시스템 프롬프트의 숨은 날짜가 LLM 평가를 매일 흔든다
Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation
무엇인가
이 논문은 LLM 평가의 재현성을 깨뜨리는 새 요인으로 시스템 프롬프트에 사용자 모르게 삽입되는 현재 날짜를 지목한다. 기존 연구가 배치 크기, 수치 정밀도, 하드웨어, 프롬프트 형식 같은 비결정성을 다뤘다면, 저자들은 날짜가 매일 바뀌는 숨은 메타데이터라서 같은 설정으로도 평가 점수와 모델 순위가 달라질 수 있다고 본다. 질문 자체가 시간에 의존하지 않는 데이터셋만 골라 이 효과를 분리했다.
어떻게 동작하나
실험은 모든 모델에 동일한 프롬프트를 쓰고 시스템 프롬프트의 날짜만 2024년 1월 1일부터 12월 31일까지 바꾸는 방식이다. 나머지 설정은 고정하고 결정적으로 맞췄다. 모델은 Llama 3.1 Instruct 8B·70B, Gemma 3 Instruct 4B·27B, Qwen3 4B, Qwen3-Next 80B, Phi-4 14B, GPT-OSS 20B·120B 등 9개다. 데이터셋은 MCQA용 MMLU·GPQA·ARC-Challenge, 수학 추론 GSM8K, 코드 생성 HumanEval, 기계번역 WMT 영어-독일어·핀란드어·체코어다. 지표는 MCQA 정확도와 ECE, GSM8K 정확도, HumanEval pass@1, 번역 BLEU와 chrF를 쓴다.
무엇과 다른가
결과는 날짜만 바뀌어도 성능이 흔들린다는 것이다. MCQA에서는 최대 6% 정확도 차이가 났고 모델 순위가 재배열됐다. 언어 생성 과제에서 효과가 더 커서 GSM8K는 평균 7.75%, 최대 14% 수준의 차이를 보였고 HumanEval pass@1은 평균 4.81%, 최대 7.32% 달라졌다. 기계번역은 평균 최대 1.88 BLEU, 1.33 chrF 차이가 났으며 초록 기준 최대 2.84 BLEU다. 실행 기반으로 채점되는 코드와 전체 출력을 보는 번역에서도 효과가 남았다. 별도로 GPT-5.1을 2025년 12월 3일부터 9일까지 평가했을 때도 GPQA에서 최대 4% 변동이 나타났다.
어떻게 쓰나
분석에 따르면 특정 날짜가 일관되게 좋거나 나쁘지 않다. 날짜와 정확도의 Spearman 상관은 중앙값 0.02였고, 데이터셋 간·모델 간 상관도 0 근처였으며 같은 방향으로 움직인 비율은 51%로 우연 수준이었다. 그래서 평가용으로 고정할 만한 좋은 날짜는 없다. CoT는 날짜 민감도를 줄이지 못하고 오히려 키웠으며, 5-shot 프롬프트도 평균 2.27% 차이로 제로샷 2.52%와 비슷하게 남았다. 배치 크기 1~128, BF16·FP16·FP32, A100·A40·RTX4090, 선택지 순서 5개 무작위 순열과 비교했을 때 날짜 효과는 배치·정밀도·하드웨어보다 일관되게 컸고 선택지 순서와 비슷한 규모였다. 시스템 프롬프트 문구를 6개 버전으로 바꾼 실험도 날짜 효과와 같은 정확도 변동계수 0.78%를 보였다.
전제와 한계
개발자에게 이 결과는 벤치마크와 리더보드 비교가 날짜에 따라 재현되지 않을 수 있음을 뜻한다. 특히 API가 서버 쪽에서 시스템 프롬프트에 날짜를 넣는 경우 사용자는 이를 보지 못한 채 평가를 돌리게 된다. 저자들은 가능하면 채팅 템플릿에서 날짜를 제거하되 나머지 템플릿은 그대로 두고, 제거할 수 없으면 날짜를 고정해 결과와 함께 보고하라고 권한다. 추론·코드·번역처럼 긴 출력을 생성하는 평가일수록, 그리고 CoT를 쓰는 평가일수록 날짜 영향을 확인해야 한다.
한계도 분명하다. 실험은 선택된 모델과 데이터셋에 한정되며, 독점 모델 검증은 GPT-5.1을 일주일 동안만 평가한 결과다. 네 가지 대표 과제만 다뤘고, 모델·데이터셋별로 1년 전체 날짜를 덮으려면 365회 실행이 필요해 대화나 요약 같은 개방형 과제는 남겨졌다. 날짜 형식과 위치를 고정했고 2024년 안에서만 바꿨으므로 다른 형식·위치·연도에 대한 민감도는 아직 탐구되지 않았다.