LLM 평가 순위표는 재현성 자체 감사에서 대부분 무너진다

How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt Structure

HF Daily2609.30074

Dipankar Sarkar2026-09-24조회 3

무엇인가

LLM 시스템 평가는 소수의 프롬프트에 여러 번 호출한 결과를 평균 내고 모델들을 순위표로 정렬해 보고하는 관행이 자리 잡았다. 이 논문은 그 순위표가 얼마나 신뢰할 만한지를 프롬프트 구조 추론이라는 구체적 사례에 대해 스스로 감사한 결과다. 프롬프트를 프로그램처럼 다루는 도구들, 즉 컴파일 대상 질의나 최적화 파이프라인, 테스트 충분성을 정의하는 작업은 모두 프롬프트에서 구조를 복원한다는 전제를 공유한다. 자연스러운 방법은 언어모델에게 물어보는 것이고, 자연스러운 걱정은 같은 질문에 같은 답을 두 번 하지 않을 수 있다는 것이다. 저자는 이 걱정을 측정 대상으로 삼고, 나아가 자신이 만든 순위표 자체를 같은 잣대로 다시 감사한다.

어떻게 동작하나

추론 과제는 모델이 프롬프트를 읽고 직렬화 가능한 중간 표현(IR)을 내놓는 것이다. IR은 타입이 있는 노드(Rule, Condition, Breakpoint, Directive) 목록이고 각 노드는 문자열 id, 카테고리, 선택적 우선순위, 소스 범위를 갖는다. 지시문은 명시적 // @rule 주석이 있으면 inferred=false로 그대로 옮기고, 없는 규칙은 추론해 inferred=true로 표시하라고 요구하므로 전사와 복원 두 성분이 섞여 있다. 측정은 캐싱을 끈 상태에서 같은 프롬프트와 같은 지시문을 R회(2~5회, 캠페인별 rate-limit 여유에 따라) 반복 호출하고, 노드 id 집합의 쌍별 Jaccard 평균과 전 회차 교집합/합집합인 ID-stability를 계산한다. 둘 다 1이면 node-set-perfect라고 부르는데, 이는 id 집합이 일치했다는 뜻일 뿐 IR이 동일하다는 뜻이 아니라고 저자는 못 박는다. 불일치는 id-label 드리프트, count 드리프트, metadata 드리프트로 분해한다. 통계는 10,000회 프롬프트 재표집 부트스트랩, 짝지은 Wilcoxon 부호순위 검정, 그리고 프롬프트 다중집합을 한 번 뽑아 모든 모델을 같은 표본으로 채점하는 joint cluster bootstrap을 쓴다.

무엇과 다른가

모델은 5개 계열, 8B~675B 파라미터의 8개 변형이 최소 3개 프롬프트에서 R회 중 2회 이상 완료한다는 포함 기준을 통과했다. 주석이 달린 합성 코퍼스 83개 중 실제로는 22개 파일을 측정했고 20개에 대해 원시 IR을 저장했다. 결과는 평균 Jaccard 0.39~0.96, ID-stability 0.22~0.96이고, 127개 프롬프트-모델 셀 중 35개(28%)만 node-set-perfect, 즉 72%는 한 번도 완벽하지 않았다. gpt-oss:120b의 0.39는 95% 구간 [0.25, 0.54], minimax-m2.7의 0.70은 n=6에서 [0.47, 0.89]로 구간이 좁지 않다. 완벽 재현은 프롬프트보다 모델 선택의 함수에 가까워서 gemma3:12b는 자기 프롬프트의 68%에서 완벽했고 qwen3-coder-next는 20개 중 한 번도 완벽하지 않았다. 계열 내 스케일링 주장은 지지되지 않는다. gpt-oss:120b는 공통 18개 프롬프트에서 0.386으로 gpt-oss:20b의 0.766보다 0.380 낮았고(Wilcoxon p=0.0046 또는 0.0036, rank-biserial -0.80), Mistral은 +0.061로 유의하지 않았으며(p=0.37), MiniMax는 공통 프롬프트가 2개뿐이라 정보가 없다. 주석 없는 실제 SKILL.md 19개에 11개 모델을 3회씩 돌린 복원 캠페인에서는 627개 중 557개가 저장됐고, 2회 이상 완료한 196개 셀의 평균 Jaccard가 0.22로 떨어졌으며 30개 셀(15%)은 정확히 0이었다. 드리프트는 98개 셀에서 count 49%, metadata 31%, id-label 19% 순으로, 모델들은 안정된 골격의 이름을 바꾸는 게 아니라 노드 개수 자체를 두고 어긋난다.

어떻게 쓰나

논문의 핵심 기여는 순위표 자체에 대한 감사다. 10,000회 joint cluster bootstrap 중 9,583회가 사용 가능했고, 하위권만 견고했다. gpt-oss:120b는 99%에서 최하위를 지켰고 qwen3-coder-next는 86%에서 7위를 지켰지만, 중간 4개는 27~48%로 동전 던지기에 가까웠고 상위 2개도 각각 68%에 그쳤다. 즉 이 표는 가장 나쁜 모델은 안정적으로 지목하지만 가장 좋은 모델은 안정적으로 지목하지 못한다. 분석 규칙도 결론을 흔든다. 여러 캠페인에 걸쳐 중복 측정된 프롬프트-모델 쌍을 더 높은 예산의 캠페인 우선으로 병합하는 규칙과, 가장 이른 측정을 우선하고 나중 것으로 보충하는 규칙은 둘 다 방어 가능하지만 8개 행 중 4개를 바꾸고 전체 헤드라인을 7.1%포인트 움직인다. node-set-perfect 셀 수는 35/127(27.6%)에서 26/127(20.5%)로 달라진다. 재현성은 정확성도 아니다. 합성 프롬프트의 주석에 대해 결정적 파서로 정답을 만들면 주석 노드 id의 평균 재현율은 0.86, 모델이 스스로 explicit로 표시한 노드에 한정한 정밀도는 0.82로, 모델이 복사했다고 주장한 노드 다섯 중 하나가 파일의 어떤 주석과도 대응하지 않는다. 안정성과 정확성의 상관은 지표 선택에 따라 r=0.69~0.90으로 달라지고, 저 이상치 하나를 빼면 네 지표 모두 유의성을 잃는다.

전제와 한계

측정은 2026년 5월 30일~6월 11일에 이뤄졌고 8월 17일 재조회에서 8개 변형 중 4개가 2026년 7월 15일자로 서비스 종료됐다. 원래 이름을 올린 15개 중 10개가 두 차례 물결(6월 16일, 7월 15일)에 걸쳐 사라졌다. 논문이 명시한 대로 이 연구는 이제 재실행이 불가능하고, 순위표의 절반은 아무도 재검토할 수 없는 대상 위에 서 있다. 저자는 앞선 버전에서 DeepSeek과 Zhipu를 구조적으로 접근 불가라고 주장했지만 이를 철회한다. 유력한 원인은 모델이 아니라 자체 클라이언트의 기본 분석 타임아웃 60,000ms 상수이며, 이 값은 플래그로도 바꿀 수 없고 그보다 느린 응답은 연결 실패로 기록된다. 11개 모델을 한 프롬프트에 두 번, 타이트한 출력 예산과 넉넉한 예산으로 탐침한 결과 타이트 조건에서 8개가 실패했고 그중 7개는 60초 안에 끝났다. 원인은 미해결이고 저자는 도구 쪽을 주된 용의자로 지목한다.

실무적으로 이 논문이 주는 지침은 절차적이다. 순위표를 인용할 때는 부트스트랩 재표집에서 각 행이 자기 순위를 지킨 비율인 순위 안정성을 함께 보고하고, 셀 단위 출처를 공개하고, 민감도 비교는 주장하지 말고 실제로 실행하고, 병합 규칙과 모든 허용 오차의 단위를 명시하고, 원시 실행 출력을 보존하고, 측정 날짜를 리더보드에 붙이라고 권한다. 특히 호스팅 엔드포인트를 대상으로 한 평가라면 요약 CSV가 아니라 실행별 원시 출력을 1차 산출물로 취급하라고 말한다. 이 논문이 성립하는 이유도 293개 원시 IR을 저장해 뒀기 때문이며, 요약 CSV만 남겼다면 드리프트·수렴·정확도 분석의 절반이 반증 불가능해졌을 것이라고 밝힌다. 또한 n=3, n=6인 행이 섞인 표는 모든 쌍 비교를 유도하지만 28개 암묵 비교에 대한 다중성 보정을 하지 않았고, 이런 표는 명백히 재현 가능, 명백히 아님, 미결의 세 덩어리로 읽는 편이 낫다고 말한다.

저자가 밝힌 한계는 분명하다. 모든 측정이 단일 상용 엔드포인트, 단일 기간, 단일 도구에서 나왔으므로 서빙된 대로의 모델을 기술하며, 어떤 가중치가 응답했는지 검증할 수 없다. 합성 코퍼스에서는 노드의 64~100%(대부분 모델 77~92%)가 모델이 그대로 옮기라고 지시받은 명시적 주석이어서 표는 주로 전사 재현성을 측정한 것이고, 복원 캠페인과 겹치는 모델은 4개뿐이라 두 체제 간 순위 이전은 주장할 수 없다. 수렴 분석은 소비자가 쓸 도구가 아니라 IR 노드 개수라는 대리 신호를 측정했고, 판정 기준은 종점에서 구성상 항상 통과하며(98개 중 48개가 우측 절단), 허용 오차는 문서상 상대값이지만 코드에서는 절대 0.05 노드로 구현되어 98개 중 50개 대 80개라는 다른 결과를 낳는다. Jaccard와 ID-stability는 노드 id 집합만 보므로 Jaccard가 1인 셀에서도 메타데이터 불일치가 발견되며, R이 2~5로, 완료율이 3/20~20/20으로 달라 행 간 비교가 엄밀히 같은 척도가 아니다. 프롬프트 구조 추론은 특수한 과제이고 표준 LLM 벤치마크나 RAG·에이전트·코드 생성 평가는 포함하지 않았으므로, 일반 권고는 이 사례에서 동기부여된 절차적 안전장치이지 LLM 평가 전반의 실패율 추정치가 아니다.