자기진화 검색 에이전트의 공모 오류를 CrossFit이 줄인다

False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents

HF Daily2609.39102

Meijia Chen, Hao Li, Zheng Lu2026-09-30

무엇인가

자기진화 검색 에이전트는 사람이 만든 학습 데이터 없이 스스로 커리큘럼을 만든다. 제안자(proposer)가 소스 문서를 질문과 의사 라벨로 바꾸고, 풀이자(solver)가 그 질문을 풀며, 새 제안에 대한 풀이자의 성능이 제안자의 보상이 되는 루프다. 문제는 이 루프가 합의를 정답의 대리 지표로 만든다는 점이다. 논문은 제안자와 풀이자가 같은 오류에 점점 합의하면서 내부 보상은 오르지만 외부 정확도는 따라오지 않는 실패 모드를 공모 오류(co-cheating)라고 부르고, 같은 오답에 합의한 평가 쌍의 비율을 거짓 합의 질량(false-agreement mass)으로 측정한다.

어떻게 동작하나

진단은 학습 루프를 건드리지 않는 사후 감사로 이뤄진다. 매 스케줄 스텝마다 소스 문서, 채택된 의사 라벨, 제안자 보상에 쓰인 풀이자 응답 5개를 저장하고, gpt-6-astra/high가 소스에서 근거 기반 참조를 구성해 이 출력들을 판정한다. 감사자는 태스크 채택, 모델 업데이트, 보상에 전혀 관여하지 않는다. 지표는 채택 라벨 정확도 T_P, 풀이자 응답 정확도 T_S, 루프가 관찰한 라벨-응답 일치율 A, 같은 오답에 일치한 쌍 F, 잘못된 라벨 때문에 점수를 못 받은 정답 응답 L이다. Dr. Zero 루프에서 1라운드 거짓 합의 질량은 Qwen3.5-4B 0.004, 9B 0.003에 불과했지만 3라운드에는 0.061과 0.088로 커졌고 L은 줄었다. A와 F가 함께 오르는 것은 불일치가 공유된 실수로 대체되고 있다는 신호다.

무엇과 다른가

가장 직접적인 완화책은 학습 전에 제안을 검증하는 다중 샘플 검증(MSV)이다. 소스 문서 x와 질문 q에 대해 자기진화에 쓰는 것과 같은 모델 M으로 소스를 본 답 3개와 소스 없이 답한 3개를 뽑는다. 각 묶음에서 2개 이상이 일치하면 다수결 라벨을 만들고, 두 다수결이 모두 존재하며 서로 일치할 때만 태스크를 채택한다. 채택되면 다수결 라벨이 초안 라벨을 대체하고, 아니면 거부한다. 거짓 합의를 6.1%에서 5.7%(4B), 8.8%에서 7.2%(9B)로 낮추지만 상당한 잔여 공모 오류를 남기며, 후보 하나마다 라벨러 생성 6회가 추가된다. 같은 모델의 6개 샘플은 오류를 공유할 수 있고, 나중에 피드백을 주는 풀이자가 평가 대상 소스에서 나온 라벨을 재사용하는 경로도 막지 못한다.

어떻게 쓰나

논문의 주 방법인 CrossFit은 제안자의 소스 문서를 소스 단위로 폴드 0과 폴드 1에 한 번씩 배정한다. 같은 문서에서 나온 질문은 자기진화 내내 같은 폴드에 남는다. 두 개의 보조 피드백 풀이자를 유지하는데, 하나는 폴드 0에서 채택된 질문만, 다른 하나는 폴드 1에서 채택된 질문만 학습한다. 다음 라운드에서 역할을 교차해 폴드 0의 질문은 폴드 1로 학습한 풀이자가, 폴드 1의 질문은 폴드 0으로 학습한 풀이자가 평가한다. 제안자 보상은 원래 규칙 그대로 R_P(q) = f(Σ_{j=1..5} 1[z_j ≃ ỹ]), z_j ~ S_{r,1-h}(·|q)이고, f(k)=(5-k)/4 (0<k<5, 그 외 0)인 Dr. Zero의 프런티어 보상이다. 즉 학습 목적은 그대로 두고 보상을 공급하는 풀이자만 바꾼다. 메인 풀이자는 분할되지 않고 두 폴드의 채택 질문을 모두 학습한다. 분할을 질문 단위가 아니라 소스 단위로 하는 이유는, 같은 문서에서 나온 관련 예제가 양쪽 폴드에 들어가 재사용 경로를 그대로 남기는 것을 막기 위해서다.

전제와 한계

실험은 Qwen3.5-4B와 9B에서 라운드당 제안자 18스텝, 풀이자 25스텝의 3라운드 일정으로 돌렸고 사람이 주석한 QA 학습 데이터는 쓰지 않았다. 평가는 NQ, TriviaQA, PopQA, HotpotQA, 2WikiMultiHopQA, MuSiQue에서 각 200문항, Bamboogle 125문항을 합친 고정 1,325문항 세트에서 Cover-EM으로 이뤄진다. 표준 결합 자기진화는 평균 Cover-EM을 4B에서 0.384에서 0.400으로, 9B에서 0.409에서 0.428로 올렸다. CrossFit은 0.488과 0.512를 기록해 Dr. Zero보다 8.8점과 8.4점, Search-R1보다 8.7점과 7.8점 높다. MSV 단독은 Dr. Zero보다 0.7~0.8점 오르는 데 그쳤고, MSV와 CrossFit을 함께 쓰면 0.491과 0.515로 CrossFit 단독보다 0.3점 높아지는 데 머물렀다. 멀티홉 과제 이득이 평균 10.0점과 10.9점으로 싱글홉의 7.3점과 5.2점보다 컸다. 최종 라운드에서 CrossFit은 채택 라벨 정확도를 4B에서 0.747에서 0.819로, 9B에서 0.737에서 0.851로 올리고 거짓 합의 질량을 0.061에서 0.030, 0.088에서 0.037로 낮췄다.

절제 실험은 개선의 원인이 평가자 복제나 임의 분할이 아니라 소스 계보 배제임을 보인다. 같은 소스로 학습한 보조 풀이자는 거짓 합의 질량 0.064와 0.087, 전체 데이터로 학습한 보조 풀이자는 0.058과 0.069로 결합 피드백 대조군과 비슷했다. 질문을 무작위로 나누면 0.050과 0.062에 그쳤지만 소스 ID로 나누면 0.004와 0.001로 떨어졌다. 저장된 3,000개 질문과 채택 라벨을 그대로 재생하는 고정 뱅크 실험에서도 소스 ID 피드백은 결합 시 0.058/0.073이던 거짓 합의를 0.004/0.001로 줄였고, 절반 예산 대조군도 0.005/0.002와 재생 정확도 91.6%/91.8%로 전체 결과와 맞먹었다. CrossFit의 다운스트림 이득은 2라운드 후 4.2점과 4.3점에서 3라운드 후 8.8점과 8.4점으로 커져, 단순 재순위가 아니라 루프가 학습하는 내용 자체를 바꾼다는 것을 보여준다.

자기진화나 셀프플레이 루프를 직접 돌리는 팀이라면 내부 보상과 합의율을 정확도와 분리해 추적해야 한다. 합의율이 오르는데 채택 라벨 정확도가 정체되거나 떨어지면 공모 오류를 의심할 신호다. 처방으로 CrossFit은 추가 생성 없이 소스 단위 분할과 보조 풀이자 두 개만 요구하므로 MSV보다 비용이 낮다. MSV는 후보마다 라벨러 생성 6회가 붙는다는 점을 예산에 넣어야 한다. 또한 평가자가 어떤 감독 데이터로 학습됐는지, 즉 피드백의 계보를 기록해 두는 것이 재현과 디버깅에 필요하다.

저자들은 공유된 사전학습 오류, 겹치는 근거, 보조 풀이자 비용을 열린 한계로 남긴다. CrossFit은 통계적 교차 적합의 배제 원리를 빌려왔지만 점근적 보장은 가져오지 않았고, 적응형 커리큘럼에는 직교 점수나 독립 표본 구조가 입증되지 않았다. 라벨러가 같은 모델과 근거를 공유하면 다수결 안정성이 정답을 뜻하지도 않는다. 거짓 합의는 이 경로를 드러내는 진단 지표이지 착취의 인과적 증명은 아니라고 밝힌다. 연결된 소스로 배제를 확장하는 것과 종단 간 효율을 측정하는 것이 다음 시험 과제다.