R-Quest는 질문 유효성과 참신성 피드백으로 자기진화 추론 모델의 붕괴를 막는다
Questioning the Questions: Sustaining Self-Evolution in Reasoning Models
무엇인가
자기진화 추론 모델은 사람이 만든 데이터에 의존하지 않고 스스로 질문을 생성해 풀면서 학습한다. 최근 프레임워크는 질문자(questioner)와 해결자(solver) 역할을 나누고 강화학습으로 두 역할을 함께 진화시킨다. 문제는 이 자기학습을 반복하면 초기의 성능 향상이 뒤집히고 결국 성능 붕괴로 이어진다는 점이다. 이 논문은 R-Zero(Huang et al., 2025)를 대상으로 왜 라운드가 거듭될수록 성능이 떨어지는지, 그리고 어떻게 하면 자기진화를 지속할 수 있는지를 실증적으로 분석한다.
어떻게 동작하나
첫 번째 원인은 무효(invalid) 질문이다. 정의가 모호하거나 조건이 빠지고 가정이 모순된 질문이 생성되는데, 해결자는 이런 질문을 거부하도록 명시적으로 학습된 적이 없어 루프 안에 배제 장치가 없다. 저자들이 R-Zero의 라운드별 질문 풀에서 200개씩 표본 추출해 GPT-5.6-Sol로 검증한 결과, 유효 질문 비율은 1라운드 76.5%에서 5라운드 39.5%로 떨어졌다. 더 심각한 것은 정답 일관성 필터가 이 비율을 더 끌어내린다는 점으로, 필터를 통과한 질문만 보면 5라운드 유효율이 27.64%까지 내려간다. 무효 질문이 성능 저하의 원인인지 확인하기 위해 Qwen3-4B-Base로 1,273개 질문(양쪽 데이터셋에 동일한 유효 질문 766개 포함, 나머지 507개는 원본에서는 무효, 다른 쪽에서는 GPT-5.6-Sol로 수리한 버전)을 GRPO로 학습시킨 비교 실험에서, 수리 데이터셋은 7개 수학 벤치마크 평균 49.91점, 원본은 46.54점을 기록했다.
무엇과 다른가
두 번째 원인은 같은 수학 과제의 반복 생성이다. 질문자는 표현·기호·숫자만 바꾼 변형을 계속 만들어내는데, R-Zero의 BLEU 기반 어휘 유사도 클러스터링은 수학적으로 동등한 질문을 다른 클러스터로 쪼개버린다. 반복 패널티가 클러스터 크기에 비례하기 때문에 이 파편화는 자주 반복되는 과제 유형에 대한 페널티를 약화시킨다. 5라운드 필터 통과 질문 200개를 GPT-5.6-Sol로 과제 구조 기준으로 묶어보니 상위 3개 유형이 표본의 59.5%를 차지했고, 가장 큰 유형 하나가 BLEU 기준으로는 22개 클러스터로 분리됐다.
어떻게 쓰나
R-Quest는 이 두 지점에 각각 피드백을 건다. 먼저 해결자를 유효성 인식형으로 초기화한다. R-Zero 5개 라운드의 해결자 학습셋에서 중복을 제거하고 라운드별로 같은 수를 뽑아, GPT-5.6-Sol이 1단계에서 유효성을 판정하고 2단계에서 유효 질문의 참조 답을 만들게 한 뒤, GRPO로 유효 질문에는 수학 답을, 무효 질문에는 INVALID를 출력하도록 학습시킨다. 보상은 R_init = 1[a = a*(q)] − λ·1[a = INVALID ∧ a*(q) ≠ INVALID]로, 유효한 질문을 거부할 때 λ만큼 감점해 과잉 거부를 억제한다. 다음으로 참신성은 별도 외부 모델 없이 동결된 베이스 모델이 질문 쌍을 비교해 판정한다. 모든 쌍을 보는 완전 게이트는 O(B²) 비용이 들기 때문에, 후보마다 K개를 무작위로 뽑아 하나라도 같은 유형이면 탈락시키는 방식으로 O(BK)까지 줄인다. 같은 유형 비율이 p일 때 통과 확률은 근사적으로 (1−p)^K이며, K=8이면 p=10%에서 약 43%, p=30%에서 약 6%다. 질문자 보상은 유효성 게이트 g_valid(q) = 1/2 − u(q)(u(q)는 INVALID를 반환한 응답 비율)로 나뉘어, g_valid < 0이면 그 값 자체가 보상이 되고, 통과하면 g_novel(q)·min{s(q), 1−s(q)}가 된다. 해결자는 갱신된 질문자가 만든 후보에 같은 다수결 유효성 검사와 정답 일관성 필터, 다수결 의사 라벨을 적용해 GRPO로 학습하며, 매 라운드 초기화 데이터의 10%를 리플레이해 무효 질문 거부 능력을 유지한다.
전제와 한계
실험은 Qwen3-4B-Base와 OctoThinker-3B-Hybrid-Base 두 계열에서 진행됐고, 베이스라인은 베이스 모델, R-Zero, OCNR, R-Diverse다. 평가는 수학 추론 7개, 일반 도메인 추론 3개, 코드 생성 2개(HumanEval+, MBPP+, EvalPlus, pass@1) 총 12개 벤치마크이며 AMC와 AIME는 mean@32, 나머지 추론은 그리디 디코딩 정확도를 쓴다. 5라운드 기준 R-Quest는 두 백본 모두에서 7개 수학 벤치마크 평균 최고점을 냈고, Qwen3-4B-Base 대비 5.47점, OctoThinker-3B 대비 5.79점을 올렸다. R-Zero 대비로는 각각 2.54점, 2.44점 추가 이득이며, 같은 베이스 모델 기준으로 R-Zero가 얻은 이득의 1.87배와 1.73배에 해당한다. 유효성 인식 초기화만 적용했을 때는 수학 성능이 베이스 모델과 비슷한 수준이었고, 이득의 대부분은 이후 자기진화 과정에서 나왔다.
10라운드로 확장하면 차이가 더 벌어진다. R-Zero는 3라운드 49.10점을 정점으로 10라운드 34.60점까지 떨어져 베이스 모델의 46.17점 아래로 내려간다. 반면 R-Quest는 라운드별로 작은 변동은 있어도 1~10라운드 모든 체크포인트가 R-Zero의 최고점을 넘고, 10라운드에서 51.92점으로 정점을 찍어 같은 시점 R-Zero보다 17.32점 앞선다. 10라운드 후 R-Quest는 베이스보다 5.75점 위, R-Zero는 11.57점 아래다. 코드 생성은 베이스 대비 Qwen3-4B-Base에서 3.90점, OctoThinker-3B에서 5.23점 향상됐고, 일반 도메인 추론 3개 벤치마크에서도 두 백본 모두 최고 평균을 기록했다. 절제 실험에서는 유효성 또는 참신성 피드백을 빼면 세 도메인 모두 성능이 떨어졌고, 유효성 판정을 동결된 판정자로 대체한 변형도 전체 R-Quest에 못 미쳤다. 유효성 피드백을 제거하면 후반 붕괴가 나타나는 반면 참신성 피드백을 뺀 변형은 완만한 하락에 그쳐 베이스 위에 머무는데, 저자들은 유효성 피드백이 지속적 이득에 더 결정적이라고 정리한다. 자기진화가 진행되면서 해결자의 유효성 균형 정확도는 초기화 후 64.80%에서 10라운드 72.93%로, 무효 질문 재현율은 10라운드 86.36%로 올라간다(R-Zero는 전 라운드 10.23~26.14%). 질문자 유효율도 1라운드 88.0%에서 4~10라운드 94.5~97.5%로 유지되는 반면 R-Zero는 76.5%에서 49.0%로 하락한다. 유효 질문에 대한 다수결 정답 정확도는 10라운드에서 R-Quest 54.69%, R-Zero 2.06%다. 반복 억제는 상위 5개 유형 점유율로 측정되는데, R-Zero가 1라운드 17.0%에서 5라운드 69.0%로 치솟는 동안 R-Quest(K=8)는 5라운드 24.0%에 머문다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 자기학습 파이프라인의 병목이 모델 용량이 아니라 학습 데이터의 품질 관리라는 점이다. 정답 일관성 필터처럼 성능을 위해 넣은 장치가 오히려 무효 질문의 비중을 높일 수 있고, 어휘 기반 중복 제거는 수학적으로 같은 문제를 걸러내지 못한다. 자기진화 루프를 운영한다면 라운드별로 생성 질문의 유효성 비율과 과제 유형 집중도를 별도 지표로 추적하고, 해결자에게 무효 질문 거부 능력을 학습시켜 그 판단을 질문자 보상에 되먹이는 구조를 검토할 만하다. 또한 참신성 판정을 외부 모델 호출 없이 동결된 자기 베이스 모델의 쌍별 비교로 처리하는 설계는, 자기완결적(self-contained) 자기진화를 유지하려는 팀에 참고가 된다.
저자들이 밝힌 전제와 한계도 분명하다. 참신성 게이트의 비교 예산 K를 8에서 16으로 늘리면 상위 5개 유형 점유율이 더 낮아지지만(4라운드 30.0% → 16.8%) 성능은 K=8보다 계속 낮았는데, 지나치게 엄격한 다양성 통제가 반복 유형 안의 더 어려운 변형까지 억제할 수 있다는 것이다. 즉 새로운 과제 유형 탐색과 기존 유형 내 난이도 상승 사이의 균형이 필요하다. 또한 유효성·참신성 판정 모두 GPT-5.6-Sol로 주석한 데이터와 검증에 의존해 초기화 데이터셋을 구축했고, novelty 판정은 동결된 베이스 모델의 쌍별 판단에 의존한다.