정답 없이 신뢰도만 학습시켜 추론 토큰을 줄이는 ConfSFT

Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency

arXiv2609.31619v1

Parsa Hosseini2026-09-25조회 7

무엇인가

추론 언어 모델은 어려운 문제에서 답을 내기 전에 수만 토큰에 달하는 사고 과정을 생성해 추론 비용을 크게 끌어올린다. 기존 접근은 크게 두 갈래였다. 추론 시점에 신뢰도·불확실성·답 안정성 같은 신호를 모니터링해 조기 종료하는 방법, 그리고 학습 시점에 길이 페널티를 준 강화학습이나 짧은 궤적만 골라 파인튜닝하는 방법이다. 두 경우 모두 효율을 학습 또는 추론 절차의 명시적 목표로 삼는다. 이 논문은 다른 질문을 던진다. 짧게 추론하도록 직접 가르치지 않고도 효율이 창발할 수 있는가.

어떻게 동작하나

제안 방법 ConfSFT는 신뢰도(confidence)를 유일한 지도 신호로 쓰는 자기지도 파인튜닝 절차다. 먼저 현재 정책으로 문제에 대한 추론 궤적을 생성하고, 궤적 안에서 텍스트 마커(기본값은 Wait)가 나타나는 지점을 중간 의사결정 지점으로 삼는다. 각 지점에서 지금까지의 추론 접두사 뒤에 고정된 답 유도 프롬프트를 붙이고 시험 답을 그리디 생성한 뒤, 그 답에 부여된 토큰 확률들의 기하평균, 즉 길이 정규화 우도를 신뢰도로 정의한다. 이 값은 모델 자신의 분포만으로 계산되며 정답이나 외부 판정자가 필요 없다. 신뢰도는 2% 간격 50단계 격자로 양자화해 텍스트 백분율로 만들고, 문제 프롬프트와 추론 접두사, 고정 프라이밍 문구 뒤에 이 라벨을 이어 붙인 학습 예제를 만든다. 손실은 라벨 토큰 위치에만 걸리는 표준 다음 토큰 교차엔트로피이며, 문제·추론 접두사·프라이밍 문구는 모두 마스킹된다. 즉 모델은 중간 추론 상태가 주어졌을 때 신뢰도를 예측하도록만 학습되고, 추론 길이·정지·효율에 대한 항은 목적함수에 전혀 없다. 궤적과 라벨이 모두 정책 생성물이므로 라운드마다 새 문제 부분집합에서 다시 샘플링해 반복 학습한다. 추론 시에는 베이스 모델과 동일한 디코딩을 쓰며 신뢰도 유도, 프라이밍 문구, 검증기, 조기 종료 장치를 일절 쓰지 않는다.

무엇과 다른가

실험은 Gemma-4-E2B, Qwen3-4B, Nemotron-Nano-8B, GPT-OSS-20B 네 모델군에서 수행했고, 학습 데이터는 AIME2000–2023 문제 600개 규모다. AIME2024는 검증용으로 남겨두고 테스트 벤치마크는 학습·모델 선택에 쓰지 않았다. 평가는 AIME2025, GSM8K, GPQA-Diamond, HumanEval, LiveCodeBench에서 문제당 16개 샘플로 정확도와 평균 생성 토큰을 측정했다. 결과적으로 정확도를 유지한 채 생성 토큰이 Nemotron 11.1%, Gemma 10.3%, Qwen 19.2%, GPT-OSS 11.1% 줄었다. 수학 문제로만 학습했는데도 과학 추론과 코딩 벤치마크로 효율 이득이 전이됐다. 명시적으로 짧은 추론을 최적화하는 학습 기법과 비교해도 대등하거나 더 컸다. 예를 들어 Qwen에서 On-Policy SFT는 평균 정확도 69.3에서 토큰을 17.2% 줄인 반면, ConfSFT는 69.5 정확도에서 19.2%를 줄였다. 추론 시점 조기 종료 기법인 DEER는 더 큰 토큰 감소를 낼 수 있지만 과제별 편차가 크고 정확도 손실이 컸다. Nemotron 기준으로 LiveCodeBench 정확도가 44.2%에서 17.4%로, HumanEval이 89.7%에서 47.1%로 떨어졌다.

어떻게 쓰나

학습 역학도 분석했다. 검증 추론 상태에서 예측 신뢰도와 양자화된 자기지도 목표 사이의 평균 절대오차(C-MAE)를 재면 학습이 진행될수록 C-MAE가 뚜렷이 감소하고 평균 생성 토큰도 함께 줄어드는 반면 정확도는 거의 변하지 않았다. 학습 전에는 모델이 소수의 신뢰도 수준에 예측을 몰아넣었지만 학습 후에는 훨씬 넓은 범위로 퍼져, 더 세분화된 신뢰도 판단을 하게 됐다. 또한 Schoenfeld Episode Theory에 기반한 ThinkARM의 8개 범주(Read, Analyze, Plan, Implement, Explore, Verify, Monitor, Answer)로 추론을 문장 단위 주석해 에피소드별 토큰 비중 변화를 총변동거리로 측정했다. L1-Max, ThinkPrune, A&Z, On-Policy SFT 같은 명시적 효율 학습 기법들은 Implement·Explore·Verify 같은 범주에서 큰 재분배를 일으킨 반면, ConfSFT는 에피소드 구성 변화가 상대적으로 작아 베이스 정책의 고수준 추론 구성을 대체로 보존했다. 특정 추론 행동을 선택적으로 억제해서 효율을 얻는 것이 아니라는 뜻이다.

전제와 한계

통제 실험은 감독 신호 자체가 중요함을 보여준다. 학습 절차는 그대로 두고 목표만 바꿨을 때, 추론 궤적 내 토큰 위치에서 유도한 Position 목표와 정답 여부에 따른 이진 정답성 목표는 두 모델에서 더 약하고 일관성 없는 개선을 냈다. 원래 신뢰도 라벨을 학습 예제 간에 무작위로 뒤섞은 Shuffled confidence는 라벨 분포는 유지하면서 상태와 신뢰도의 대응만 깨뜨린 조건인데, 효율 이득이 대부분 사라지거나 오히려 뒤집혔다. 의사결정 지점 선택도 검증했다. 기본 마커인 Wait는 Gemma-4-E2B에서 궤적당 평균 4회 정도만 나타나지만 다른 모델군은 20회 이상이며, Gemma는 그럼에도 상당한 효율 이득을 보였다. 문단 경계(\n\n)를 마커로 쓴 변형도 Gemma에서 정확도를 유지하며 토큰을 8.4% 줄였다(Wait 사용 시 10.3%). 다만 이 변형은 라운드당 문제 수를 4개, 학습률을 1e-6으로 달리 설정했기 때문에 두 결과를 마커 자체의 통제된 비교로 보면 안 된다고 저자들은 밝힌다.

개발자 관점에서 이 방법의 실질적 매력은 배포 파이프라인을 바꾸지 않는다는 점이다. 추론 시 조기 종료 규칙, 신뢰도 유도 프롬프트, 별도 검증기, 프록시 모델이 필요 없고 디코딩 절차도 그대로다. 학습 비용도 작다. AIME 문제 600개 규모의 작은 집합과 모델 자체 토큰 확률만으로 라벨을 만들기 때문에 정답 라벨링이나 외부 판정 모델 비용이 들지 않는다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, 학습 데이터가 수학 문제에 국한됐으므로 자신의 도메인(예: 사내 코드베이스, 특정 언어 추론)에서도 전이되는지 자체 검증해야 한다. 둘째, 정확도가 통계적으로 유의하게 변하지 않았다는 저자들의 주장은 모델별 신뢰구간 분석에 근거하므로, 자체 평가에서는 문제당 샘플 수를 충분히 늘려 정확도 손실 여부를 직접 확인해야 한다. 셋째, 중간 지점을 뽑는 마커는 모델이 실제로 자주 내뱉는 구조적 표시(Wait, 문단 경계 등)면 충분하지만, 마커를 바꾸면 라운드당 문제 수와 학습률 같은 하이퍼파라미터를 다시 조정해야 한다.

저자들이 명시한 전제와 한계도 분명하다. 신뢰도 점수는 보정된 정답 확률이 아니다. 신뢰도 0.8이 답이 80% 확률로 맞는다는 뜻이 아니며, 저자들은 이를 중간 추론 상태와 추가 추론의 가치에 대한 유의미한 신호로만 해석한다. 학습은 AIME2000–2023 문제에만 이뤄졌고, 검증은 AIME2024, 평가는 별도 벤치마크로 분리했지만 학습 데이터 규모 자체는 600문제 수준으로 작다. 또한 문단 경계 마커 실험은 학습 설정이 달라 마커 간 통제 비교가 아니라고 스스로 못박는다. 효율 이득이 정확도를 희생하지 않았다는 결론 역시 특정 벤치마크와 샘플링 프로토콜 위에서 얻은 것이므로, 더 넓은 과제군에서 재현되는지는 열린 문제로 남는다.