추론 토큰을 줄여도 CoT 모니터링 능력은 대체로 살아남는다

Efficient Reasoning Training Does Not Always Harm CoT Faithfulness and Monitorability

HF Daily2610.03509

Samuel Lewis-Lim, Xingwei Tan, Mario Sanger2026-10-02조회 3

무엇인가

CoT(사고 사슬) 추론은 모델이 답에 도달한 경로를 사람이 들여다보고 행동을 감시할 수 있게 해주지만, 추론 토큰이 길어 지연과 추론 비용을 크게 높인다. 그래서 더 적은 토큰으로 문제를 풀도록 학습시키는 효율적 추론 기법이 늘고 있는데, 이런 학습이 중요한 추론 단계를 생략시켜 CoT가 더 이상 모델의 실제 결정을 반영하지 못하게 될 수 있다는 우려가 따라붙는다. 다만 효율 기법마다 CoT에 가하는 길이 압력의 방식이 다르고, 충실한 설명에 필요한 토큰 수도 과제마다 다르기 때문에 실제로 언제 이런 일이 벌어지는지는 불명확했다. 이 논문은 그 조건을 분리해서 측정한다.

어떻게 동작하나

저자들은 길이 압력을 서로 다르게 가하는 세 가지 RL 기법을 비교한다. ThinkPrune은 학습 롤아웃 자체에 고정 최대 완성 길이 L을 걸어 L을 넘긴 응답만 잘라내고, 보상은 잘린 응답에 대한 이진 정답 여부만 준다. 즉 이미 짧은 응답에는 추가 압력이 가지 않는다. L1(LCPO)은 프롬프트에 명시되는 예시별 목표 길이를 U(b_min, b_max)에서 균등 샘플링해 "이만큼 토큰으로 생각하라"고 붙이고, 정답 보상에서 목표와 실제 길이 차이의 절댓값에 α를 곱한 만큼 벌점을 뺀다. GLP(그룹 상대 길이 벌점)는 같은 문제에 대해 샘플링한 k개 응답 중 최단·최장 길이로 정규화한 상대 위치 λ를 써서, 정답 응답은 그룹 내에서 짧을수록 보상하고 길면 벌점을 주되 오답은 짧아도 보상하지 않는다. 모델은 Qwen3-4B-Thinking, Qwen3-8B, Olmo3-7B-Think 세 개이며, AIME·AMC 경시 수학 2,223문제로 LoRA 어댑터만 학습하고 AIME22로 체크포인트를 고른다.

무엇과 다른가

측정은 두 축이다. 충실성은 NSG(정규화 시뮬레이션 이득)로 잰다. 예측 모델에게 원래 질문과 참조 모델의 답을 보여준 뒤, 반사실 질문에 참조 모델이 어떻게 답할지 CoT 없이 먼저, 그다음 CoT와 함께 예측하게 하고, CoT가 만들어낸 정확도 향상을 이론적 최대 향상으로 나눈 값이다. 데이터셋은 Employee Attrition, Bank Marketing, Breast Cancer Recurrence, Heart Disease, Annual Income, Moral Machines, Pima Diabetes 일곱 개이고, 예측 모델은 Qwen3-32B·GPT-OSS-20B·Gemma3-27B 앙상블을 쓴다. 감시 가능성은 g-mean2로 잰다. 입력에 개입(사용자의 선호, 의학 문제에 삽입된 인지 편향 단서)을 가했을 때 모델 답이 바뀌는지를 보고, CoT만 읽은 외부 모니터(DeepseekV4-Flash-0731)가 그 영향이 답을 바꿨다는 사실을 알아채는지 평가한다. 데이터는 FACE-Eval(아첨)과 MedQA 150문항(동료 합의·기저율 단서)이다.

어떻게 쓰나

충실성은 대부분의 설정에서 떨어진다. 15개 효율 설정 중 11개에서 NSG가 유의하게 낮아졌다. Olmo3-7B에 L1을 적용하면 CoT가 약 70% 짧아지고 NSG가 38.4%에서 약 21%로 반토막 난다. Qwen3-4B에 GLP를 적용하면 75% 짧아지며 NSG가 32.7%에서 23.0%로 내려간다. 그러나 항상 그런 것은 아니다. ThinkPrune은 Qwen3-8B에서 42%, Olmo3-7B에서 29%를 줄이면서도 NSG를 떨어뜨리지 않았고, Qwen3-8B의 GLP는 65%를 줄이면서 NSG를 29.8%에서 33.1%로 오히려 올렸다. 관찰자가 결정을 예측하는 데 필요한 정보가 베이스 모델 평균보다 적은 토큰으로 표현될 수 있다는 뜻이다.

전제와 한계

충실성 손실의 주된 원인은 CoT에서 정보가 빠지는 것이 아니라 모델 출력이 덜 일관해지는 것이다. 질문마다 10번씩 샘플링해 최빈 답을 맞히는 오라클 예측기의 상한을 재보면 대부분의 설정에서 이 상한이 내려가고, Olmo3-7B에서는 최대 26 NSG 포인트 떨어져 47.1%가 된다. 일관성 변화와 NSG 변화의 상관은 ρ=0.87인 반면 CoT 길이 변화와의 상관은 ρ=0.46에 그친다. Pima Diabetes가 가장 심하게 무너진다. 베이스 Olmo3-7B는 일관성 99.4%, NSG 76.7%였는데 L1-Medium에서는 일관성 83.5%, NSG 11.8%로 떨어지고, CoT는 여전히 전당뇨 수치를 주된 위험 요인으로 제시하지만 답이 그 요인을 더는 안정적으로 따르지 않는다. 반대로 Bank Marketing에서는 Qwen3-4B의 L1이 일관성 74.7%→83~85%로 오르며 NSG가 약 20포인트 상승하고, Breast Cancer Recurrence에서는 Qwen3-8B가 일관성 84.2%→90~95%로 오르며 NSG가 10~19포인트 상승한다. 과제별 편차가 크다.

감시 가능성은 훨씬 견고하다. 아첨 탐지에서는 CoT가 최대 70% 짧아져도 어떤 효율 학습 모델도 베이스보다 0.08 넘게 떨어지지 않았고, 짧은 CoT도 사용자 성향을 요약하며 답을 연결한다. 인지 편향은 대부분 0.1 이하의 손실에 그쳤지만 가장 작은 길이 예산인 L1-Low만 세 모델 모두 0.2 넘게 하락했고, Qwen3-4B L1-Low에서 g-mean2가 0.87에서 0.62로 떨어진다. 중요한 것은 이 하락이 절대 CoT 길이가 아니라 베이스 모델 대비 압축률로 예측된다는 점이다(ρ=0.68). Olmo3-7B의 L1-Low는 Qwen3-8B의 ThinkPrune보다 CoT가 긴데도 0.49 대 0.83으로 훨씬 낮다. 실패 양상도 두 갈래다. Qwen3-8B L1-Low에서는 모니터가 단서를 무시했다고 판단하는 비율이 베이스 6%에서 40%로 뛰고, Qwen3-4B에서는 단서를 유지하되 답의 원인이 아니라 자기 결론을 확인해주는 근거로 제시하는 비율이 11%에서 37%로 오른다.

개발자 입장에서 결론은 CoT를 무엇에 쓰는지에 달려 있다. 외부 편향 요인이 답을 바꿨는지 잡아내는 감시 용도라면 효율 학습은 대체로 안전하다. 아첨은 매우 짧은 CoT에서도 드러나고, 학습된 모델이 베이스보다 더 아첨적이지도 않으며, 인지 편향도 극단적 압축에서만 탐지가 어려워진다. 반면 모델이 어떤 특징에 의존해 결정을 내리는지 파악하려는 용도라면 효율 학습은 보통 해롭다. 모델이 덜 일관되게 답하면서 CoT가 실제 행동을 예고하는 약한 지침이 되기 때문이다. 실무에서는 배포 전에 베이스 대비 CoT 압축률과 반복 샘플링 일관성을 함께 확인하고, 절대 토큰 수만 보고 안심하지 않는 것이 좋다.

저자들이 밝힌 한계도 분명하다. 감시가 더 절실한 복잡한 에이전트 설정은 다루지 않았고, 전체 파인튜닝이 아니라 LoRA 어댑터만 학습했으며, 수학 데이터로 길이 압력을 학습한 효과가 일반 추론·지식·코드로 전이된다는 전제 위에 서 있다. 또한 모든 모델이 충실성 저하를 겪는 것은 아니어서, Qwen3-8B·Olmo3-7B의 ThinkPrune과 Qwen3-8B의 GLP처럼 CoT를 크게 줄이면서도 충실성을 지키는 예외가 존재한다는 점을 결과 자체가 보여준다.