검증 가능한 초등 수학 문제에서 정답과 사고 흔적은 어긋난다
Correct Answers, Invalid Traces: What Verifiable Grade-School Math Reveals About Chain-of-Thought Traces
무엇인가
사고 흔적(chain-of-thought trace)은 모델이 답에 도달한 과정의 기록으로 읽히며 디버깅, 에이전트 감사, 추론 능력 주장의 근거로 쓰인다. 그런데 자연어 추론 흔적은 기계적으로 검증하기 어려워서 이 해석 자체가 직접 시험된 적이 거의 없다. 이 논문은 iGSM이라는 합성 초등 수학 벤치마크에서 "정답이 나왔을 때 그 흔적이 정말 그 답의 타당한 유도인가"를 측정한다. iGSM은 학습된 추론과 계획의 증거로 인용되어 온 벤치마크이므로, 그 긍정적 결론을 같은 데이터 위에서 다시 시험한다는 점이 핵심이다.
어떻게 동작하나
iGSM의 문제는 각각 하나의 양(quantity)을 진술하는 문장들의 집합이고, 엔티티 범주를 층으로 놓은 구조 그래프와 파라미터 간 의존 관계를 담은 방향성 비순환 그래프가 함께 주어진다. 질의된 양이 의존하는 부분 그래프가 정답 계산에 필요한 파라미터 집합이며, 참조 흔적은 이들을 위상 순서로 계산한다. 난이도는 연산 수(op)와 인스턴스 파라미터 수(ip)로 제어되고 모든 산술은 모듈로 23이다. 검사기는 생성된 흔적을 파싱해 이름이 먼저 정의되었는지, 각 정의가 의존 그래프가 규정한 입력을 정확히 쓰는지, 산술이 맞는지, 질의 파라미터를 정의하며 끝나는지를 확인한다. 네 검사를 모두 통과해야 유효한 흔적이고, 정답 여부는 별도로 비교한다.
무엇과 다른가
실험은 Ye 등(2025a)의 iGSM-med 레시피를 따라 124M 파라미터 GPT-2 스타일 모델을 처음부터 학습시킨다(op≤15, ip≤20). 레벨당 4,096개 held-out 인스턴스로 평가하며 분포 밖은 op 20~23이다. 항상 0을 답하는 예측기가 약 15%를 기록하므로 이를 기준선으로 쓴다. 유효하고 최소한 흔적으로만 학습한 clean 모델은 분포 내에서는 정답 정확도와 흔적 유효성이 거의 일치한다. 그러나 op=15, 20, 23에서 정답이면서 유효한 흔적인 비율은 98.3%, 77.0%, 39.7%로 떨어지고, 정답인데 흔적이 무효인 비율은 0.5%, 7.5%, 31.6%로 올라간다. 이 무효 흔적 중 구문·산술 검사는 통과하고 의존성 검사만 실패한 의미론적 실패가 각각 95.0%, 78.1%, 51.2%다. 학습 스텝을 두 배로 늘려도 이 경향은 바뀌지 않는다.
어떻게 쓰나
흔적 지도 방식을 바꾼 개입 실험도 수행했다. 다른 문제의 흔적을 붙여 학습한 swapped 모델은 생성한 흔적이 단 하나도 검증을 통과하지 못하는데도 분포 내 정답률이 82%다. op별로 보면 4연산 이하는 거의 다 맞히고 5~7연산은 82~96%를 맞히며, 11연산에서 30%, 15연산에서 20%로 떨어지고 분포 밖에서는 16~20%로 0-답변 사전확률 수준이 된다. 흔적 앞부분 p% 문장의 토큰을 무작위로 섞은 shuffled 모델은 p=10에서 clean 모델과 동등하고, p=30에서도 op=15에서 75%, op=20에서 44%를 기록한다(흔적 없이 학습한 모델은 25%/18%, swapped 모델은 20%/17%). 실제로 파괴된 토큰 비율은 p=10, 30, 50, 75, 100에 대해 21, 29, 45, 61, 100%다. 모든 파라미터를 무작위 위상 순서로 계산하는 비최소 흔적으로 학습하면 op=15에서 흔적당 불필요 파라미터가 2.5개, 최소 흔적 비율이 40%가 되는데 표준 학습에서는 99.9%다. 질문을 의존 그래프의 sink가 아닌 다른 파라미터로 바꿔 다시 물으면 최소성이 무너져, 정답 문제 중 불필요한 파라미터를 포함한 흔적 비율이 표준 설정 op=20에서 0.4%에서 3.7%로, 확장된 세계에서 1.3%에서 9.6%로 오른다. 모델이 포함한 불필요 파라미터의 89~97%가 sink로 가는 체인 위에 있는데, 그런 파라미터는 사용 가능한 것의 18~28%에 불과하다.
전제와 한계
개발자에게 이 결과가 주는 메시지는 분명하다. 흔적이 답을 만들어내는 데 유용한 계산이라는 것과 그 흔적이 답의 타당한 유도라는 것은 서로 다른 속성이다. 정답률과 그럴듯한 문장 형식은 흔적의 의미론적 신뢰성을 보증하지 않으며, 특히 학습 때보다 어려운 문제로 분포가 이동하면 그 보증이 약해진다. 흔적의 최소성이나 일관성 같은 특징은 모델이 스스로 계획해서 나온 것이 아니라 학습 데이터와 문제 구성에서 상속된 것일 수 있다. 따라서 CoT 흔적을 모니터링·감사 신호로 쓰는 시스템이라면, 검증 가능한 도메인에서는 흔적을 프로그램적으로 검사하는 장치를 두고, 그렇지 않다면 반사실적 테스트로 흔적과 실제 계산의 연결을 확인해야 한다.
저자들이 밝힌 한계도 분명하다. 모델이 작고 데이터가 합성이므로 프런티어 시스템으로 직접 외삽하는 것은 정당화되지 않는다. 이 실험은 인과적 충실성이나 안전 모니터의 정확도를 측정하지 않으며, 무효한 흔적이 내부에 유용한 추론이 없었다는 뜻도 아니다. CoT 모니터링이 여전히 유용할 수 있다는 점도 부정하지 않는다. 다만 의미론적 해석의 관찰 가능한 전제조건, 즉 흔적이 그 문제에 대해 유효하다는 조건이 깨끗한 지도, 적대자 없음, 은폐 유인 없음이라는 이상적 조건에서도 분포 이동에 따라 무너질 수 있음을 보인다. 저자들의 결론은 생성된 흔적이 내부 추론 과정의 직접 측정이 아니라 모델 행동의 관찰이라는 것이다.