LLM 수학 추론의 병목은 구조 발견이며 Absorb가 이를 보강한다
The Missing Primitive: Diagnosing and Repairing Mathematical Reasoning in Large Language Models
무엇인가
대형 언어모델이 최전선 수학 문제를 풀어내면서도, 그 해답 아래에 깔린 구조적 수학 이해를 실제로 갖추고 있는지는 불분명하다. 정답률이나 형식 증명 검증 가능성 같은 결과 지표만으로는 모델이 해법에 필요한 수학적 구조를 발견한 것인지, 아니면 단순히 유도 절차를 성공적으로 실행한 것인지 구분되지 않는다. 저자들은 정답률이 서로 다른 능력 프로필을 가리는 현상을 체계적으로 진단하고, 그 진단을 후학습 개선으로 연결하는 것을 목표로 삼는다.
어떻게 동작하나
핵심 개념은 Mathematical Primitive, 즉 어떤 문제가 왜 풀리는지를 드러내는 응축된 비절차적 관찰이다. 불변량, 정리 조건, 표현 방식, 환원, 재정식화처럼 문제와 해법이 공유하는 잠재 구조를 가리키며, 짧고 문제 특정적이고 설명적이어야 한다. "귀납법을 써라" 같은 일반 조언이나 일상적 계산, 완전한 증명은 원시 개념이 아니다. 이를 측정하기 위해 제안한 Prim 벤치마크는 HLE-Verified의 Gold·Revision 부분집합에서 200문제를 표집하고 GPT-5.4-High로 초기 원시 개념 주석을 만든 뒤 수학 전공 대학원 수준 전문가 3인이 검토해 부적합 18문제를 제외한 182문제로 구성된다. 평가는 문제만 보고 원시 개념을 찾는 Discovery, zero-shot CoT로 푸는 Generation, 정답 해법을 주고 원시 개념을 추출하는 Digestion, 원시 개념을 조건으로 문제를 푸는 Execution 네 차원으로 나뉜다. 원시 개념 채점은 유효성 V, 구조 식별 σ_gate, 구조가 해법을 가능하게 하는 방식 설명 σ_mech를 조합해 Score = V·σ_gate·(0.6+0.4·σ_mech)로 계산하고 τ=0.8 이상이면 정답으로 본다.
무엇과 다른가
진단 결과는 세 가지다. 첫째, 비슷한 정답률이 전혀 다른 능력 프로필을 가린다. Qwen3.6-27B와 gpt-5.4-mini는 Generation 성능이 비슷한데 Discovery에서는 30%포인트 이상 차이가 난다. OpenAI 계열은 원시 개념을 먼저 잡고 실행에서 실패하는 D+G- 유형이, Qwen은 발견에 실패하고 실행으로 성공하는 D-G+ 유형이 상대적으로 많고, DeepSeek-R1 증류 모델은 발견과 실행이 함께 실패하는 경우에 집중된다. 둘째, 올바른 원시 개념은 잠재된 실행 능력을 끌어낸다. 정답 원시 개념을 명시적으로 주면 12개 모델 전부에서 성능이 17.58~29.67%포인트 올랐고, 같은 교사 모델이 만든 단계별 Teacher Plan보다 Teacher Primitive의 향상 폭이 훨씬 컸으며 Gold Primitive는 대표 모델들을 71.98%, 68.68%, 78.57%까지 끌어올렸다. 셋째, 독립적 구조 발견이 지배적 병목이다. Qwen3.6-27B는 Discovery 24.73%에서 Digestion 92.31%로, R1-Distill-32B는 6.04%에서 65.38%로 뛴다. Generation 실패를 Discovery와 Execution의 결합 결과로 분해하면 83.6%가 발견 실패 영역에 속하고, 그중 상당수는 원시 개념을 주면 풀리는 D-E+ 유형이다.
어떻게 쓰나
후학습 분석에서는 1991~2026년 수학 박사 자격시험 문제 709개(인간 작성 증명, 중앙값 118단어)로 SFT와 On-Policy Self-Distillation을 Qwen-3.5-27B·9B·4B에 적용했다. 짧은 정답 검증이 불가능한 서술형 증명 문제라 RLVR 대신 텍스트 지도 후학습을 쓴다. 세 모델의 기저 모델이 Prim에서 남긴 실패 341건 중 Discovery 실패는 294건이었고, D-E+ 147건과 D-E- 147건으로 나뉘었다. SFT와 OPSD는 D-E+의 20.4%와 21.1%를 고쳤지만 D-E-에서는 6.8%와 8.2%에 그쳐, 발견 제한 실패가 후학습에 훨씬 잘 반응한다. 다만 이미 맞히던 문제가 틀리게 되는 퇴행 때문에 Generation 순증가는 크지 않았다.
전제와 한계
Absorb는 이 관찰에서 출발한 원시 개념 특권 자기증류 기법이다. 원시 개념을 학생의 예측 대상으로 삼는 대신 교사에게 특권 정보로 제공하고, 학생이 스스로 생성한 온폴리시 추론 궤적 위에서 토큰 수준 지도를 한다. 전체 참조 해법보다 표적화된 감독을 주면서 학생이 이미 할 수 있는 실행 단계를 강요하지 않는다. 동시에 무분별한 교사 개입을 막기 위해 단방향 클램핑을 적용한다. 교사가 학생보다 어떤 선택을 더 선호하면 그 양의 지도는 온전히 전달하되, 교사가 학생 선호를 강하게 억누르는 압력은 상한 τ로 제한한다. 교사의 top-K 토큰 지지집합 위에서 재정규화한 분포로 min{π̄_S log(π̄_S/π̄_T), τ}를 합산하는 것이 목적함수이며, 이는 역 KL에 단방향 클램핑을 적용한 형태다.
실험은 Prim, HLE-Verified 수학 전체 부분집합, HMMT25, Omni-MATH 네 벤치마크에서 이뤄졌고 HMMT25와 Omni-MATH는 pass@4로 측정했다. 평균은 Discovery를 제외한 Generation 점수만으로 계산한다. Absorb는 세 모델 규모 모두에서 Generation을 개선했고 9B에서 5.49%포인트, 벤치마크 평균 3.73%포인트 향상을 냈다. 반면 SFT와 OPSD는 9B에서 각각 6.04, 4.95%포인트 Generation을 떨어뜨렸고 OPSD는 27B에서도 3.30%포인트 하락을 일으켰다. 개선이 명시적 Discovery가 아니라 하류 추론에 집중되는 점도 확인된다. 9B에서 Generation은 5.49%포인트 오르는데 Discovery는 1.10%포인트만 올랐고, 27B에서는 Discovery가 0.55%포인트 떨어졌는데도 Generation 1.10%포인트, HLE Math 3.93%포인트가 올랐다.
개발자 관점에서 이 논문은 평가와 파인튜닝 양쪽에 시사점을 준다. 정답률 하나로 모델을 비교하면 발견형과 실행형이라는 서로 다른 약점을 놓치므로, 문제만 주는 Discovery와 해법을 주는 Digestion을 분리해 측정하는 편이 실패 원인을 좁혀준다. 또 실패 사례를 D-E+와 D-E-로 나누면 후학습으로 고칠 수 있는 구간이 어디인지 사전에 가늠할 수 있고, 참조 해법 전체를 지도하는 대신 구조적 단서만 특권 정보로 주고 부정 압력을 제한하는 설계가 기존 문제를 망가뜨리는 퇴행을 줄이는 데 도움이 된다.
저자들이 밝힌 전제와 한계도 분명하다. 학습 코퍼스가 알고리즘적으로 검증 가능한 짧은 정답을 갖지 않는 자격시험 증명 문제라서 결과 검증형 RLVR 대신 텍스트 지도 후학습에 한정해 실험했다. 또한 원시 개념을 특권 정보로 주는 순진한 OPSD에서는 복잡한 추론 문제에서 특권 누출이 크게 나타나며, 기존 후학습 기법의 성능 퇴행은 후학습 표류로 설명된다. Absorb의 효과가 명시적 Discovery 향상으로 나타나지 않는다는 점, 그리고 진단 프레임워크를 이론물리학이나 계산화학 같은 다른 구조적 영역으로 확장하는 일은 향후 과제로 남겨두고 있다.