SAGE는 장기 추론의 두 편향을 위상 구조로 완화하는 강화학습 프레임워크다.
SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance
무엇인가
이 논문이 다루는 문제는 희소 보상 환경에서 대형 언어모델의 장기 추론(long-horizon reasoning)이 왜 쉽게 무너지는가다. 저자들은 원인을 두 가지 편향으로 분리한다. 첫째는 탐색 편향(exploration bias)으로, 추론 트리가 깊어질수록 국소적으로는 그럴듯하지만 구조적으로 불안정한 분기가 전체 도달 가능 공간을 압도해서, 결과 기반 학습이 성공으로 확장 가능한 경로가 아니라 샘플링하기 쉬운 경로를 선호하게 되는 현상이다. 둘째는 누적 편향(compounding bias)으로, 중간 보상이 없으면 초기의 작은 이탈이 깊이를 따라 누적되어 장기적 실행 가능성에서 멀어지는 현상이다. 논문은 Andrews-Curtis(AC) 문제를 대표 예시로 삼는다. 합법적인 심볼릭 변환을 길게 이어가 결국 자명한 표현(trivial presentation)에 도달해야 하는, 실제로 미해결 난제가 포함된 과제다.
어떻게 동작하나
이론적 렌즈로 제안하는 것이 Symbolic Closure Analysis(SCA)다. SCA는 국소 허용성 판정 함수 Adm_S만으로 정의되는 전위 폐쇄(prefix-closed) 실행 가능 집합 F를 도입한다. 어떤 접두사가 국소 허용성을 위반하면 그 뒤의 모든 연속 경로도 실행 불가라는 성질을 이용해, 도달 공간 Ω를 실행 가능 영역 F와 그 여집합 G로 나눈다. 이 틀에서 탐색 편향은 롤아웃이 F 바깥에 집중되는 현상(μ_π0 ≈ 1)으로, 누적 편향은 종단 보상만 있을 때 초기의 국소적 이탈이 오래 살아남는 현상으로 나타난다. 논문은 실행 가능 분기 계수 B_t^F가 전체 분기 계수 B_t보다 훨씬 작으면 실행 가능 경로의 비율이 ∏(B_t^F/B_t) 수준으로 줄어든다는 부피 비교(식 1)를 제시하고, 점수 함수 그래디언트의 분산을 F 영역 분산, G 영역 분산, 두 영역 간 평균 차이 항으로 분해한다(Proposition 3.4). 또한 종단 보상만 있고 성공 궤적이 참조 정책에서 희귀할 때, KL 정규화 최적해가 참조 정책에서 벗어날 수 있는 총변동 거리의 상한이 (e^{R_max/λ} − 1)·p로 제한된다는 정리(Theorem 3.5)를 통해, 보상이 약하면 KL 항이 학습을 지배해 국소적 이탈이 교정되지 않음을 보인다. SCA는 심볼릭 시스템에서는 F가 정확히 정의되고, 폐형식 수학에서는 미해결 변수·방정식·답안 스키마 제약을 잔여 구조의 계산 가능한 대리로 쓰며, 자유 형식 자연어 추론에서는 프롬프트 조건부 의미 구조로 잔여와 목표 앵커를 추정하는 세 단계로 적용된다.
무엇과 다른가
이 진단을 학습 신호로 바꾼 것이 SAGE(Structural Admissibility-Guided Exploration)다. 구성 요소는 두 가지다. 대수적 희소화 Ψ_P는 현재 심볼릭 잔여 r_t를 연산자별 부분공간 S_j에 투영한 비율 ‖P_{S_j} r_t‖²/(‖r_t‖²+ε)로, 후보 연산자가 잔여를 얼마나 설명하는지를 나타내는 소프트 적합도 점수다. 이는 Adm_S를 대체하는 것이 아니라 허용된 후보 중에서도 구조적으로 확장 가능한 쪽으로 샘플링을 편향시켜 탐색 편향을 줄인다. 쌍곡 구조 유도 Ψ_H는 상태와 연산자를 합성한 결과를 푸앵카레 공간에 임베딩하고 목표 구조 g까지의 쌍곡 거리 d_D로 exp(−d_D/κ)를 계산한다. 음의 곡률 공간이 계층적 추론 구조에 자연스럽게 맞는다는 점을 이용해, 종단 보상이 오기 전에 깊이별 조밀한 신호를 제공함으로써 누적 편향을 완화한다. 두 잠재함수는 α, γ 가중치로 합쳐진다. 중요한 전제는 두 신호 모두 정답 궤적 T*나 프로세스 라벨 없이 계산되며, 추론 시점에는 추가 탐색이나 필터링 없이 학습된 정책에 흡수된다는 점이다.
어떻게 쓰나
학습 절차는 세 부분이다. 먼저 구조 유도 샘플링으로, 후보 집합 C_t 위에서 기존 정책 로짓에 λ·Ψ_SAGE를 더한 분포로 다음 행동을 뽑는다. 다음으로 보상은 종단 결과 R_term에 궤적 평균 구조 유도값 η·(1/T)ΣΨ_SAGE를 더해 만들고, 그룹 상대 어드밴티지로 정규화한다. 논문은 종단 보상이 그룹 전체에서 0이어도 Ψ_SAGE의 그룹 내 분산이 0이 아니면 어드밴티지가 살아 있어 갱신 신호가 남는다는 명제(Proposition 4.1)를 제시한다. 마지막으로 정책 갱신은 클리핑과 스텝 단위 KL 정규화를 포함한 그룹 상대 목적함수(식 5)로 이루어진다. 이론적으로는 실행 가능 영역과 실행 불가 영역의 Ψ_SAGE 하한·상한 차이가 Δ 이상이면, 유도 강도 λ를 키울수록 실행 불가 질량이 실행 가능 질량 대비 e^{−λΔ}로 지수적으로 억제된다는 명제(Proposition 4.2)가 뒷받침한다.
전제와 한계
실험은 12개 벤치마크와 7개 모델 계열에서 수행됐다(서론의 기여 문장에는 13개 벤치마크·8개 모델로 적혀 있어 원문 내 수치가 일치하지 않는다). 모델은 Qwen3.5(2B·9B·35B), Qwen3.6-27B, Qwen3-32B, DeepSeekMath-7B, DeepSeek-Prover-V2-7B, Kimina-Prover(7B·Distill-8B), Llama-3.3-70B-Instruct다. 벤치마크는 폐형식 수학(MATH, Minerva Math, AMC23, AIME 2024, OlympiadBench, GSM8K, Putnam), 자유 형식 추론(MMLU-Pro, GPQA, BBH-H, ARC-C), 그리고 실제 장기 과제인 AC 문제(n≤7, |w|≤7인 1190개 표현)로 구성된다. 비교 대상은 SFT, GRPO, EMPO, GRPO-PRM이다. 결과적으로 2B에서 평균 정확도 27.24%→42.11%, 9B에서 29.01%→47.95%, 35B에서 45.21%→64.86%로 올랐고, 가장 강한 베이스라인 대비 각각 +1.83, +3.02, +2.49 포인트 앞선다. 35B SAGE의 64.86%는 약 두 배 파라미터인 Llama-3.3-70B-Instruct의 38.48%를 크게 웃돈다. 자유 형식 추론에서도 9B 기준 MMLU-Pro 37.91%→39.99%, BBH-H 44.04%→45.31%, ARC-C 39.73%→42.04%로 개선됐고, 27B는 BBH-H 60.25%·ARC-C 58.11%, 35B는 BBH-H 69.07%·ARC-C 66.41%를 기록했다. AC 문제에서는 AC Validity가 아키텍처별로 +19.2%에서 +26.0% 개선됐고, Lean 검증 증명 성공률은 모든 경우에서 +13% 이상, Qwen3에서는 베이스 대비 거의 8배 증가했다.
구성 요소 분리 실험도 의미가 있다. Qwen3.5-9B에서 Ψ_P나 Ψ_H 중 하나만 제거해도 수학·자유 형식 추론 성능이 떨어져 두 신호가 중복이 아니라 상호 보완적임을 보인다. Ψ_H를 유클리드 거리로 바꾸면 성능이 약해지고, 목표 앵커를 뒤섞으면 정확도와 보상 밀도가 모두 크게 떨어진다. 즉 이득이 일반적인 조밀 보상 셰이핑으로 설명되지 않는다는 통제 실험이다. 학습된 프로세스 보상과의 비교에서 GRPO-PRM은 GRPO보다 나았지만 SAGE가 여전히 더 강했고, 특히 AC 문제에서 격차가 컸다. AC 과제에서 직접 편향 제거 실험을 했을 때도 Ψ_P 또는 Ψ_H를 빼면 AC Validity, AC Path Solving, Lean 검증 성공률이 모두 낮아졌고, 전체 SAGE가 종단 검증 성능이 가장 좋았다.
개발자 관점에서 이 논문의 실용적 요점은 세 가지다. 첫째, 긴 추론 체인을 RL로 학습시킬 때 결과 보상만 주는 구조는 참조 정책에서 크게 벗어나기 어렵다는 것을 정량적 상한으로 보여주므로, 보상 설계나 중간 신호 부재를 진단하는 기준으로 쓸 수 있다. 둘째, SAGE의 두 유도항은 정답 라벨 없이 계산되며 추론 시점 오버헤드가 없다는 점을 명시적으로 주장하므로, 프로세스 라벨 주석 비용이 부담인 팀에 현실적인 대안이 된다. 셋째, 적용 조건은 도메인별 국소 허용성 판정 함수나 잔여 구조 프록시를 정의할 수 있는지에 달려 있다. 심볼릭 과제는 그대로, 폐형식 수학은 변수·방정식 제약으로, 자유 형식 추론은 의미 구조 추정으로 대체하는데, 이 프록시의 품질이 곧 성능 상한이 된다.
한계와 전제는 원문에 흩어져 제시된다. SCA는 실행 가능 집합 F를 다루기 쉬운 구조적 프록시로 취급하며, 심볼릭 도메인에서는 국소 허용성으로 유도되지만 그 외 영역에서는 장기 확장 가능 부분집합의 근사일 뿐이다. 자유 형식 추론의 잔여와 목표 앵커는 프롬프트 조건부 의미 구조에서 추정되는 값이다. 또한 Ψ_P는 하드 제약이 아닌 소프트 호환 점수이며 추론 시점 가지치기를 하지 않는다는 점, 모든 비교가 유사한 롤아웃 예산과 생성 길이·디코딩 제약 아래에서 이루어졌다는 점이 명시된다. 원문 발췌 범위에는 별도의 Limitations 절이 포함되어 있지 않으며, 벤치마크·모델 수 표기가 12/7과 13/8로 엇갈리는 불일치도 남아 있다.
관련 논문
- 도구 응답 예측 대신 에이전트의 추론-행동을 판정·수정해 장기 과제 오염을 막는 AEWMLLM 에이전트의 장기 작업에서 누적되는 작업 상태 오염을 다루며, 툴 응답을 예측하는 대신 추론·행동이 미래 작업 진행에 미치는 영향을 모델링하는 AEWM과 EditAct를 제안한다. 기존 언어 월드 모델이 환경 관측을 예측하는 방식과 달리 실제 실행 피드백을 활용해 의사결정 기반 상태를 직접 바꾸는 접근으로, 여러 벤치마크에서 개선을 보고한다.
- UECR-GRPO는 GRPO와 온폴리시 증류를 엔트로피보정 크레딧배분으로 통합한다검증기 보상과 교사 모델 신호를 하나의 GRPO 업데이트 안에서 응답·토큰 수준으로 결합한 UECR-GRPO를 제안한다. 교사 엔트로피로 불확실한 지도를 감쇠하고 응답별 제로섬 투영으로 총 과제 크레딧을 보존한다.
- RLVR 데이터 정책 13종을 같은 GRPO 레시피에서 재검증한 결과, 균일 샘플링을 이기는 재현 가능한 개선은 없었다검증 가능한 보상 기반 강화학습(RLVR)의 데이터 정책을 동일한 GRPO 조건에서 비교하는 평가 플랫폼 DataFlex-RL이 공개됐다. 12개 시드와 12개 벤치마크 실험에서 어떤 롤아웃 선택·재가중 기법도 균등 샘플링을 안정적으로 앞서지 못했다.
- VHD-Play는 해를 먼저 풀어 검증 가능한 에이전트 RL 환경을 생성한다수학 모델을 먼저 샘플링·해결한 뒤 그 해를 상태 기반 도구로 렌더링해 에이전트 RL 환경을 자동 생성하는 VHD-Play를 제안한다. 3,300개 환경을 개당 몇 센트로 만들고, Qwen3.6-35B-A3B 학습으로 진단 점수를 0.204에서 0.815로 끌어올렸다.