잠재 공간 추론 LLM의 생각 표현을 네 가지 손실로 직접 감독한다
Principled Thoughts for Latent Recursive LLM Systems
무엇인가
Chain-of-Thought는 모든 중간 추론 단계를 이산 어휘의 토큰으로 써내야 하므로, 말로 쓸 수 있는 경로에 추론이 갇히고 추론 흔적이 길어져 추론 비용이 오른다. 이 논문이 다루는 문제는 그 대안으로 떠오른 잠재 공간 추론, 즉 모델이 자기 은닉 상태를 다음 추론 단계로 다시 입력하거나 에이전트 사이에 은닉 상태·KV 캐시를 넘겨주는 시스템이다. 문제는 이런 시스템의 학습 목표가 대개 최종 디코딩된 답의 교차엔트로피(CE)뿐이고, 정작 생각(thought) 자체는 아무 제약을 받지 않는다는 점이다. 에이전트 수와 재귀 라운드가 늘면 뒤쪽 에이전트가 앞에서 받은 생각 위에 쌓이므로 오차가 시스템 전체로 복리처럼 누적된다.
어떻게 동작하나
저자들은 CE만으로 학습할 때 생기는 네 가지 실패를 이론과 실험으로 정리한다. 첫째 대체 발산(substitution divergence)으로, 소비자 에이전트가 생산자의 텍스트 임베딩을 받을 때와 생각 T를 받을 때의 다음 토큰 분포 차이가 KL 발산으로 나타나며, 정답 확률이 exp(-nΛ(v))만큼 줄어든다. 즉 같은 토큰당 발산이라도 정답이 길수록 더 크게 벌점을 받고, 이 효과는 홉마다 누적된다. 둘째 정보 손실로, 소비자가 혼자서도 풀 수 있는 문제에서는 CE 기울기가 작아 생산자 출력이 생각에 보존되지 않고, 오히려 생산자 입력의 무관한 정보가 인코딩된다. 셋째 생각 충돌(thought collision)로, 서로 다른 질문의 생각이 같아지면 소비자는 두 정답에 거의 같은 분포를 배정할 수밖에 없어 평균 CE에 하한이 생긴다. CE는 각 예제를 개별적으로 평가하므로 이런 충돌을 '어려운 예제 두 개'와 구분하지 못한다. 넷째 생산자 불확실성으로, 생산자가 동등한 확률의 대안 사이에서 고민 중이어도 CE는 그 확신도를 생각에 담도록 요구하지 않는다.
무엇과 다른가
REST(REpresentation-Supervised Thought(s))는 유효한 생각 표현이 가져야 할 네 속성을 미분 가능한 손실로 번역해 CE에 더한다. 인과성은 소비자가 텍스트 임베딩을 받았을 때와 생각 T를 받았을 때의 위치별 다음 토큰 분포 사이 KL을 벌점으로 준다. 최소성은 λ1·CE(Y|T) − λ2·CE(X|Y,T)로, 생산자 출력 Y에 대한 정보는 유지하면서 입력 X의 무관한 정보는 버리도록 한다. 분리성은 현재 예제의 풀링된 생각 벡터와 앞선 K개 예제의 생각 벡터 사이 코사인 유사도에 온도 τ를 적용한 log-sum-exp를 벌점으로 주어, 의미가 다른 출력의 생각이 서로 구분되게 만든다. 안정성은 어텐션 풀링과 아핀 사상으로 만든 프로브 g_ω(T)가 생산자 출력 u를 따라 계산한 평균 예측 엔트로피와 일치하도록 제곱 오차를 준다. 전체 손실은 최종 답의 CE에 β를 곱한 속성 항을 모든 전이에 대해 평균해 더한 형태이며, 추론 시점에 아키텍처 변경이나 추가 파라미터가 필요 없다.
어떻게 쓰나
적용 범위는 두 갈래다. 다중 에이전트 시스템에서는 planner·refiner·solver가 m′개의 잠재 스텝을 밟고 R라운드 재귀하며, 각 전이마다 속성 항이 하나씩 붙는다. 단일 에이전트 설정은 정의상 생산자와 소비자가 같은 A_i = A_j인 경우로, solver가 자기 입력으로 한 번 돌아 생각 T를 만들고 다시 T를 조건으로 두 번째 패스를 도는 self-loop 구조다. 학습에서는 베이스 LLM과 내부 링크 R_in을 모두 동결하고, CE로 학습되는 외부 링크 R_ψ만 갱신해 각 속성 항의 효과를 분리한다.
전제와 한계
실험은 Qwen·Llama·Gemma 계열 오픈 웨이트 모델로 구성한 이종 에이전트 협업에서 수행했고, 학습 데이터는 s1K와 m1K의 질문-답 쌍을 역할별 텍스트로 재작성한 Sequential-Math를 쓴다. 평가는 수학(MATH500, AIME2025, AIME2026), 과학(GPQA-Diamond), 의학(MedQA), 코드 생성(MBPP+, LiveCodeBench-v6) 7개 벤치마크다. 베이스라인은 CE만 쓴 원래의 latent recursive 시스템, CE에 손실 항으로 이식한 CODI와 SIM-CoT, 동결 LLM 텍스트 베이스라인, 인과성과 최소성을 결합한 Best pair다. 동일한 학습 데이터·연산·잠재 예산에서 REST는 다중 에이전트 평균 +3.5%p, 단일 에이전트 평균 +3.3%p 정확도를 올렸고, 최고 구성은 각각 +7.5%p와 +6.5%p에 도달한다. 토큰은 평균 15.4% 더 디코딩하는데, 저자들은 이를 최종 답에 수렴하는 비율이 높아진 결과로 해석한다. 실제로 박스 처리된 답변 비율은 REST 95% 대 CE 73%다.
분석 결과도 함께 제시된다. 단일 에이전트에서는 최소성이 가장 큰 이득을 냈고, 생각이 다른 에이전트로 넘어가는 다중 에이전트에서는 인과성이 앞섰다. 재귀 라운드를 늘리면 Scaled 에이전트는 REST 이득이 커지고 Light 에이전트는 줄어, 큰 모델이 추가 라운드를 활용한다는 해석이 가능하다. 생각을 디코딩해 내용을 분해하면 REST는 생산자의 출력(계획 또는 정제된 계획)을 더 많이 담는 반면 CE는 입력 프롬프트 내용을 상대적으로 더 많이 담았고, 이 차이는 체인 후반으로 갈수록 커진다. 생산자가 만든 정답 계획을 오라클로 준 경우와 비교했을 때도 REST가 그 성능에 더 근접한다. 200개 무작위 샘플의 생각을 투영하면 CE 생각은 밀집 클러스터로 뭉치는데, 클러스터 안 텍스트들은 서로 관련이 없어 공유 내용 없는 붕괴임을 확인했다. 학습 CE가 더 낮다고 정확도가 더 높지도 않았다.
개발자 관점에서 이 논문이 주는 실무적 신호는 명확하다. 잠재 공간 추론이나 에이전트 간 은닉 상태 전달을 쓰면서 최종 답 정확도만 모니터링하면, 생각 표현이 붕괴하거나 무관한 입력 정보를 나르는 문제를 놓친다. 저자들은 최종 답 정확도가 잠재 시스템을 보는 불완전한 시야이며 생각 표현에 대한 점검이 함께 가야 한다고 말한다. 또한 REST의 손실 항은 기존 latent recursive 시스템에 아키텍처 수정 없이 추가할 수 있고, β 가중치 전 구간에서 인과성과 최소성이 CE를 앞섰다고 보고한다. 다만 어떤 속성이 가장 큰 이득을 주는지는 소비자에 따라 달라지므로, 자기 생각을 다시 먹이는 self-loop라면 최소성, 에이전트 간 전달이라면 인과성을 먼저 시도하는 편이 합리적이다.
저자들이 밝힌 한계도 분명하다. 연산 비용이 커서 속성 조합과 하이퍼파라미터를 전수 탐색하지 못했고, 필요한 실행 수가 조합마다 곱셈으로 늘어난다. 안정성 항은 계산 한계 때문에 값싼 근사치를 택했지만 그럼에도 성능 이득은 있었다. 또 REST는 외부 링크만 학습하고 베이스 LLM과 내부 링크는 동결했는데, 이는 각 속성 항의 기여를 분리하기 위한 설계 선택이며 내부 링크나 에이전트 자체를 학습하는 확장은 향후 과제로 남긴다.