API 도구 호출로 꺼낸 숨은 사고 연쇄, 압축된 추론은 약한 모델이 못 읽는다
Capable yet Parsimonious: Extracting and Characterizing Hidden Chain-of-Thought in Frontier Models
무엇인가
폐쇄형 프런티어 모델은 최종 답만 내놓고 네이티브 사고 연쇄(chain-of-thought)는 감춘다. 그래서 벤치마크 정확도는 '무엇을 풀 수 있는가'만 알려줄 뿐 '어떻게 풀었는가', 그리고 더 강한 모델과 더 효율적인 모델의 추론이 무엇이 다른지는 알려주지 않는다. 정답이 건전한 추론에서 나왔는지 사후 합리화에서 나왔는지 구분할 수 없다는 검증 문제도 따라온다. 이 논문은 그 측정 공백을 메우려 한다.
어떻게 동작하나
방법은 Forced-Reasoning 프로토콜이다. 추론용 자유 문자열 인자 하나를 받는 커스텀 도구를 등록하고, 네이티브 추론을 끈 상태로 실행한다. 첫 호출에서 named tool_choice로 이 도구를 강제 선택하게 하고, 반환된 도구 호출의 인자를 기록한 뒤 어시스턴트 도구 호출과 내용 없는 확인 응답을 대화에 덧붙인다. 이후에는 자동 도구 선택으로 되돌려 모델이 다시 도구를 부르거나 최종 답을 낼 때까지 진행한다. 도구는 외부 계산을 전혀 하지 않는다. 강제되는 것은 최초의 도구 선택뿐이고, 추론 텍스트 자체는 모델이 과제를 풀면서 생성한다. 즉 별도 추론 채널이 막혀 있어도 클라이언트가 제공한 도구가 중간 추론의 작업 공간으로 쓰일 수 있는지를 시험하는 장치다.
무엇과 다른가
검증은 두 갈래로 이뤄진다. 네이티브 CoT가 관찰되는 오픈소스 모델 DeepSeek-V4-Flash와 GLM-5.2에서는 추출된 트레이스가 네이티브에 근접한 성능을 회복하고 추론 없음 베이스라인을 크게 앞섰으며, 네이티브 CoT와 상당한 어휘 중첩과 유사한 거친 기능 구조를 보였다(부록 A.1의 그림 5, 표 4, 그림 6). 폐쇄형 모델에서는 MATH(HMMT·APEX Shortlist 경시 문제 80개), LiveCodeBench 100문제 부분집합, Humanity's Last Exam 100문제 부분집합에서 None(추론 끔, 도구 없음), Native(고노력 추론), Forced 세 조건을 비교했고, Forced는 Native에 근접하면서 None을 크게 상회했다. 다만 모델마다 도구 프롬프트 민감도가 달라 Forced가 특정 네이티브 추론 노력 수준에 일대일로 대응하지는 않았다. Astra는 네이티브 추론 비활성화를 지원하지 않아 가장 낮은 추론 노력 설정을 사용했고, 모든 실험은 OpenRouter를 통해 수행됐다. 벤치마크별 구체적 정확도 수치는 표 1과 그림 5에 보고되지만 본문 발췌에는 숫자가 실려 있지 않다.
어떻게 쓰나
추출한 트레이스로 모델 간 차이를 네 축에서 분석한다. 첫째, 길이와 압축성이다. 무손실 zlib 압축비를 텍스트 중복도의 거친 지표로 쓰는데, GPT-6 Astra가 세 벤치마크 모두에서 가장 높은 zlib 비율, 즉 가장 압축되지 않는 텍스트를 냈다. 둘째, 국소적 추론 입자성이다. 같은 검산이나 유도를 Astra는 더 압축적으로 쓰고 Sol·Opus는 중간 계산을 더 명시한다. 예를 들어 Astra는 탄소·수소·산소가 각각 4, 1, 6개의 원자가전자를 기여한다는 사실을 다시 진술하지 않고 48+18+36=102라고만 쓴다. 셋째, 추론 활동 구성이다. Read, Analyze, Plan, Implement, Explore, Verify, Monitor 일곱 범주로 나눠 보면 모든 모델이 Analyze와 Implement가 가장 큰 비중을 차지하고 전체 프로필이 대체로 유사했다. Astra의 짧음은 특정 추론 활동 범주를 통째로 제거해서 생긴 것이 아니다. 넷째, 전역 구조다. LCoT2Tree로 트레이스를 추론 트리로 바꿔 폭 p(임의 스케치 단계의 최대 횡적 확장), 깊이 q(가장 깊은 점유 단계), 노드 수 N(인공 루트 제외)을 측정했고, 재방문은 병합하지 않고 별도 노드로 남겼다. Astra는 비슷한 깊이에 도달하면서도 트리 폭이 훨씬 좁고 노드 수가 훨씬 적었다. 즉 분기와 시행착오가 적고 더 직접적으로 유효한 경로로 수렴한다.
전제와 한계
압축된 트레이스가 실제로 쓸모가 있는지도 시험한다. 트레이스를 만든 모델을 donor, 소비하는 모델을 recipient라 하고, recipient에게 donor의 추출 추론을 최종 답 없이 사전 문맥으로 주고 네이티브 추론과 도구 없이 한 번에 답하게 했다. Sol과 Opus의 트레이스는 모든 recipient가 거의 손실 없이 재사용했다. Astra의 트레이스는 달랐다. 강한 recipient는 donor 정확도의 거의 전부를 재현했지만 약한 recipient는 덜 회복했고, Claude Haiku 4.5와 GPT-5.4 Nano에서 격차가 가장 컸다. 이 패턴은 recipient 능력 순서로 깔끔하게 정렬되지도 않았다. GPT-5.4 Nano와 DeepSeek-V4-Flash는 Native-high 정확도가 비슷한데 회복량은 달랐다. 어떤 경우에는 donor 트레이스에 정답이 이미 적혀 있는데도 recipient가 다른 답을 냈다. 저자들은 이를 압축 트레이스가 특정 능력 이하의 독자에게는 아예 읽히지 않는 '능력 상한'으로 해석한다.
개발자에게 이 논문이 주는 실무적 의미는 두 가지다. 하나는 추론 노출 통제가 생각보다 느슨하다는 점이다. 네이티브 추론이 꺼져 있거나 제공자가 추론 토큰 0을 보고해도, 커스텀 도구와 강제 도구 선택을 지원하는 API라면 일관성 있는 중간 추론 텍스트가 외부화된다. 자체 모델 서빙이나 게이트웨이를 운영한다면 도구 스키마·도구 강제 선택 경로가 사실상의 추론 유출 채널이 될 수 있는지 점검해야 한다. 다른 하나는 추론 데이터의 감독 가치가 절대적이지 않다는 점이다. 가장 강한 교사 모델이 가장 압축된 트레이스를 쓰기 때문에, 그 트레이스를 그대로 증류 데이터로 쓰면 약한 학생이 재구성하지 못하는 단계가 정확히 빠져 있을 수 있다. 저자들이 제안하는 검증 가능한 예측은 압축된 트레이스를 암묵적 중간 단계까지 펼쳐 주면 약한 recipient의 활용도는 회복되고 강한 recipient는 거의 영향받지 않는다는 것이다.
한계는 저자들이 명시한다. 오픈소스 모델에서는 추출 트레이스가 실제 네이티브 CoT와 여러 지표에서 매우 유사함을 확인했지만, 네이티브 CoT를 볼 수 없는 폐쇄형 모델에 대해서는 증거가 어쩔 수 없이 행동적이다. 추출된 텍스트가 모델의 실제 내부 추론인지, 아니면 유용한 행동적 대리물일 뿐인지 판별할 수 없으며, 네이티브 트레이스와의 유사성이나 하류 유용성을 내부 계산과의 동일성으로 해석해서는 안 된다고 못 박는다. 또한 프로토콜은 커스텀 도구와 이름 지정 도구 강제 선택을 지원하는 API-as-a-service 인터페이스를 요구하므로 이런 제어가 없는 엔드포인트에는 적용 범위 밖이다. 교차 모델 재사용 실험도 파인튜닝이 아닌 인컨텍스트 재사용을 측정한 것이고 donor 트레이스가 정확성·내용·스타일에서 서로 달라 압축을 인과 요인으로 분리하지는 못한다. 윤리 항목에 따르면 모든 추출 실험은 2026년 9월 9일 이전에 공개 벤치마크와 연구자 계정만으로 완료됐고, 개인정보·독점 프롬프트·자격증명·유해 콘텐츠는 추출하지 않았으며, 관찰 내용은 OpenAI와 Anthropic 보안팀에 이메일로 보고됐다.
관련 논문
- 컴퓨터 사용 에이전트의 실행 행동을 공통 이벤트로 정규화해 런타임 안전을 판정하는 HazardAuditor컴퓨터 사용 에이전트의 위험은 생성 콘텐츠가 아니라 런타임 행동에서 나온다. 정적 프롬프트용 가드 모델과 판정만 내놓는 실행 안전 플랫폼의 한계를 지적하며, 이기종 프레임워크에 통용되는 정규화 감독 신호를 목표로 HazardAudit을 제안한다.
- 탈옥 방어 단계별 조합을 CASCADE가 통제된 공격·방어 평가로 제안한다.LLM 탈옥 방어를 입력 변형·출력 가드 등 파이프라인 단계별로 어떻게 배치하고 조합할지 체계적으로 비교한 연구다. 통제된 공격-방어 평가로 단계 내·단계 간 방어 조합을 다루는 CASCADE를 제안한다.
- 16일·8개 세계 멀티에이전트 적대적 스트레스 테스트에서 모델 정렬≠시스템안전이다상시 배포된 다중 에이전트의 실패가 메모리·도구·다른 에이전트·환경 상태로 전파되는 문제를 다룬다. 동일 조건에서 10개 에이전트로 구성된 8개 월드를 병렬로 돌리는 상시 가동 적대적 스트레스 테스트 환경 Emergence World를 제안한다.
- PACT 벤치마크는 압박 속 기업용 AI 비서의 규칙 준수를 측정한다.기업용 LLM 에이전트가 채용·의료·금융에서 시스템 규칙을 지키는지, 사용자·관리자의 압박까지 포함해 측정하는 평가 프레임워크 PACT를 제안한다. 어떤 모델이 규정을 잘 위반하는지 비교할 기준이 없던 공백을 겨냥한다.