LLM 파이프라인이 단계 사이 인터페이스에서 최대 40점 정확도를 잃는다
The Decomposition Tax: LLM Pipelines Lose Up to 40 Accuracy Points at Their Own Interfaces
무엇인가
여러 번의 LLM 호출을 이어 붙여 하나의 답을 만드는 멀티스테이지 파이프라인은 각 호출이 원래 문제를 얼마나 볼 수 있는지에 따라 성능이 달라진다. 이 논문은 그 차이를 '분해 세금(decomposition tax)'이라 부르고 값에 매긴다. 빌더는 파이프라인을 단계 하나씩 설계하지만 청구서는 단계와 단계 사이 인터페이스에서 도착한다는 것이 저자들의 문제 설정이다. 기존 연구는 인터페이스에서 발생하는 실패를 목록화하거나 고치는 데 집중했고, 호출 구조와 각 단계가 보는 정보를 동시에 바꿔 비용을 측정한 가장 가까운 연구도 있었다. 이 논문은 호출 구조를 고정하고 '각 단계가 무엇을 볼 수 있는가'만 바꿔 인터페이스 자체의 값을 매긴다.
어떻게 동작하나
실험 설계는 두 개의 팔(arm)로 이루어진다. strict 팔에서는 각 단계가 직전 단계의 출력만 보고, full 팔에서는 각 단계에 원래 문제를 다시 보여준다(재접지, re-grounding). 재접지는 단계 입력 앞에 'Original problem (for reference)' 헤더로 원문 문제를 붙이는 방식이며 단계 프롬프트는 바이트 단위로 동일하게 유지된다. 두 팔은 모델, 문제, 단계 수, 단계 프롬프트, 완성 토큰 예산이 모두 같고 오직 무엇을 볼 수 있는가만 다르다. 세금은 TAX = acc(full) − acc(strict)로 문항별 짝지음(paired)으로 계산한다. 특정 단계 i에 세금이 얼마나 몰리는지(incidence)는 그 단계만 재접지한 팔 g_i로 STAGE_TAX(i) = acc(g_i) − acc(strict)로 잰다. 인터페이스를 분해하기 위해 2×2 정사각형 두 개를 쓴다. 깊이 3 정사각형은 발신 단계가 무엇을 넘기는지(CONTENT: 수치와 질문만 압축 vs '그들 사이에 서술된 모든 관계'까지 보존)와 어떻게 쓰는지(FORM: 구조화된 목록 vs 산문 재서술)를 교차한다. 깊이 4 정사각형은 발신 단계의 지시 전체(EDGE)와 수신 단계가 무엇을 할 수 있는지(RECEIVER: 계산식만 출력하는 committed vs 단계별로 다시 유도하는 re-deriving)를 교차한다. 혼합 순서 파이프라인 MIX_LR과 MIX_RL은 손실 있는 인터페이스를 각각 앞과 뒤에 두어 인터페이스와 단계 위치를 분리한다. 통계는 짝지은 McNemar 정확 검정과 부트스트랩 구간을 쓰고 주장을 family별로 Benjamini-Hochberg FDR과 Holm으로 중복 보정한다. primary family는 A_asset, B_asset, 깊이 3 정사각형의 압축-목록 파이프라인의 full 대 strict 탐욕(greedy) 비교 118개 검정이다.
무엇과 다른가
실험은 9개 기관의 오픈웨이트 모델 21개(1B~24B), GSM-Hard와 MATH-500, 셀당 n=200 짝지은 문항, 온도 0, 로컬 실행으로 수행됐다. primary family에서 가장 큰 세금은 gemma-3-12B의 MATH-500 A_asset으로 +0.4050(40.5점)이었고 Holm 보정 p = 1.66e-19였다. 118개 primary 검정 중 70개가 Benjamini-Hochberg 보정을, 54개가 Holm을 통과했다. A_asset에서 부트스트랩 구간이 0을 배제한 모델은 MATH-500에서 20개 중 17개, GSM-Hard에서 20개 중 16개다. headline 셀에서 gemma-3-12B는 strict 팔 15.0%, full 팔 55.5%였고 같은 모델의 단일 호출(monolith)은 79.5%였다. 단일 호출이 strict 파이프라인을 0.05 넘게 앞서는 322개 셀에서 재접지는 격차의 중앙값 63%(A_asset에서는 65%)를 되돌렸다. 세금의 정체가 '사라진 문제'라는 증거로, GSM-Hard에서 문제의 단어를 최대 한 개만 남기고 ___로 바꾼 placebo(레이아웃과 단어 수는 유지하고 재접지가 추가하는 토큰의 최소 60%를 담음)는 세 모델에서 −0.0100/−0.0050/−0.0100으로 아무것도 회복하지 못했다. Qwen2.5-7B에서 샘플링 20개 시드는 +0.3922로 탐욕 +0.3800과 비슷했고 두 번째 GPU 아키텍처에서는 +0.3850 대 +0.3800이었다. 예산 스윕은 MATH-500에서 세금을 최대 0.055만 움직였고 문제의 절반만 재접지하면 거의 회복되지 않았다. full 팔은 strict 팔보다 중앙값 1.17배 토큰을 읽는다.
어떻게 쓰나
단계 하나의 지시문이 세금을 크게 바꾼다. gemma-3-12B의 MATH-500 깊이 3 정사각형에서 세금은 보존-산문 +0.0450, 보존-목록 +0.0700, 압축-산문 +0.1150, 압축-목록 +0.3650으로 같은 파이프라인 안에서 4.5점에서 36.5점까지 움직였다. 9개 모델 평균은 CONTENT +0.0628(9개 중 9개 양수), FORM +0.0517(9개 중 7개 양수), 상호작용 +0.0550이었다. 출력이 목록일 때 '그들 사이에 서술된 모든 관계'를 남기라고 지시하면 MATH-500에서 9개 중 9개 모델, GSM-Hard에서 4개 중 3개 모델의 세금이 낮아졌고 gemma-3-12B는 36.5점에서 7.0점으로 떨어졌다. 깊이 4 정사각형에서는 압축 edge가 GSM-Hard 11개 중 11개, MATH-500 11개 중 10개 모델에서 세금을 올렸고 committed receiver도 각 벤치마크에서 11개 중 10개 모델에서 올렸다. 수학 어휘를 모두 빼고 다시 써도 세금은 남았다(gemma-3-12B +0.4500 대 어휘 사용 시 +0.3550). 답 추출 문제도 아니다. MATH-500 172개 셀 중 157개에서 parse_rate가 1.000이었고 최악이 0.9550인데 gemma-3-12B의 목록 대 산문 격차는 25점이었다. 수리 위치에 대해서는 손실 있는 인터페이스가 하나일 때 그 뒤 단계를 재접지하는 것이 앞 단계를 재접지하는 것보다 두 벤치마크 모두에서 7개 중 7개 모델에서 우세했다. MATH-500에서는 앞 단계 재접지가 아무것도 안 하는 것보다 나쁜 경우가 7개 중 7개(0.005~0.070 악화, 양측 부호검정 p = 0.016)였고 GSM-Hard에서는 7개 중 3개였다. gemma-3-12B에서 1단계만 재접지하면 −0.0250, 2단계만 재접지하면 모든 단계를 재접지한 +0.2500 중 +0.2350을 회복했다.
전제와 한계
최신 모델도 세금을 낸다. 2026 코호트(테스트한 가장 새 모델 3개)는 MATH-500 A_asset에서 모두 Benjamini-Hochberg를 통과했다. gemma-4-12B +0.3700(Holm p = 8.68e-17, 단일 호출 0.865 대 strict 0.450), gpt-oss-20B +0.2250(0.815 대 0.555), Granite-4.1-8B +0.1000(0.710 대 0.555)이다. 4096 토큰 예산으로 맞추면 2026 코호트 평균 세금은 +0.2317로 2024 코호트의 +0.3383보다 0.1067 낮다. 다만 MATH-500에서 세금의 구성은 바뀐다. 2024 코호트는 깊이 4 edge 요인이 +0.1241로 receiver의 +0.0703을 앞섰지만 gemma-4-12B는 receiver +0.1425 대 edge +0.0125로 순서가 뒤집힌다. 저자들이 등록했던 코호트 간 구조 불변 가설은 두 검정 모두 실패했고, 이후 구성은 세대별이지만 수리는 아니라는 예측을 등록해 수리 테스트가 세 모델 모두에서 통과했다. 또한 인터페이스 유형과 수신자 유형으로 비용을 지불하는 단계를 예측하는 더 강한 규칙은 밀봉된 held-out 테스트에서 반박됐다(불일치 4개 예측 중 3개 패배, 1개 무효). 대신 압축 인터페이스 뒤의 re-deriving 단계도 여전히 비용을 낸다는 경쟁 규칙이 4개 중 4개 모델에서 유지됐다.
실무적으로 이 논문이 주는 처방은 두 가지다. 첫째, 손실 있는 인터페이스 뒤에 오는 단계에 원래 문제를 다시 보여줘라. 직관과 반대로 손실 이전 단계를 재접지하는 것은 MATH-500에서 아무것도 안 하는 것보다 나쁠 수 있다. 둘째, 어떤 단계가 수치를 목록으로 나열해야 한다면 '그들 사이에 서술된 모든 관계'를 함께 남기라고 지시하라. 목록 형식 자체가 산문보다 비쌀 수 있고 압축과 목록이 겹칠 때 비용이 가장 커진다. 파이프라인을 단계별로 최적화하면서 각 단계 프롬프트만 만지고 있다면 단계 사이에서 무엇이 잘려 나가는지를 먼저 측정하는 편이 낫다. 저자들은 이 결과가 더 많은 단계나 샘플링으로 정확도를 쫓는 대신 더 싼 인터페이스 선택으로 정확도를 되찾는 쪽이라며 컴퓨트를 늘리기보다 줄일 가능성이 크다고 본다.
저자들이 명시한 한계는 분명하다. 처방은 수학적 추론 벤치마크 두 개(GSM-Hard, MATH-500)와 고정된 파이프라인 계열에서 측정된 것이며 검색, 계획, 코드, 도구 사용 파이프라인으로 전이된다는 보장이 없다. 깨끗하게 측정할 수 있었던 비수학 과제 하나에서는 세금이 2개 모델의 4개 짝지음 비교 모두에서 더 작았는데 저자들은 이를 결과가 아니라 방향 정도로 취급한다. 목록이 하위에서 기계 파싱되는 상황에서 산문을 권하는 것도, 40.5점이라는 수치가 비수학 파이프라인에 그대로 적용된다고 가정하는 것도 증거 범위를 넘는 외삽이다. 또한 OLMo-2-13B는 컨텍스트 창이 짧아 완성 예산이 작아 A_asset 집계에서 빠졌고, 4개 GPU 유형 중 등록된 교차 아키텍처 통제는 Ada 한 종류만 덮는다. 재현성 측면에서 모든 예측은 채점 전에 날짜가 찍힌 파일로 등록됐고 원고의 모든 4자리 수치는 스크립트 출력으로 추적되며 1,025개 결과 파일이 각 셀의 실행 조건과 함께 남아 있다.