한 번의 학습으로 20개 깊이 모두를 서빙하는 Telescopic Language Model

Telescopic Language Models

arXiv2609.35769v1

Zhilin Guo2026-09-28조회 3

무엇인가

언어 모델은 온디바이스 어시스턴트부터 데이터센터 엔드포인트까지 지연·연산 예산이 수십 배 차이 나는 환경에 배포된다. 지금은 이 범위를 감당하려면 예산마다 별도 모델을 학습하거나, 큰 모델을 사후 압축하고 품질 손실을 감수해야 한다. 전자는 M개 운영점에 M번의 전체 학습을, 후자는 같은 크기로 네이티브 학습한 모델보다 뒤처지는 결과물을 낳는다. 중첩 용량 캐스케이드(nested-capacity cascade)는 이를 한 번의 학습으로 해결하겠다고 약속하지만, 기존 구현인 Matryoshka Language Model Suites(MLMS)는 3개의 고정 exit만 감독한다. 이 논문은 그 약속이 왜 지켜지지 않았는지를 진단하고, 아키텍처가 아니라 목적함수를 바꿔 해결한다.

어떻게 동작하나

제안 방법인 Telescopic Language Model(TLM)은 MLMS 아키텍처를 그대로 쓴다. 캐스케이드는 폭이 엄격히 증가하는 Llama 스타일 서브모델 M개를 순서대로 쌓은 구조로, 각 서브모델은 이전 서브모델의 출력에 공유 입력 임베딩의 새 슬라이스(넓어진 채널)를 결합해 입력받고, 자체 최종 RMSNorm과 공유 어휘에 대한 LM head를 갖는다. 따라서 캐스케이드의 모든 프리픽스가 그 자체로 독립된 언어 모델이다. F_k(x;θ)를 k번째 블록까지 실행한 뒤 해당 서브모델의 최종 norm과 head를 적용한 로짓이라 하면, F_N이 전체 모델이다. MLMS는 블록 경계에 해당하는 고정 exit 격자 k∈{k1,…,kM}에서만 교차엔트로피와 증류 손실을 합산해 감독하기 때문에, 그 사이 깊이의 프리픽스는 학습되지 않고 퍼플렉서티 10^2~10^5로 붕괴한다.

무엇과 다른가

TLM의 목적함수는 매 최적화 스텝마다 같은 마이크로배치에 대해 정확히 두 번의 순전파·역전파를 수행한다. 하나는 깊이 분포 π에서 무작위로 뽑은 프리픽스 k~를 전체 다음 토큰 타깃 y에 대해 평가하는 확률적 프리픽스 패스(λ=1)이고, 다른 하나는 전체 모델 F_N을 같은 배치에 대해 평가하는 전체 앵커 패스(γ=1)다. 기본 설정은 깊이 전체에 균등한 π이며, 이는 k=1을 포함한 모든 프리픽스를 학습하는 유일한 샘플러다. 두 패스는 트렁크에 비대칭적으로 작용한다. 블록 j는 매 스텝 앵커 그래디언트를 받지만 프리픽스 그래디언트는 k~≥j일 때만 받으므로, 얕은 블록이 더 자주 업데이트된다. 추론 시에는 아무 깊이 k에서 잘라 그대로 쓰면 되고 추가되는 것이 없다. 논문은 로그균등 샘플러(k=⌈N^u⌉, p(k)≈1/k, 평균 k≈6.9, k=1은 사실상 미샘플링)와 MLMS의 exit에만 질량을 둔 exit-grid 샘플러도 비교한다. 선택적 증류 항도 실험했지만 방법은 그것에 의존하지 않는다.

어떻게 쓰나

실험은 200M Matryoshka 프록시 스위트(블록 11@320 + 5@576 + 4@960, head_dim 64, SmolLM2 토크나이저, 어휘 49,152)를 FineWeb-Edu 20B 토큰으로 학습하며, 모든 방법이 동일한 데이터 스트림을 소비한다. 시퀀스 길이 2048 패킹, AdamW(β=0.9/0.95), 피크 학습률 4e-4, WSD 스케줄, 글로벌 배치 512×2048, bf16, seed 42로 고정했다. 결과는 균등 π TLM이 20개 레이어 프리픽스 전부에서 유효한 언어 모델임을 보인다. 퍼플렉서티는 k=1의 81에서 k=20의 15까지 매끄럽게 감소하고 k≥2에서 56을 넘지 않는다. 반면 MLMS는 학습된 3개 exit에서만 유효하며 off-exit 퍼플렉서티가 10^2~10^5에 이른다(k=5: 1,412, k=1: 438,883, 어휘 확률 수준은 49,152). AULB(품질-예산 곡선 아래 면적)는 MLMS 4개 스위트의 5.73~5.90에서 TLM 3.28로 43~44% 줄었다. 배포 프론티어 지표인 LODA는 정확도 기준 38.9 대 21.8(1.8배), 퍼플렉서티 기준 47.3 대 27.8로 앞선다. 이는 구조적 우위로, MLMS의 최소 exit(50M) 아래 구간에서 MLMS는 유효 모델을 전혀 제공하지 못하는 반면 TLM은 10개 운영점을 더 제공한다. 전체 용량에서는 균등 TLM이 14.99로 MLMS의 14.96~15.42 범위 안에 들어 사실상 동등하고, exit-grid 팔은 14.65까지 내려가 독립 학습한 바닐라 트윈(13.98)과의 격차를 MLMS의 7.1%에서 4.8%로 약 3분의 1 줄인다.

전제와 한계

비용과 트레이드오프도 명시적이다. 증류를 끈 동일 조건에서 균등 TLM 한 번은 131 GPU-시간으로, 증류 없는 MLMS 스위트 149보다 약 12% 싸고, 바닐라 3-모델 스위트 216보다 1.7배 저렴하다. 로그균등은 120, exit-grid는 147 GPU-시간이다. 대신 MLMS는 전체 크기 아래 두 학습 exit에서 우위를 유지한다(50M에서 21.89 대 24.38, 100M에서 17.47 대 19.11). 이는 3개 exit 대신 20개 프리픽스에 감독을 분산한 대가이며, π를 exit 쪽으로 옮기면 그 지점 품질을 되찾는 대신 연속성이 사라진다(exit-grid의 k=5는 2,693으로 붕괴). 즉 샘플링 밀도는 벽이 아니라 다이얼이고, 운영점은 아키텍처가 아니라 학습 시점의 선택이 된다. 어블레이션은 각 요소의 역할도 분리한다. 앵커를 제거하면 200M 퍼플렉서티가 22.32로 오르고(AULB는 3.41로 거의 불변), 로그균등에서 k=1은 학습되지 않아 6,740으로 붕괴하며, head만 사후 보정하는 구조 구제는 k=5를 177까지 회복시키지만 TLM의 학습된 프리픽스보다 약 6배 뒤처진다.

개발자 관점에서 이 논문이 주는 실무적 판단 기준은 명확하다. 배포 예산이 여러 개이고 그중 일부가 사전에 확정되지 않았다면, 한 번의 학습으로 20개 깊이를 모두 커버하는 TLM이 유리하다. 반대로 예산이 소수이고 미리 알려져 있다면 저자들 스스로 "크기별 개별 학습이 올바른 도구"라고 말한다. 세 개의 트윈을 따로 학습하는 비용은 총 216 GPU-시간이고 지점별 품질이 가장 좋다. 또한 이 논문의 이득은 지연·처리량 축에서 측정된 것이며, 파라미터 수 축에서는 프리픽스가 임베딩과 head를 공유하기 때문에 연속성의 이점이 줄어든다. 서빙은 요청 단위로 깊이를 고정하므로, 한 생성 안에서 깊이를 바꾸려면 레이어를 넘나드는 KV 캐시 절단·확장이 필요하고 이는 이 논문이 다루지 않은 시스템 문제다.

저자들이 밝힌 한계는 다음과 같다. 증거는 FineWeb-Edu 위 200M 프록시 규모에 한정되고, 팔당 시드가 하나다(두 개의 주요 TLM 팔에 대해서만 두 번째 시드를 돌렸고, 짝지은 부트스트랩 신뢰구간이 주요 격차를 뒷받침한다). 중첩·탄성 학습은 100M에서 수십억 파라미터까지 검증된 바 있지만, 여기서 보고한 피크-연속성 분리가 8B~70B에서도 유지되는지는 열린 질문이다. MLMS는 전체 크기 아래 두 학습 exit에서 여전히 우위를 가지며, 이는 커버리지의 예상된 대가다. 프론티어는 고정 폭에서 깊이 축만 훑었고, 폭, 3B 규모, 추측 디코딩이 다음 단계로 남아 있다.