DepthBench가 잔차 연결 설계에 따라 깊이가 실제 계산 깊이가 되는지를 측정한다
DepthBench: Measuring How Residual Connections Enable More Computational Depth
무엇인가
트랜스포머에서 깊이를 늘리는 것은 계산 용량을 키우는 자연스러운 방법이지만, 깊이가 커질수록 뒤쪽 층의 기여가 줄어드는 현상이 알려져 있다. Pre-LN 트랜스포머는 잔차 연결 덕분에 학습은 안정되지만, 모든 층이 유용한 계산을 한다는 보장은 없다. 층이 깊어지면 후반부 업데이트가 약해지거나 중복되거나 앞 층과 비슷해지면서, 명목상 깊이만 늘고 실효 계산 깊이는 늘지 않을 수 있다. LayerNorm Scaling이나 KEEL 같은 정규화 개선, AttnRes·HC·mHC 같은 잔차 경로 재설계가 제안됐지만, 이들이 정말로 늘어난 구조적 깊이를 실효 계산 깊이로 바꾸는지, 아니면 서로 다른 학습 레시피와 시스템 설정 때문에 생긴 착시인지는 분리되지 않았다. 이 논문은 그 물음을 통제된 실험으로 좁힌다.
어떻게 동작하나
제안하는 DepthBench는 깊이를 용량 배분 선택으로 취급한다. 모델 크기와 사전학습 레시피를 고정한 채 너비-깊이 비율(d_model/n_layer)만 얕고 넓은 형태에서 깊고 좁은 형태까지 체계적으로 바꾼다. 파라미터 수가 약 N ∝ 12Ld² + 2Vd로 스케일하므로, 총 파라미터를 맞추면 깊이를 늘릴수록 너비가 줄어든다. 모든 변형은 LLaMA 계열 백본 위에 올린다. 1B 미만 모델은 16헤드 MHA, RoPE, RMSNorm(ε=10⁻⁶), SwiGLU, GPT-NeoX 토크나이저(어휘 50280), untied 임베딩을 쓰고, 1.6B 모델은 Qwen3-1.7B 구성을 따라 16개 쿼리 헤드와 8개 KV 헤드의 GQA로 바꾼다. 비교 대상은 네 그룹 10개 아키텍처다. 기준선 Pre-LN, 정규화 변형(Sandwich-LN/Peri-LN, LNS, DeepNorm, KEEL), 다중 스트림 잔차(HC, mHC), 층 간 직접 접근(AttnRes, MoDA)이다. 각 비율마다 학습률을 여러 개 스윕해 최적 학습률에서의 성능을 보고하므로, 차이가 아키텍처에서 오는지 학습률 부적합에서 오는지 구분된다.
무엇과 다른가
실험은 OLMo-core로 FineWeb-Edu에서 처음부터 사전학습하며, Chinchilla 법칙에 따라 파라미터당 20토큰(400M 모델 8B 토큰, 1.6B 모델 32B 토큰)을 쓴다. 시퀀스 길이 2048, 전역 배치 512, AdamW, 웨이트 감쇠 0.1, 그래디언트 클리핑 1.0, 10% 선형 워밍업 후 코사인 감쇠다. 주 벤치마크는 400M 규모에서 7개 형태, 비율 76.0(d_model=1216, n_layer=16)부터 9.1(d_model=640, n_layer=70)까지다. 결과는 뚜렷하게 갈린다. Pre-LN은 L=16에서 검증 손실 2.759였는데 L=32에서 2.782로 오히려 나빠졌다. Sandwich-LN, LNS, DeepNorm, KEEL, MoDA도 약하거나 비단조적인 추세를 보이며 최적점이 중간 또는 얕은 형태에 머문다. 반대로 Full AttnRes는 2.751에서 2.718로, HC는 2.729에서 2.699로 깊어질수록 개선됐다. 백본 크기를 300M으로 고정한 통제 실험에서도 깊고 좁은 모델이 계속 좋아졌는데, 이는 이득이 백본 크기 증가가 아니라 너비-깊이 배분 자체에서 온다는 뜻이다. 200M~500M 여러 규모와 1.6B에서도 Full AttnRes의 추세는 유지됐다. 코딩·STEM·수학 과제의 teacher-forced NLL에서도 깊은 HC와 Full AttnRes가 더 낮은 값을 기록했고, 특히 STEM과 수학에서 일관됐다. 다만 파생 변형은 다르다. Block AttnRes는 L=20에서 2.715로 최고였다가 L=32에서 2.730으로 퇴보하고, mHC는 L=24에서 최고지만 깊이에 따른 일관된 이득이 없다.
어떻게 쓰나
층 단위 분석은 왜 이런 차이가 나는지 설명한다. 층 출력 사이의 각거리를 재면 Pre-LN, Sandwich-LN, LNS, DeepNorm, KEEL은 깊이에 따라 표현이 점점 비슷해지는데, HC와 AttnRes는 각거리가 클 뿐 아니라 깊이 방향으로 매끄럽지 않은 구조를 보이며 층마다 다른 변환을 유지한다. Block AttnRes는 블록 안에서는 매끄럽고 블록 경계에서 급변하는 패턴을 보인다. 층을 건너뛰었을 때 후속 층의 업데이트가 얼마나 달라지는지를 재는 causal score와, 두 층을 맞바꿨을 때 손실이 얼마나 나빠지는지를 재는 permutation score에서도 격차가 크다. L=32 모델에서 후반 3/4 구간의 causal score가 0.45를 넘는 비율은 Pre-LN이 약 1%인데 Full AttnRes는 약 16%, HC는 7%다. permutation score가 0.15를 넘는 비율은 Pre-LN 약 8% 대 Full AttnRes 약 46%, HC 약 35%다. 즉 HC와 Full AttnRes는 추가된 층이 기능적으로 유의미하게 남아 있고, Pre-LN 계열은 후반 층이 작고 대체 가능한 미세 조정에 그친다.
전제와 한계
파생 변형의 숨은 비용도 짚는다. Block AttnRes는 블록 크기 b가 깊이에 따라 4, 5, 6, 7, 8로 커지고 경계 수가 8로 고정되는데, 첫 블록 출력이 저장되기 전까지 depth-mixing 소프트맥스가 러닝 서밋에 거의 0의 가중치를 준다. 이 초기 죽은 구간이 L=16, 24, 32에서 각각 2, 5, 8개 층으로 늘어나, L=32 네트워크의 4분의 1이 층 쌓기의 이득을 못 받는다. mHC는 잔차 매핑을 음이 아닌 값으로 제한하고 Sinkhorn-Knopp 정규화로 이중 확률 행렬에 가깝게 만드는데, 그 결과 순방향 잔차 곱의 유효 랭크가 1.44~1.65로 HC의 2.53~2.81보다 낮아진다. 이중 확률 행렬이 균일 혼합 행렬 U=(1/m)11ᵀ를 고정점으로 갖기 때문에 반복 혼합이 스트림 방향을 수렴시켜, 층 순서 민감도가 떨어지는 것이다. 깊이 스케일링은 공짜가 아니다. 비율이 76.0에서 9.1로 갈 때 시퀀스 길이 4096, BF16, A100 40GB 기준 prefill FLOPs는 시퀀스당 약 3.0에서 4.4 TFLOPs로 늘고 KV 캐시는 2배 이상 커진다. Full AttnRes가 최대 피크 메모리를, HC가 최대 GPU-시간을 기록했다.
개발자 관점에서 이 논문의 실무적 결론은 명확하다. 파라미터 예산이 정해진 상황에서 너비를 줄이고 층을 늘리는 선택은 잔차 연결 설계에 따라 완전히 다른 결과를 낳는다. Pre-LN이나 그 정규화 변형을 쓰고 있다면 깊이를 늘리는 것은 손실만 키울 수 있으므로, 차라리 넓고 얕은 형태가 낫다. 반대로 HC나 Full AttnRes를 도입하면 극단적으로 깊고 좁은 형태까지 깊이를 스케일링 축으로 쓸 수 있다. 다만 HC는 학습률에 민감해 규모가 커지면 세밀한 튜닝이 필요하고, 깊은 모델은 순차 실행과 작은 행렬 곱셈 때문에 하드웨어 활용률이 떨어져 명목 FLOPs 이상의 지연 비용이 든다. 커널 최적화와 파이프라인 스케줄링 같은 시스템 공동 설계 없이는 이득을 실전에서 회수하기 어렵다는 점을 전제로 삼아야 한다. 저자들도 HC의 500M 최대 비율 실행에서 그래디언트 폭발이 있었고 1.6B에서는 깊이에 따른 명확한 개선이 나타나지 않았다고 밝히며, 이득이 사전학습 손실을 넘어 도메인 성능으로 전이된다는 점은 확인했지만 대규모에서의 안정성과 효율은 별도 과제로 남긴다.