소프트맥스 어텐션의 두 결손, 기권과 잡음 필터링을 분리해 측정한 연구

Abstention and Noise Filtering: Two Missing Primitives of Softmax Attention

arXiv2609.22005v1

Richard Zhe Wang2026-09-18조회 4

무엇인가

소프트맥스 어텐션에는 두 가지 구조적 결손이 있다는 것이 이 논문의 출발점이다. 첫째, 어텐션 가중치는 합이 1이어야 하므로 헤드가 아무것도 출력하지 않기가 불가능하다. 읽을 만한 위치가 없어도 전체 어텐션 질량을 어딘가에 배분해야 하고, 모델은 보통 첫 토큰에 그 질량을 쌓아두는 어텐션 싱크를 만들어 보상한다. 둘째, 밸류 경로가 끝에서 끝까지 선형이라서 읽어들인 내용이 신호든 간섭이든 같은 충실도로 집계된다. 특징들이 중첩(superposition)되어 있는 잔차 스트림에서는 어떤 위치의 읽기가 헤드가 찾는 특징을 전혀 담고 있지 않아도 존재하는 모든 특징의 간섭이 조금씩 섞여 들어온다. MLP 뉴런은 임계 비선형성으로 이런 간섭을 제거하지만 밸류 경로에는 그런 장치가 없다. 저자들은 이 두 결손을 각각 기권(abstention)과 잡음 필터링(noise filtering)이라는 두 개의 빠진 프리미티브로 이름 붙이고, 최근 밸류 게이팅 연구들이 왜 도움이 되는지에 대한 기존 설명들이 서로 엇갈리는 이유가 바로 이 두 가지를 구분하지 않았기 때문이라고 주장한다.

어떻게 동작하나

저자들은 두 능력을 각각 직접 구현하는 별도의 메커니즘을 만들어 분리 측정한다. 기권은 헤드별로 학습되는 싱크 로짓(sink logit)으로 공급한다. 이는 학습 가능한 로짓과 정확히 0으로 고정된 밸류를 가진 유령 키(phantom key)로, 소프트맥스 분모에 exp(b_h)를 더하는 형태이며 b_h는 헤드마다 하나씩 0으로 초기화된다. 기권 여부를 쿼리가 결정하고, 기권된 질량은 출력에 정확히 아무것도 기여하지 않는다. 필터링은 각 밸류 읽기에 게이트를 걸어 공급하는데 두 가지 형태를 쓴다. 놈 게이트는 읽기 벡터의 노름에 시그모이드를 적용한 것으로 g_j = σ(β(‖v_j‖/√d − τ_h)), β=8 고정, τ_h는 헤드별 학습 임계값이며 초기값 −4/β로 초기화해 학습 시작 시 g_j ≥ 0.98이 되게 하고 가중치 감쇠에서 제외한다. 회전 불변이라 밸류 기저의 특정 좌표를 골라낼 수 없기 때문에, 필터링 자체가 도움이 되는지 판정하는 도구로 적합하다. 프로젝션 게이트는 읽기의 학습된 선형 함수에 시그모이드를 적용한 g_j = σ(w_h^T v_j + b_h)로, w=0, b=4로 초기화하고 두 파라미터 모두 가중치 감쇠에서 제외한다. 방향 선택적이라 읽기가 밸류 공간에서 가리키는 방향에 따라 통과와 차단을 달리한다. 대조군으로 같은 게이트 신호를 소프트맥스 안에 log g_j 가산 편향으로 넣는 라우팅 슬롯 대조군(renorm)을 둔다. 논문의 보조정리 3.1은 스칼라 게이트가 집계와 교환 가능함을 보여, 밸류 슬롯 게이팅이 라우팅 슬롯 게이팅에 쿼리별 인자 Z_i ≤ 1을 곱한 것과 정확히 같다고 말한다. 즉 밸류 게이트는 라우팅 게이트에 부분적 제로 옵션을 더한 것이고, 이 Z_i 항이 두 슬롯의 차이다. 또한 g_j가 읽기 v_j에만 의존하므로 게이트된 읽기를 한 번 계산해 KV 캐시에 저장할 수 있어 생성 비용이 변하지 않는다. 결합 arm은 싱크 로짓과 놈 게이트를 함께 쓰는 combo, 싱크 로짓과 프로젝션 게이트를 함께 쓰는 combo2다. 싱크 로짓이 정확한 기권을 이미 공급하므로, 결합 arm과 싱크 로짓 arm의 차이가 기권을 고정한 상태에서 측정한 필터링 효과가 된다. 비교를 위해 오프바이원(소프트맥스 분모에 1을 더함)과 싱크 토큰(학습된 추가 토큰, 밸류가 0으로 고정되지 않아 기권이 근사적이며 잔여 내용이 누출되는 정확성 부담이 있음) arm도 훈련한다.

무엇과 다른가

실험은 FineWeb-Edu 웹 텍스트 코퍼스에서 네 개 티어(비임베딩 파라미터 약 10M, 50M, 124M, 350M, 토큰 예산 0.2B, 0.95B, 1.6B, 5.8B)의 매칭 모델을 처음부터 훈련한다. 같은 티어의 모든 arm은 아키텍처, 데이터 순서, 옵티마이저, 스케줄을 공유하고 어텐션 메커니즘만 다르다. 작은 세 티어는 arm당 3개 시드, 350M은 arm당 1개 시드이며, 모든 효과는 같은 시드를 공유하는 두 arm의 쌍별 차이로 보고한다. 첫 번째 발견은 기권의 이득은 모델이 커질수록 줄고 필터링의 이득은 커진다는 것이다. 10M에서 싱크 로짓은 베이스라인 대비 0.0185 nats를 개선하고 오프바이원은 0.0160을 개선하는 반면, 놈 게이트는 0.0037에 그치고 라우팅 슬롯 대조군은 오히려 +0.0017 nats로 도움이 되지 않는다. 보조정리 3.1에 따르면 놈 게이트와 그 대조군의 차이는 Z_i 인자뿐이므로, 이 규모에서 놈 게이트의 작은 이득은 전부 그것이 나르는 부분적 제로 옵션이다. 제로 옵션 증분(싱크 로짓의 베이스라인 대비 개선)은 10M 0.0185에서 50M 0.0068, 124M 0.0052, 350M 0.0013으로 떨어진다. 필터링 증분(결합 arm의 싱크 로짓 대비 개선)은 놈 게이트로 10M 0에서 0.0030, 0.0036, 0.0074로 오르고, 프로젝션 게이트로는 0.0036, 0.0065, 0.0054, 0.0114다. 두 곡선은 50M과 124M 사이에서 교차하고, 350M에서 필터는 제로 옵션의 5~9배를 기여한다. 싱크 로짓 모델이 유령 키에 배분하는 어텐션 질량 비중은 10M 13%에서 350M 53%로 늘어, 기권에 대한 수요는 규모와 함께 커지는데도 그것을 공급해서 절약되는 손실은 줄어든다. 훈련된 모델 분석이 이를 설명한다. 124M 베이스라인은 전체 어텐션 질량의 6.0%를 첫 키 위치에 쌓고 그 위치의 읽기 노름은 보통 읽기의 0.42배인데, 싱크 로짓 모델은 위치 0의 질량이 0.5%로 줄고 노름 비율이 0.99로 회복된다. 350M에서 베이스라인은 11%를 위치 0에 두고 노름 비율 0.36인 반면, 싱크 로짓 모델은 0.7%, 0.98, 유령 키에 53%를 둔다. 큰 베이스라인일수록 싱크를 더 무겁고 정확하게 만들어 모방하므로, 내장 메커니즘이 절약하는 손실이 줄어든다. 놈 게이트는 위치 0 질량 3.7%, 노름 비율 0.65로 베이스라인이 스스로 만든 싱크를 거의 그대로 남겨둔다. 키별 게이트는 쿼리에 접근할 수 없어 기권을 대체할 수 없기 때문이다. 싱크 토큰은 밸류가 학습되므로 잔여 내용이 누출되어 10M에서 싱크 로짓의 이득 대부분을 잃는다(0.0025 대 0.0185 nats).

어떻게 쓰나

두 번째 발견은 두 이득이 가산적이라는 것이다. 싱크 로짓 유무와 게이트 유무를 교차한 2×2 비교에서 두 단독 이득의 합이 함께 쓸 때의 이득을 초과하는 부분(중복)은 모든 티어와 두 형태에서 0.0024~0.0076 nats로 작다. 10M에서는 중복이 놈 게이트 단독 이득 전체 이상이고 프로젝션 게이트 단독 이득의 3분의 2에 해당하지만, 124M에서는 둘 중 어느 것의 절반에도 못 미친다. 즉 작은 규모에서 단독 게이트가 얻는 것의 대부분은 그것이 나르는 기권이고, 모델이 커질수록 그 비중이 줄어든다. 프로젝션 게이트의 필터링 기여는 모든 티어에서 놈 게이트를 앞선다(10M 0.0036 대 −0.0008, 50M 0.0065 대 0.0030, 124M 0.0054 대 0.0036, 350M 0.0114 대 0.0074). 두 프리미티브를 모두 가진 arm이 모든 규모에서 최선이며, combo2가 10M, 50M, 124M, 350M에서 각각 4.1897, 3.5266, 3.3604, 3.0210 nats로 최저 검증 손실을 기록하고 모든 티어의 모든 쌍별 시드에서 싱크 로짓을 개선한다. 세 번째 발견은 주입 실험에서 나온다. 평가 시점에 모든 arm에 동일하게, 헤드별 중위수 또는 25퍼센타일 미만 노름의 조용한 읽기를 골라 중위 읽기 노름으로 스케일링한 정크 벡터를 복용량 ε ∈ {0.2, 0.4, 0.8, 1.6}로 더한다. 주 조건인 구조적 정크는 다른 시퀀스의 무작위 위치에서 이식한 밸류 읽기다. 124M, 25퍼센타일 컷오프에서 베이스라인은 ε=0.4에서 0.11 nats, ε=0.8에서 2.6 nats 손실이 늘어나는데, 싱크 로짓, 프로젝션 게이트, 결합 arm은 ε=0.4에서 베이스라인 피해의 10분의 1에서 3분의 1만 겪는다. 정크의 구조가 중요하다. 124M 중위 컷오프에서 ε=0.4의 구조적 정크는 베이스라인에 0.48 nats를 물리지만 같은 노름의 가우시안 정크는 0.035 nats만 물려 14배 차이가 난다. 노출 회계도 흥미롭다. 124M에서 베이스라인은 가장 조용한 4분의 1 읽기에 질량의 37%를 두는데, 싱크 로짓은 유령 키에 35%를 두고 노출이 18%로 떨어져 오염된 재료의 절반가량을 더 이상 읽지 않는다. 프로젝션 게이트는 유령 없이도 노출을 22%로 줄이고, combo2는 노출 19%, 유령 질량 24%를 가진다. 놈 게이트는 노출이 44%로 베이스라인보다 높다. 라우팅이 계속 조용한 읽기에 질량을 두고 제거를 게이트에 맡기기 때문이다. 고복용량에서 두 게이트 형태의 맹점이 드러난다. 놈 게이트는 크기에서 실패한다. 구조적 정크 ε=0.8에서 4.4 nats를 잃어 베이스라인의 2.6보다 나쁘고, ε=1.6에서는 6.8 대 4.9로 역전된다. 노름 임계값은 작은 읽기를 약화시키므로 임계값 위로 읽기를 끌어올릴 만큼 큰 정크는 그대로 통과한다. 프로젝션 게이트는 방향에서 실패한다. 무작위 방향 주입에서는 ε=0.4에서 0.05 nats, ε=0.8에서 0.29 nats만 잃지만, 자신의 학습된 게이트 방향 w_h를 따라 주입하면 0.56과 4.8 nats로 11배, 17배 더 잃는다. 모든 필터는 자신의 결정 변수를 따라 맹목적이라는 원리다. 350M에서 combo2는 ε=1.6에서 1.1 nats만 잃어 베이스라인의 5.9 nats와 대비된다.

전제와 한계

실무적으로 이 논문이 주는 설계 지침은 명확하다. 어텐션 헤드에는 헤드별 학습 싱크 로짓으로 제로 옵션을 주고(레이어당 H개 파라미터), 각 밸류에 프로젝션 게이트를 달아 필터를 주는 것(레이어당 H(d+1)개 파라미터)이 논문이 권하는 조합이다. 파라미터 증가는 0.01% 미만이고, 게이트가 읽기에만 의존하므로 KV 캐시와 호환되어 생성 비용이 변하지 않는다. 또한 밸류 게이트를 쓸 때 왜 좋아지는가를 규모에 따라 다르게 봐야 한다. 10M급 소형 모델의 소거 실험에서 게이트 이득이 좋게 나와도 그것은 대부분 기권 효과일 수 있고, 350M 이상에서는 필터링이 주된 기여가 된다. 게이트 형태를 고를 때는 결정 변수 방향의 맹점을 확인해야 한다. 놈 게이트는 큰 정크에 취약해 베이스라인보다 나빠질 수 있으므로, 자연 발생 정크에 대한 견고성과 최저 손실을 원하면 프로젝션 게이트가 낫다. 또한 키별 게이트는 어텐션 싱크를 없애지 못한다는 점, 즉 기권은 쿼리 조건부 결정이라 키별 메커니즘으로는 대체할 수 없다는 점을 기억해야 한다.

저자들이 밝힌 한계는 다음과 같다. 350M 결과는 arm당 시드 1개에서 나온 것이며, 그 티어의 필터링 증분은 124M에서 관측된 시드 산포의 몇 배지만 제로 옵션 증분은 그 안에 들어간다. 베이스라인과 싱크 로짓 쌍의 두 번째 시드가 훈련 중이다. 모든 모델은 FineWeb-Edu 한 코퍼스에서 적당한 토큰 예산으로 훈련됐다. 보고된 효과 크기는 수천분의 1 nat 수준으로, Zhao 등(2026)이 대부분의 아키텍처 수정이 더 큰 모델로 전이되지 않는다고 관측한 영역에 있다. 시드 잡음은 쌍별 비교로 통제했지만 350M 이상으로의 전이는 시험하지 않았고 처리량 측정도 보고하지 않는다. 방향 맹점은 적대적 구성으로 확립한 것이며, 자연 입력이 헤드의 학습된 게이트 방향에 얼마나 자주 근접하는지는 측정하지 않았다. 124M에서 LAMBADA, HellaSwag, WikiText-2 제로샷 평가가 손실 결과와 방향상 일치한다는 점은 별도로 보고된다.