학습 가능한 입력 임베딩 테이블 없이도 1.7B 언어모델이 작동한다

Do Language Models Need a Trainable Input Embedding Table? Fixed Minimal Token Codes at 1.7B-Class Scale

HF Daily2610.04002

A. Bochkov2026-10-02

무엇인가

신경망 언어모델은 입력 심볼을 구분해야 하지만, 그 구분을 심볼마다 독립적으로 학습되는 벡터로 표현할 필요는 없다. 이 논문은 그 필요성을 세 질문으로 분해한다. 첫째 정체성(입력 인터페이스가 어떤 토큰이 관측됐는지 보존하는가), 둘째 학습 가능성(공유 네트워크가 그 인터페이스로부터 유용한 언어 계산을 배울 수 있는가), 셋째 유용성(토큰별 입력 벡터를 독립적으로 적응시키는 것이 결과 모델을 개선하는가). 단사 코드는 첫 질문만 답하며 나머지 둘은 실증이 필요하다는 것이 저자들의 출발점이다. 이 구분은 임베딩 압축을 넘어선다. 학습 테이블에서는 입력 좌표와 그 위의 계산이 함께 변하지만, 고정 인터페이스에서는 좌표가 변하지 않으므로 어휘·문맥 표상이 어떻게 구성되는지 통제된 조건에서 관찰할 수 있다.

어떻게 동작하나

실험은 같은 토크나이저, 같은 문맥 백본, 같은 untied 출력 헤드, 같은 학습 레시피를 쓰는 디코더 전용 모델 3개를 처음부터 학습한다. 목표 예산은 모델당 100B 예측 토큰이다. 백본은 24개 디코더 블록, 히든 폭 2048, 어텐션 헤드 32개, RoPE, RMSNorm, SwiGLU, FFN 중간 폭 8192, 문맥 길이 2048이며 어텐션·FFN 투영은 바이어스 없음, 드롭아웃 0, 출력 어휘 투영은 untied다. 입력 인터페이스만 바뀐다. 첫째는 통상적인 학습 테이블 E_in ∈ R^(V×d)이다. 둘째는 토큰 ID의 리틀엔디언 이진 전개로 만든 정규 16비트 코드다. 어휘 49,152개이므로 K = ceil(log2 V) = 16비트다. 셋째는 같은 코드에 GF(2) 위의 가역 선형 재부호화를 적용한 Ã(t) = A c(t) mod 2이며, A는 GL(16,2)에서 시드 12345로 한 번 생성하고 모든 행·열의 최소 해밍 가중치를 4로 제한한다. 구현은 아핀 오프셋을 지원하지만 평가 설정은 b=0이다. 고정 코드는 16×16 단위행렬을 128번 쌓은 행렬 R로 폭 2048까지 반복되며, 추가 학습 입력 투영은 없다. 두 고정 구현 모두 V×16 코드북을 상주 버퍼로 저장하므로 저자들은 이를 '학습 가능한 입력 테이블이 없다'고 표현하지 '룩업이 없다'고 표현하지 않는다. 출력 헤드는 모든 모델에서 어휘 크기의 학습 가능한 행렬로 남는다.

무엇과 다른가

데이터는 HuggingFaceTB/smollm-corpus의 fineweb-edu-dedup 성분이며 234개 소스 Parquet 샤드를 전부 처리하고 Cosmopedia 혼합은 쓰지 않는다. 문맥 길이 2048에서 최소 2049토큰 이상인 문서만 대상으로 하고, 문서 식별자의 시드 해시로 학습·검증을 나눈다(검증 임계값 0.001). 이 절차는 복원 추출이므로 전체 코퍼스 토큰에 대해 균등하지 않고, 보고된 토큰 예산은 중복·겹침 창을 포함한 처리된 예측 타깃 수다. 최적화는 AdamW, 피크 학습률 1.5e-4, 최소 1e-5, 워밍업 2000 업데이트, 베타 (0.9, 0.95), 엡실론 1e-8, 행렬 파라미터 가중치 감쇠 0.01(1차원 파라미터는 0), 최대 382,500 업데이트에 걸친 선형 워밍업 후 코사인 감쇠, 그래디언트 노름 클리핑 1.0이다. 학습은 FP32 가중치에 BF16 autocast와 그래디언트 체크포인팅을 쓴다. GPU 2장, GPU당 시퀀스 8개, 그래디언트 누적 8스텝으로 옵티마이저 업데이트당 전역 예측 타깃은 2×8×8×2048 = 262,144개다. 인터페이스당 학습 실행은 단 한 번이다.

어떻게 쓰나

결과는 가능성과 비용을 함께 보여준다. 정규 이진 코드 모델은 HellaSwag 정규화 정확도 52.40%, PIQA 70.51%, LAMBADA 42.75%를 기록했고, GF(2) 재부호화 모델은 각각 51.44%, 71.16%, 42.29%로 같은 범위에 들었다. 둘 다 WikiText에서 쓸 만한 코퍼스 우도를 낸다. 반면 학습 입력 대조군은 HellaSwag와 LAMBADA를 포함한 여러 평가에서 더 좋았다. 저자들은 이 수치를 성능 동등성이 아니라 실현 가능성의 증거로 규정한다. 고정 인터페이스는 학습 가능한 파라미터 1억 7백만 개(100.7M)를 제거해 모델을 1.711B 파라미터로 만든다. 다만 저자들은 파라미터 감소가 이 연구의 핵심 결과가 아니라고 못 박는다. 한계도 분명하다. CommonsenseQA 정확도는 세 모델 모두 약 20%, MMLU는 두 샷 설정 모두 약 25~26%로 균등 선택 기준선에 가깝다. 외부 참조로 같은 로컬 프로토콜에서 평가한 SmolLM2-135M, 360M, 1.7B가 있는데, 정규 코드의 HellaSwag 52.40%는 SmolLM2-135M의 43.02%와 SmolLM2-360M의 56.28% 사이에 놓인다. SmolLM2-1.7B는 보고된 스위트에서 훨씬 강하다. SmolLM2 세 모델의 학습 예산은 각각 약 2T, 4T, 11T 토큰으로, 저자들은 이를 고정 코드의 효율성 주장으로 환산해서는 안 된다고 강조한다.

전제와 한계

개발자 관점에서 이 논문이 주는 실무적 메시지는 임베딩 테이블이 쓸모없다는 것이 아니라 유용함과 필수임은 다른 주장이라는 구분이다. 어휘 경계의 파라미터 할당은 이미 아키텍처 선택이며(weight tying, 분해, 해시 임베딩, 조합적 코드 학습 같은 선행 연구가 있다), 이 실험은 그 설계 공간에서 고정 최소 이진 정체성에 고정 리프트를 얹고 추가 학습 입력 생성기를 두지 않는다는 매우 제한된 운용점을 1.7B급 규모에서 특성화한다. 임베딩 압축이나 어휘 경계 파라미터 절감을 검토한다면, 이 논문은 절감량과 함께 품질 비용을 측정한 사례가 된다. 다만 파라미터 수는 untied 기준선 대비이며 tied 모델 대비 추가 절감으로 읽으면 안 된다. 또 하나의 실무적 가치는 고정 인터페이스가 연구 도구로서 갖는 성질이다. 토큰 입력 좌표가 학습 내내 변하지 않으므로, 문맥 계산·메모리·실행 컴포넌트를 따로 갱신하는 모듈형 시스템에서 재현 가능한 경계로 쓸 수 있다.

저자가 명시한 한계는 다음과 같다. 인터페이스당 학습 실행이 한 번뿐이라 학습 초기화와 실제 데이터 스트림에 걸친 변동성을 추정하지 못하며, 보고된 차이는 이 체크포인트들을 설명할 뿐이다. 입력 학습 가능성, 파라미터 수, 기하, 스케일이 동시에 바뀌는 완전한 파라미터화 개입이라 품질 격차를 단일 메커니즘에 귀속시킬 수 없다. 고정 0/1 벡터는 무작위 초기화된 학습 벡터와 초기 노름이 다르고, 공유 레시피를 인터페이스별로 따로 최적화하지도 않았다. 일반화 범위도 좁다. 하나의 토크나이저 계열, 어휘 크기, 문맥 길이, 데이터 구성, 주 모델 스케일만 다루므로 다국어, 장문맥, 명령 튜닝, 크게 다른 학습 예산에서의 거동은 확립되지 않았고, MMLU와 CommonsenseQA의 근사-균등 점수는 광범위한 추론·지식 주장을 특히 제한한다. 시스템 효율 이점도 입증되지 않았다. 입력 파라미터를 제거하면 옵티마이저 상태도 사라지지만 런타임은 버퍼 접근, 타일링, 활성값, 커널 동작에 좌우되며 처리량·에너지·지연 이득은 측정되지 않았다. tied 입력·출력 가중치 기준선에서는 입력 쪽 사용을 없애도 행렬이 저장에서 사라지지 않는다. 또한 출력 헤드의 어휘 크기 학습 행렬은 그대로 남는다. 재부호화 행렬은 하나만 평가했으므로 코드 할당에 대한 불변성이나 분포적 강건성은 주장하지 않는다. 어휘 49,152개는 2^16보다 작아 전체 하이퍼큐브의 균형 성질을 그대로 귀속시킬 수 없다.

결론적으로 저자들은 학습 입력 테이블이 유용하지만 관측된 능력에 필수는 아니라는 구분을 제시한다. 이는 우위 주장이 아니라 구분이며, 단일 실행 실험이라 아키텍처적 필연성과 경험적 유용성을 분리해 보여주는 운용점 결과다. 고정 인터페이스는 입력 정체성이 불변이고 표상 학습이 나머지 학습 가능한 시스템에서 진행되는 통제된 설정을 제공하지만, 특정 능력이 어디에 국소화되는지는 확립하지 않는다.