실제 언어 없이 훈련한 3억 파라미터 모델이 문맥에서 언어를 배운다

Learning to Learn a Language

HF Daily2610.05879

Lennart Carstens-Behrens, Holger Fröhlich2026-10-05

무엇인가

자연어 모델은 수조 개 토큰으로 훈련되지만 아이는 수천만 단어만 듣고도 유창해진다. 이 논문은 그 여섯 자릿수 차이가 언어 자체의 성질이 아니라 데이터에 가져오는 사전지식의 차이라고 본다. 저자들이 던진 질문은 이렇다. 실제 언어를 한 글자도 보지 못한 모델이 합성된 비언어적 사전분포만으로 사전학습된 뒤, 가중치를 고정한 채 문맥 안에서 처음 보는 언어를 추론할 수 있는가.

어떻게 동작하나

제안하는 사전분포는 재귀적 구조적 인과모형이다. 하나의 합성 언어는 소수의 잠재 노드가 희소하게 연결된 방향 그래프 G, 노드별 구조방정식 f_i, 활성함수 σ_i, 발화율 함수 ρ_i, 단일 노이즈 스케일 η, 양자화기 Q의 튜플로 정의된다. 잠재 상태 h_t는 부모 노드 값에 구조방정식을 적용하고 활성함수를 통과시킨 뒤 노이즈를 더해 갱신되는데, ρ_i가 1인 스텝에서만 갱신되고 나머지 스텝에서는 값을 유지한다. 발화율은 2의 거듭제곱 주기로 뽑혀 노드마다 다른 시간규모를 갖게 하고, 이것이 자연어의 장거리 의존성을 흉내 낸다. 매 스텝마다 앞쪽 d_obs개 좌표를 균일 구간으로 나눠 혼합기수 인코딩으로 토큰 하나를 방출하며, L=2, d_obs=8이면 어휘 크기가 256, 즉 바이트가 된다. 그래프 배선과 갱신 규칙은 훈련 시퀀스마다 새로 뽑히므로 모델은 같은 언어를 두 번 보지 못하고, 다음 토큰 손실을 줄이는 유일한 방법은 접두사로부터 생성 언어를 추론하는 것뿐이다. 이때 최적 예측기는 언어에 대한 사후예측분포(논문 수식 1)이고, 훈련은 이 베이즈 예측기를 근사하는 과정이 된다.

무엇과 다른가

PFLM은 300M 파라미터의 디코더 전용 트랜스포머다. Qwen3-Next와 유사한 하이브리드 스택으로, 게이티드 선형 어텐션 층과 어텐션 층을 3:1로 교차시키고 어텐션은 2^18 토큰 슬라이딩 윈도로 제한한다. 어휘는 256개 바이트 값이라 합성 스트림과 UTF-8 텍스트가 같은 알파벳 위에 놓인다. 사전분포에서 새로 뽑은 1500억 토큰으로, 문맥 길이를 2^10에서 2^20까지 늘려가는 6단계(각 20·60·40·15·10·5억 토큰)로 학습했고 NorMuon 옵티마이저와 warmup-stable-decay 학습률 스케줄을 썼다.

어떻게 쓰나

결과는 모두 이 단일 모델, 가중치 고정 상태에서 나온다. 영어·중국어·힌디어·아랍어·일본어·한국어 위키백과에서 문맥이 길어질수록 비트/바이트가 균일분포의 8비트에서 100만 바이트 문맥에서 0.9~2.4비트로 떨어진다(언어당 100만 바이트 홀드아웃 윈도 32개의 평균). 숫자를 주면 자릿수 올림이 없을 때 세 자리 만에, 올림이 있을 때 한 자리 늦게, 끝자리 9를 넘는 올림일 때 두 자리 늦게 다음 수를 정확히 맞힌다. 세 자리 수 크기 비교는 두 수의 비가 1/2일 때 정확도 0.97에서 1/15일 때 0.68로 떨어지고(8192개 예시), 합이 세 번째 수를 넘는지 판단하는 과제도 0.93에서 0.62로 같은 비율 의존성을 보인다. 결정론적 수열에서는 100만 심볼 기준 Rudin–Shapiro 0.04비트, Kolakoski 0.13비트(10만 심볼에서 0.11), 소수 지시함수 0.28비트로, 소수 밀도만 아는 예측기의 0.37비트보다 낮다. 반면 π의 이진 전개는 1.00비트에 머문다. 음성(8비트 μ-law), MIDI 피아노, 단백질, 소스코드, 세균 게놈, SMILES 분자 등 여섯 비텍스트 영역에서도 온라인 바이그램·gzip·PPMd보다 비트/바이트가 모두 낮았고, 격차는 DNA에서 가장 작고 오디오·음악에서 가장 컸다.

전제와 한계

저자들은 사전분포 샘플이 자연어의 통계적 지문을 재현한다는 점을 따로 검증한다. Zipf 빈도, 느린 엔트로피율 수렴, 다중 규모 상호정보량 감쇠다. 1~8차 n-gram 조건부 엔트로피에서 합성 샘플의 10~90 퍼센타일 밴드가 여섯 언어 곡선을 모두 포함했고, 1~512바이트 거리의 상호정보량도 자연어와 같은 모양으로 감쇠했다. 발화율을 모든 노드에서 1로 고정하는 절제 실험에서는 스칼라 지표는 그대로지만 거리 적분 장거리 상호정보량이 18% 줄었다. 즉 느리게 갱신되는 노드 꼬리가 장거리 의존성을 나른다.

개발자 관점에서 흥미로운 지점은 데이터가 거의 없는 영역이다. 저자들도 향후 연구로 저자원 언어, 미해독 문자, 동물 의사소통 같은 도메인에 이 사전분포를 적용하는 것과, 실제 텍스트와 사전분포 샘플을 함께 사전학습해 기존 언어모델의 인컨텍스트 학습을 강화하는 것을 꼽는다. 실무에서 확인할 것은 두 가지다. 첫째, 이 모델은 가중치를 갱신하지 않으므로 성능이 전적으로 문맥 길이에 달려 있다. 둘째, 비트/바이트 수치는 UTF-8에서 문자당 바이트 수가 스크립트마다 달라 언어 간 직접 비교가 아니다(라틴 1바이트, 아랍 2바이트, 데바나가리·한중일 3바이트). 코드와 가중치는 공개돼 있다.

한계는 저자들이 명시한다. 문맥 길이가 인컨텍스트 학습의 도달 범위를 제한한다. 학습된 문맥은 100만 바이트로 영어 약 20만 단어에 해당하고, 그 길이에서 위키백과 예측은 수조 토큰을 학습한 현대 언어모델에 아직 미치지 못한다. 또한 이 논문의 주장은 사전분포가 자연어를 담고 있지 않다는 것, 즉 모델이 언어를 배운 것이 아니라 언어를 배우는 법을 배웠다는 데 있다. 사전분포는 자연어에 적합된 것이 아니라 구성된 것이며, 훈련 데이터에는 자연어 텍스트가 전혀 없다.