구조 일반화가 어려운 이유는 트랜스포머가 아니라 학습 데이터의 타입 다양성 부족이다
Type Diversity Enables Transformers to Generalise Compositionally
무엇인가
합성 일반화(compositional generalisation)는 어휘 일반화와 구조 일반화로 나뉜다. 선행연구(Kim & Linzen 2020; Yao & Koller 2022; Li et al. 2023; Jabbar et al. 2025)는 소규모 진단 데이터셋에서 트랜스포머가 새로운 어휘는 잘 일반화하지만 새로운 구조는 잘 못한다고 보고했다. 저자들은 이 차이가 트랜스포머 고유의 결함도, 데이터 크기·연산량·파라미터 수라는 통상적 '스케일' 3요소도 아니고, 데이터의 특정한 언어적 다양성 — 이 논문이 '타입 다양성(type diversity)'이라 부르는 것 — 때문이라고 주장한다. 데이터 품질을 스케일의 네 번째 축으로 보는 최근 흐름에 붙는 문제 설정이다.
어떻게 동작하나
타입 다양성의 정의는 다음과 같다. 어떤 언어적 타입(예: 명사구 NP)의 타입 다양성이란 그 타입의 트리를 만드는 서로 다른 생성자 함수(constructor)의 개수다. 'a cat', 'the mice'는 한정사와 명사를 결합하는 하나의 생성자로 만들어지고, 'a cat on a mat'은 단순 NP와 전치사구를 결합하는 또 다른 생성자로 만들어진다. 즉 표면적 단어 조합의 다양성이 아니라 문법 구조를 만들어내는 규칙 자체의 다양성이다. 이 정의와 데이터 생성을 위해 Grammatical Framework(GF)를 개념적·실용적 도구로 쓴다. GF는 추상 구문(abstract syntax, tectogrammar — 범주와 결합 함수의 층위)과 구체 구문(concrete syntax, phenogrammar — 선형화 규칙의 층위)을 분리하며, fun 대신 data로 선언한 함수를 생성자로 삼고 def 함수 정의로 neo-Davidsonian 논리 의미를 계산한다.
무엇과 다른가
방법은 이렇다. COGS와 그 변형인 SLOG를 GF로 재생성하면서 형용사, 명사 복수형, 동사 시제 같은 자연스러운 언어 다양성을 추가해 어휘 타입과 구조 타입의 다양성 양을 각각 조절한 변형본을 만든다. 순수 인공 데이터셋인 SCAN에 대해서는 타입 다양성 양을 달리한 100개 이상의 변형을 생성한다. 여기에 더해 새 테스트 구조 이외의 타입 다양성, 논리 의미 포맷의 표면적 속성(예: 논리식에서 의미항의 순서) 같은 다른 데이터 속성의 영향도 함께 측정한다. 비교 기준으로는 Keysers et al.(2020)의 DBCA(분포 기반 합성성 평가)를 사용하는데, 이는 원자 발산(atom divergence)과 복합 발산(compound divergence) 두 값으로 학습·테스트 분할의 '합성성'을 정량화하는 방법이다.
어떻게 쓰나
결과적으로 타입 다양성은 어휘 테스트 케이스와 구조 테스트 케이스에서 동등하게 합성 일반화와 상관관계를 보였고, 이는 가설을 지지한다. 특히 명사구에 새로운 생성자를 추가하는 것만으로 구조 일반화 과제(PP-in-Obj → PP-in-Subj) 성능이 좋아진다. 또한 타입 다양성 자체가 낮은 상황에서는 하위 트리·상위 트리(sub-/supertree) 타입 다양성도 일반화에 도움이 된다. DBCA와 관련해서는, 발산이 타입 다양성 증가 때문에 발생한 경우에는 복합 발산과 원자 발산이 트랜스포머 성능과 상관관계를 보일 수 있음을 확인했는데, 이는 복합 발산이 합성 일반화의 어려움을 설명한다는 선행 주장과 모순된다. SLOG 변형 실험에서는 의미항의 순서 같은 구체 구문 속성도 결과에 영향을 준다. 다만 정확도는 100%에 도달하지 않고 어느 지점에서 정체한다.
전제와 한계
원문에 제시된 선행연구(Wu et al. 2023)의 수치는 이렇다. COGS의 PP-in-Obj → PP-in-Subj 과제에서 채움말(filler)과 도치(preposing)를 추가하면 정확도가 0%에서 20.5%로 오르고, 분사 형용사구를 nmod 의미로 넣어 구조 일반화를 사실상 어휘 일반화로 환원하면 0%에서 82.7%로 오른다. acl 토큰을 쓰는 경우에는 0%에서 24.7%다. 저자들은 이 증가가 토큰 순서나 변수 번호 제약의 완화 때문이라기보다 데이터에 새로운 타입과 의미를 도입했기 때문이라고 본다. 또한 Geiger et al.(2019)이 제시한 '공정한 학습셋' 정의(모든 중간 함수-인자 쌍을 학습셋이 제공해야 한다는 요건)는 필요조건으로 보기에는 지나치게 엄격하다고 반박하며, 인간이 새로운 구조의 문장도 이해한다는 점을 들어 구조 일반화는 모델에 요구할 만한 정당한 과제라고 주장한다. 이 논문 자체의 실험별 정확도 수치는 제공된 원문 범위에 제시되지 않았다.
개발자에게 주는 실무적 의미는 분명하다. 진단 데이터셋에서 모델이 구조 일반화에 실패할 때 곧바로 아키텍처 한계로 결론 내리지 말고, 학습 데이터의 타입 다양성(서로 다른 생성자의 수)을 먼저 세어보라는 것이다. 벤치마크를 직접 만들 때는 어휘 타입은 다양하고 구조 타입은 빈약해지는 편향이 생기기 쉬우므로, 테스트하려는 구조 타입에 대해서도 생성자 수준의 다양성을 확보해야 한다. 또한 논리 의미 포맷의 토큰 순서, 변수 번호 같은 표면적 관례가 성능을 크게 흔들 수 있으므로 데이터 포맷을 바꿔가며 결과의 재현성을 확인해야 한다. 데이터와 코드는 github.com/anmoisio/type-diversity에 공개되어 있고, GF 기반 생성 방식은 다른 언어와 구조로 확장 가능하다.
한계도 저자들이 명시한다. 트랜스포머만 실험했고, 실험당 하이퍼파라미터 설정이 하나뿐이며, 랜덤 시드 간 분산이 매우 커서 저자들은 분산을 감안해도 드러나는 결과만 결론의 근거로 삼았다. LSTM 등 다른 seq2seq 모델과는 차이가 크다고 보고된 바 있어 결과가 모든 seq2seq 모델로 일반화되지는 않을 것이다. 또한 이 결과는 타입 다양성이 충분하면 트랜스포머가 완벽한 또는 인간 수준의 합성 일반화에 도달한다는 것을 보여주지 않는다 — 정확도는 100%에 이르기 전에 정체한다. 합성성은 데이터셋에 구현되어야 하는 추상적 속성이라 다른 데이터 속성과 필연적으로 공존하므로, 자연어의 변이성과 중의성 같은 요인이 일반화에 미치는 영향은 향후 과제로 남는다.