다국어 수학 벤치마크로 언어 간 능력 전이의 결정 요인을 정량화한다
Multilingual GSM-Symbolic: What determines capability transfer across languages?
무엇인가
이 논문이 다루는 문제는 언어 간 능력 전이다. 한 언어에서 습득한 능력이 다른 언어로 얼마나 옮겨가는지, 그 이전을 지배하는 요인이 무엇인지는 거의 알려져 있지 않다. 기존 다국어 평가는 서로 비교할 수 없는 데이터셋에 의존하고, 포화되기 쉽고, 결정 요인들을 함께 추정한 경우가 드물었다. 이전을 예측하는 요인을 알면 모든 언어 쌍을 전수 평가하지 않아도 되고, 저자원 언어의 성능을 제한하는 요인을 개발자가 직접 겨냥할 수 있다. 저자들은 수학을 시험대로 삼는다. 의료 질의응답처럼 문화에 따라 답이 달라지는 영역과 달리 수학 문제의 답은 언어가 바뀌어도 고정되기 때문이다.
어떻게 동작하나
방법의 핵심은 문항 단위로 대응되는 다국어 심볼릭 데이터셋이다. 저자들은 GSM-Symbolic에서 출발해 자체 파서를 구현하고 문법을 확장해 Multilingual GSM-Symbolic을 만든다. 규모는 15개 언어에 걸친 3만 개의 문항 대응 질문-답 쌍이고, 언어당 100개의 심볼릭 템플릿을 쓴다. 템플릿 하나에서 수백만 개의 검증 가능한 변형을 생성할 수 있어 특정 인스턴스 암기로는 이득을 볼 수 없고, 표면형 민감도와 오염 문제를 분리할 수 있다. 언어 선택은 자원 수준, 어족, 문자체계가 서로 뒤섞이지 않도록 설계했고, 게르만 어파 축(아이슬란드어, 덴마크어, 네덜란드어, 독일어, 영어)에 우크라이나어, 이탈리아어, 마라티어를 더했다. 번역은 기술 전문성을 갖춘 원어민이 맡았고 LLM 보조를 허용하되 수동 검토로 마무리했으며, 통화·단위·문화적 지시체·숫자를 현지화했다. 검증은 영어 템플릿에 먼저 적용해 오류 전파를 막고, 번역 템플릿에서 도입된 오류를 잡는 방식으로 진행했다. 각 문제를 20개씩 생성해 Claude Opus 4.8이 틀린 템플릿의 추론 흔적을 사람이 검토했고, 자동 테스트 스위트로 기본값 렌더링이 원본과 일치하는지, 템플릿 조건이 충족되는지 확인했다.
무엇과 다른가
능력 이전은 일반화 선형 혼합 모형(GLMM)으로 모델링한다. 모델 m이 언어 l의 템플릿 t의 인스턴스 i를 맞혔는지를 베르누이 응답으로 두고, 로짓을 고정효과(언어 특징, 모델 특징, 그 상호작용)와 교차 랜덤효과(어족, 모델, 추론 on/off 변형, 언어, 템플릿, 모델×언어)의 합으로 표현한다. 랜덤효과는 해당 특징으로 설명되지 않는 변동을 흡수해, 고정효과가 적절한 변동 원천에 대해 평가되도록 만든다. 특히 모델×언어 항은 모델 강도와 문제 난이도를 제거한 뒤 남는 이전 변동을 뜻하고, 여기에 언어 특징을 추가했을 때의 감소분이 그 특징이 설명하는 이전 변동의 양이 된다. 언어 특징으로는 언어 자원 수준(Common Crawl 페이지 수, 로그 변환), 영어로부터의 유형론적 거리(URIEL의 103개 형태통사적 특징 코사인 거리), 토크나이저 생산성(fertility)을 쓴다. 모델 특징은 로그 변환한 크기와 추론 여부다. 평가는 오픈 웨이트 인스트럭션 튜닝 모델만 대상으로 했고, Inspect AI와 vLLM 0.22.1로 제로샷 프롬프팅을 했다. EuroLLM-1.7B는 토큰 한도를 54%의 경우에서 초과해, Qwen 3.5 0.8B(reasoning=on)는 95%의 경우에서 거의 빈 응답을 내 제외했다.
어떻게 쓰나
결과에서 가장 큰 결정 요인은 모델 크기(β=1.77, 본문 표에서는 1.88), 언어 자원 수준(β=0.77), 추론(β=0.67), 유형론적 거리(β=-0.25) 순이다. 크기와 추론의 상호작용은 β=-0.34로, 추론의 이득이 규모가 커질수록 줄어든다. 이 공동 추정 덕분에 요인들을 서로 환산할 수 있는데, 예컨대 마라티어로 평가한 32B 모델은 영어의 10B 모델과 비슷한 성능을 낸다. 자원 격차를 좁히는 레버는 모델 크기(β=-0.27)와 추론(β=-0.20)이며, 같은 레버가 유형론적으로 먼 언어에는 거의 또는 전혀 듣지 않는다(거리×크기 β=0.02, p=0.32). 거리×추론은 β=0.11(p=.03)이지만 모델 제거 실험에서 재현되지 않는다. 예측력은 언어 평균 난이도 3.2pp(r=0.93), 특정 모델의 특정 언어 성능 5.98pp(r=0.96)이고, 목표 언어 템플릿 10개만 추가하면 각각 2.38pp, 4.19pp로 줄어든다. 분석 프레임워크는 언어 간 변동의 92%를 설명하지만 모델×언어 변동은 23%만 설명한다. 즉 언어 난이도는 잘 예측하지만 어느 모델이 어느 언어에서 무너지는지는 여전히 추정하기 어렵다. 심볼릭 변형은 원본 GSM8K보다 3.14pp 어려웠고(r=-0.02), 이 페널티는 로그오즈 -0.30에 언어별로 달라져 영어가 1.7pp로 가장 작고 러시아어가 5.5pp로 가장 컸다. 오류는 파싱 단계에 국한되지 않는다. 피연산자 읽기(β=0.32), 중간 계산(β=0.45), 최종 답(β=0.77)으로 갈수록 자원 수준의 효과가 커지고, 지시 준수율도 독일어 94.5%에서 마라티어 77.1%까지 떨어진다.
전제와 한계
개발자에게 주는 실무적 의미는 두 갈래다. 하나는 평가 비용 절감이다. 언어 특징만으로 보지 못한 언어의 성능을 6pp 이내로 예측하고, 템플릿 10개만 측정하면 4.19pp까지 좁힐 수 있으므로 모든 언어 쌍을 전수 평가할 필요가 줄어든다. 다른 하나는 개입 우선순위다. 저자원 언어의 격차를 줄이려면 모델 크기와 추론을 키우는 것이 유효하지만, 유형론적으로 먼 언어에는 그런 레버가 통하지 않으므로 다른 접근이 필요하다. 또한 강한 성능이 그 언어의 일반적 사용성을 뜻하지 않는다는 점, 언어별 결과를 따로 보고하라는 점을 저자들은 명시적으로 강조한다.
한계도 분명하다. 데이터셋은 100개 템플릿과 15개 언어로 구성되어 언어를 더 추가하면 유용성이 커질 것이며, 초등학교 수준 산술이라 포화의 영향을 받을 수 있다(성능 임계값별로 다시 적합해도 결론은 안정적이라고 밝힌다). 모델 선택은 베이스 모델이 아닌 인스트럭션 정렬 모델로 제한했고, 크기를 맞추기 위해 MoE는 제외했으므로 결과는 이 조건에 한정된다. 유형론적 거리와 생산성의 상관(r=0.8)이 높아 상대적 생산성을 쓰지만, 거리 계수는 구조적 거리와 (비상대적) 생산성을 함께 담으므로 해석에 주의해야 한다. 언어 자원을 단일 축으로 나타낼 수 없다는 점, Common Crawl이 자원 수준의 불완전한 대리 변수라는 점도 인정한다. 예측 실패의 큰 사례는 모델×언어 특이성으로, Apertus-70B가 영어에서 23%를 기록한 반면 크기와 언어 특징이 시사하는 값은 75%였다. 표본 수 실험에서는 50개 표본이면 순위가 0.99로 재현되고, 100개 표본에서는 (모델, 언어) 예측의 표준오차가 2.29pp이며, 이를 절반으로 줄이려면 400개 템플릿이 필요하다.