이름 토큰화의 불균형이 LLM 내부 개념 접근성과 선택을 바꾼다

Who Gets a Token, and What Does It Carry? Unequal Name Support and Concept Access in Large Language Models

HF Daily2609.34065

Mir Tafseer Nayeem, Davood Rafiei2026-09-28조회 2

무엇인가

이름 기반 공정성 평가는 오랫동안 "문맥을 고정하고 이름만 바꾸면 나머지 차이는 이름이 담은 사회적 정보 때문"이라는 실험 논리를 써 왔다. 이 논문은 그 논리의 전제, 즉 비교하는 이름들이 애초에 비교 가능한 모델 입력이라는 가정이 깨진다고 주장한다. Emily와 Emilee처럼 사회적으로 대응되는 두 이름을 봐도, 어떤 토크나이저는 Emily를 단일 토큰 [Emily]로, Emilee를 [Emi][lee] 같은 여러 서브워드 조각으로 표현한다. 사람에게는 이름만 다른 입력이지만 모델에게는 어휘 접근 방식 자체가 다른 입력이다. 이름은 개인 식별자인 동시에 가족·문화·성별·인종과 연결된 사회적 신호이고, 채용·의료·대출 같은 실제 배치 환경에서 프로필·이력서·메모리로 자연스럽게 등장하기 때문에 이 차이는 평가실 안에만 머물지 않는다.

어떻게 동작하나

논문이 제안하는 NameTrace는 이 문제를 세 층위로 추적하는 모델 내부 프레임워크다. 첫째, 어휘 수준에서 어떤 이름이 단일 토큰으로 손실 없이 인코딩되는지(atomic) 아니면 여러 조각으로 조립되는지(fragmented)를 측정한다. 둘째, 중간 레이어에서 모델이 과제별 형용사 축에 부여하는 자체 확률 분포를 읽어 개념 접근성(concept accessibility)을 계산한다. 각 형용사에는 SentiWordNet의 연속적 정서가·강도 값과 과제 방향을 곱한 과제 정렬 가중치가 붙는다. 예를 들어 fellowship 축에서는 excellent가 promising보다 강하게 기여하고, 임상 평가 축은 방향이 반전되어 worried가 부정적 정서에도 불구하고 더 큰 우려를 뜻하는 방향으로 정렬된다. 점수는 S = Σ P(형용사|이름, 과제, 증거조건) × 과제정렬가중치로 정의되고, 매칭 쌍의 격차 Δ는 atomic 이름 점수에서 fragmented 이름 점수를 뺀 값이다. 정답이나 외부 판정자 없이 동작하는 사전 행동적(pre-behavioral) 측정이라는 점이 특징이다.

무엇과 다른가

첫 번째 연구 질문의 규모는 플로리다 2022년 6월 유권자 등록 추출에서 얻은 단어 하나짜리 이름 497,583개와 LLM 계열 토크나이저 12종이다. 전체 이름 중 최소 한 토크나이저에서 atomic인 이름은 23,095개뿐이고 12종 모두에서 atomic인 이름은 4,052개에 그친다. 개별 어휘 크기는 DeepSeek 4,998개에서 Aya 20,020개까지 벌어진다. 빈도와 길이를 통제한 뒤에도 불균형은 남는다. 고빈도·고신뢰 이름 7,469개에서 임의 토크나이저 기준 atomic 접근률은 남성 연관 49.8% 대 여성 연관 25.7%였고, 인종 연관 그룹별로는 NH Black 연관 17.6%에서 NH White 연관 47.2%까지, Asian/PI 연관은 46.4%였다. 로그 빈도 1표준편차 증가는 atomic 접근 오즈를 2.94배로, 길이 1표준편차 증가는 0.51배로 만든다. 남성 연관 이름은 여성 연관 이름의 3.36배, Hispanic·NH Black 연관 이름은 NH White 연관 이름의 각각 0.47배·0.42배, Asian/PI 연관은 1.55배다. 교차 분석에서는 NH Black 여성 연관 12.1%에서 NH White 남성 연관 64.8%까지 벌어진다. 12개 토크나이저의 접근 패턴은 8가지로 수렴한다. 공유 atomic 이름 7,460개로 제한해 표현 기하를 비교한 CKA에서는 계열 내 평균 0.694, 계열 간 0.544로, 어휘 접근을 고정해도 표현 구조가 모델 계열별로 갈린다.

어떻게 쓰나

두 번째 질문은 이 어휘 차이가 과제 관련 내부 표현에서도 보이는지다. 저자들은 8개 인종/민족–성별 층 안에서 빈도, 문자 길이, 인구통계 연관 강도, 메타데이터 신뢰도, 약한 철자 단서를 맞춘 atomic–short-fragmented 쌍 200개(이름 400개)를 만들어 개발/평가 세트로 반씩 나눈다. 네 과제 축은 fellowship/promise, hiring/competence, clinical assessment/concern, lending/trustworthiness이며 각각 강·경계·약 증거 조건을 둔다. 평가 이름에서 atomic 이름이 fragmented 이름보다 과제 정렬 개념에 더 접근 가능했다. 가중 격차는 fellowship 0.131(95% CI [0.096, 0.168]), hiring 0.072([0.055, 0.091]), clinical 0.059([0.048, 0.072]), lending 0.051([0.041, 0.061])이고, 비가중 확률 격차는 각각 0.027, 0.023, 0.022, 0.023이다. 모델별로는 Qwen이 네 축 모두 0.154~0.366으로 양수, Llama는 0.002~0.026으로 작게 양수, Ministral은 hiring과 clinical에서 양수지만 fellowship은 거의 0, lending은 음수다. Qwen과 Llama는 12개 과제–증거 조합이 모두 양수, Ministral은 9개가 양수이고 음수 3개가 전부 lending에 몰린다. 8개 모델 확장에서는 32개 모델–과제 평균 중 23개, 신뢰구간 20개가 양수이고 fellowship은 8개 모델 중 7개에서 양수다. 8개 층 모두에서 모든 과제의 격차가 양수이며, 모델×층 교차 셀 기준으로 fellowship 22/24, hiring 24/24, clinical 23/24, lending 15/24가 양수다. 다만 깊이와 학습 단계에 따라 양상이 달라져, 출력 경계에서는 fellowship이 약화되고 hiring과 clinical은 부호가 뒤집히며 lending은 양수로 남는다.

전제와 한계

세 번째 질문은 이 신호가 처음 보는 이름으로 전이되는지, 그리고 실제 선택을 움직이는지다. 개발 이름에서 추정한 지원 사전(prior)을 그대로 빼면 평가 세트의 통합 격차가 fellowship 0.131→0.004, hiring 0.072→0.008, clinical 0.059→−0.007, lending 0.051→0.014로 줄어든다. 감소율은 96.6%, 88.3%, 88.2%, 72.9%다. 36개 모델–과제–증거 셀에서 개발 사전과 홀드아웃 격차의 상관은 Pearson r=0.992, Spearman ρ=0.959, 부호 일치율 94.4%였고 평균 절대 잔차는 0.0790에서 0.0094로 떨어졌다. 과제/증거 대응을 섞은 순열 분석의 중앙 잔차는 0.0364(p_MC=0.0001)로 더 컸다. 개입 실험에서는 과제 정렬 형용사와 반대 형용사의 표현으로 과제 방향 d를 만들고, 매칭된 두 이름 표현을 그 축을 따라 반대 방향으로 밀어 넣은 뒤 이후의 이지선다 확률을 비교했다. 정방향−역방향 대비는 Qwen 0.153, Llama 0.155, Ministral 0.094였고, Qwen과 Llama는 200쌍 전부, Ministral은 195쌍이 예상 방향으로 움직였다. Qwen과 Llama에서는 이 대비가 무관 축·극성 셔플·랜덤 부분공간 대조군을 앞섰고, Ministral은 layer 8에서 0.142로 대조군을 모두 앞섰다.

개발자 입장에서 이 논문은 이름을 조건으로 넣는 평가·프롬프트·개인화 파이프라인에서 토크나이저가 통제 변수라는 점을 뜻한다. 같은 이름 집합이라도 토크나이저에 따라 atomic 비율이 달라지고, 그 차이가 중간 레이어의 개념 접근성과 최종 선택까지 이어질 수 있으므로, 이름 기반 A/B 비교를 할 때는 먼저 대상 이름이 단일 토큰인지 서브워드로 쪼개지는지 확인하고 토크나이저별로 결과가 재현되는지 봐야 한다. 특히 채용·임상·대출처럼 민감한 판단을 이름 조건으로 평가한다면, 인구통계 매칭만으로는 입력 비교 가능성이 확보되지 않는다는 것이 이 논문의 핵심 경고다.

저자들이 명시한 한계도 분명하다. 이름별 사전학습 노출량은 관측되지 않으므로 이 설계는 atomicity의 인과적 분리가 아니라, 관측된 속성으로 매칭한 이름들 사이에서도 어휘 지원이 예측력을 유지하는지를 측정한다. 토크나이저를 이름 조건 행동의 유일한 인과적 설명으로 취급하지 않으며, 학습 노출과 다른 미관측 이름 속성이 어휘 지원과 학습된 표현 모두에 영향을 줄 수 있다고 밝힌다. 데이터 측면에서는 플로리다 유권자 등록 추출을 쓰되 이름 표면만 집계해 인종/민족·성별 연관 메타데이터를 만들고, 유권자 식별자·성·주소·생년월일 등 개인 수준 필드는 쓰지 않는다. 공개 기록이라도 민감하게 다루며, 배포하는 데이터는 개인 식별 정보가 없는 집계 수준이고, 결과는 이름 표면의 어휘적 지원에 대한 증거일 뿐 이름을 가진 사람이나 집단에 대한 주장이 아니라고 못박는다.