LLM 일반화는 정확도가 아니라 의미가 같은 입력에서의 안정성이다
Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs
무엇인가
이 논문이 푸는 문제는 LLM 평가의 관행 자체다. 검색, 코딩 어시스턴트, 에이전트 워크플로에서 같은 사용자 의도는 결코 한 가지 형태로만 들어오지 않는다. 표현, 길이, 어조, 포맷, 노이즈가 달라져도 목표와 맥락은 같다. 그런데 기존 연구는 단일 프롬프트 형식, 단일 태스크, 단일 변형 집합에 대한 집계 정확도로 일반화를 측정해 왔다. 저자들은 이것이 견고성과 벤치마크 성능을 뒤섞는다고 지적한다. 도메인 하나에서의 성공은 일반화 능력의 증거가 아니고, 변형 패밀리 하나에 적응한 모델은 다른 표현 방식에서 무너질 수 있으며, 집계 점수는 개별 예시 수준의 행동 변화를 가린다. 어떤 변형에서 실패한 것이 다른 변형에서의 성공으로 상쇄되면 평균은 그대로인데 실제 동작은 크게 달라진다.
어떻게 동작하나
제안 방법은 SAGO(Stability-Aware Generalization Objective)다. 세 가지로 구성된다. 첫째, 의미를 보존하는 통제된 입력 변형 벤치마크. 둘째, 프롬프트별 안정성 점수. 셋째, 서로 다른 실패 모드를 포착하는 네 개의 행동 축이다. 형식화는 이렇다. 프롬프트 x_i에 대해 의미 보존 변환 T_v로 만든 변형을 x_i^(v) = T_v(x_i)라 하고, 의미 내용 c(x_i^(v)) = c(x_i)를 만족시킨다. 축 X는 모델과 프롬프트에 대한 스칼라 속성이고, 변형이 유발한 변화량은 Δ_X(i,v) = X(f_θ, x_i^(v)) − X(f_θ, x_i)로 부호까지 보존해 기록한다. SAGO의 목표는 모든 프롬프트 i와 모든 변형 v에 대해 Δ_X(i,v) = 0인지 판정하는 것이고, 성립하지 않을 때는 0에서 얼마나 벗어났는지로 실패의 심각도를 정량화한다. 이 조건은 축마다 따로 평가한다. 한 축에서의 일반화가 다른 축의 일반화를 함의하지 않기 때문이다.
무엇과 다른가
변형 집합은 세 패밀리로 구성된다. 사회적 레지스터는 공손함, 직접성, 인사, 완충 표현, 감사 표시, 부정적 사회적 프레이밍 등 11개 수준으로 대인 관계적 틀을 바꾼다. 표면 노이즈는 불규칙한 띄어쓰기, 구두점 노이즈, 대소문자 변화 같은 토큰·문자 수준 교란을 여러 강도로 가한다. 구조적 재작성은 길이의 통제된 압축·확장과 의문문·명령문 간 변환으로 요청을 재조직한다. 비구조적 변형은 접두, 접미, 전역 세 위치에 적용하고 구조적 변형은 정의상 전역이다. 표면 노이즈는 구성상 의미 보존이 보장되고, 나머지 패밀리는 모든 변형이 BERTScore 0.85를 넘는 프롬프트만 남겨 의미 보존을 확인한다.
어떻게 쓰나
점수 계산은 축마다 단위와 범위가 달라 먼저 정규화한다. Δ~_X(i,v) = Δ_X(i,v) / R_X로 나누어 0이 정확히 행동 변화 없음을 뜻하는 [−1, 1] 구간으로 맞춘다. 스케일 상수는 R_Act = 2, R_BLEU = 100, R_BERT = 1, R_Ent = 10, R_Prob = 250, R_MR = 1이다. 프롬프트별 불안정성은 변형 집합 전체에 대한 정규화 델타의 제곱평균제곱근(RMS)이다. RMS는 모든 델타가 0일 때만 0이 되므로, 모든 변형에서 똑같이 양수만큼 어긋나는 모델도 불안정한 것으로 정확히 잡힌다. 데이터셋 점수는 프롬프트별 불안정성의 평균이고, 전체 SGS는 데이터셋들을 프롬프트 단위 동일 가중으로 풀링한 값이다. 통계 검정은 실무적으로 무시할 수 있는 허용 임계값 ε에 대해 단측 t-검정으로 수행하며, ε은 0.01, 0.05, 0.10 세 값으로 보고하고 주 결과는 0.05다.
전제와 한계
네 축은 내부 표현에서 표면 출력까지의 경로를 훑는다. 활성화 기하(X_Act)는 L개 레이어 각각의 마지막 비패딩 히든 상태에 대해 변형과 원본의 코사인 유사도를 평균한 뒤 1을 빼서, 최종 출력이 같아도 내부 표현이 표류하는 경우를 잡는다. 생성 일관성(X_BLEU, X_BERT)은 변형 응답과 기준 응답의 BLEU와 BERTScore-F1을 자기 자신과의 점수에서 뺀 값으로, 표면적 어휘 변화와 의미 수준 표류를 구분한다. 신뢰도·불확실성(X_Prob, X_Ent)은 시퀀스 로그확률과 평균 토큰 엔트로피의 변화를 측정해 길이 민감 관점과 길이 불변 관점을 함께 본다. 응답 미러링(X_MR)은 응답이 변형의 표면 속성을 반영하는지 나타내는 이진 검출기로, 사회적 레지스터는 GPT-4o-mini 판정(라벨 10% 수동 검증), 표면 노이즈는 규칙 기반 휴리스틱, 길이는 목표 배수 ±0.25 일치 여부로 계산한다. 저자들은 미러링을 의도된 정렬 특성일 수도, 의도치 않은 불안정성일 수도 있는 행동 민감도로 취급하고 의도를 선판단하지 않는다.
실험은 오픈소스 8개와 클로즈드 3개, 총 11개 인스트럭션 튜닝 모델을 대상으로 한다. Llama-3.2-3B-Instruct, Llama-3.1-8B-Instruct, Gemma-2B-IT, Gemma-7B-IT, Gemma-4-E4B-IT, Qwen2.5-1.5B-Instruct, Qwen2.5-7B-Instruct, Qwen3.5-9B, 그리고 API로 접근한 GPT-5.4, Gemini-2.5-Flash, Claude-Sonnet-4.6이다. 디코딩은 T=0으로 결정적이다. API 제약으로 클로즈드 모델은 X_Act와 X_Prob를 계산할 수 없고 X_Ent는 GPT-5.4만 측정한다. 데이터셋은 건강, 법, 금융, 정치, 과학, 역사, 지리, 상식, 창의적 지시 수행을 아우르는 6개 개방형 사실 QA로 TruthfulQA, Natural Questions, Alpaca, SimpleQA Verified, TriviaQA, HotpotQA이며 데이터셋당 16개 프롬프트를 샘플링한다. 실행 환경은 NVIDIA RTX 2080 Ti 4장과 GTX 1080 Ti 4장(CUDA 12.8)이다.
결과는 세 갈래다. 첫째, 어떤 모델도 균일하게 일반화하지 않는다. 모든 오픈소스 모델이 최소 한 축에서 ε=0.05를 넘고, Δ-BLEU와 Δ-MR은 모든 모델에서 p<0.001로 유의하다. 세 아키텍처 계열 모두에서 나타나므로 개별 모델의 교정 가능한 결함이라기보다 현재 인스트럭션 튜닝의 구조적 속성으로 보인다. 파라미터 수로도 해결되지 않아 L-8B, G-7B, Q-7B가 대부분 축에서 자기보다 작은 모델과 같거나 더 불안정하다. 반면 Δ-Ent는 전 모델에서 최대 0.012로 임계 이내여서 토큰 수준 분포의 예리함이 출력 수준 안정성과 분리돼 있음을 보여준다. 둘째, 축 해리다. Gemma 계열에서 G4-E4B가 오픈소스 중 생성 불안정성이 가장 높고(Δ-BERT 0.178, Δ-BLEU 0.837), 선배 모델들은 그보다 낮다(G-2B 0.097, G-7B 0.084). 반대로 Q3.5-9B는 Δ-BERT 0.080, Δ-BLEU 0.520으로 오픈소스 최저지만 신뢰도 불안정성은 0.088로 가장 높고 미러링 불안정성도 0.441로 상당하다. 생성 일관성과 신뢰도가 같은 불안정성의 상관 대리물이라면 이런 체계적 역전은 불가능하다. 셋째, 데이터셋 간 변동이다. L-8B의 Δ-Cos는 3.7배 범위에 걸쳐 있고 Δ-MR은 6개 데이터셋에서 두 배 이상 차이 난다. 이 변동 폭은 어느 데이터셋을 고르느냐에 따라 모델 순위를 뒤집을 만큼 커서, 단일 벤치마크에 고정된 견고성 평가는 그 도메인만 특징짓는다.
개발자에게 이 논문이 주는 실무 지침은 명확하다. 모델 선택을 리더보드 순위가 아니라 프로파일로 해야 한다. 콘텐츠 안정성이 중요한 배포라면 한 모델이 낫고, 신뢰도 안정성이나 표면 미러링 억제가 중요하면 다른 모델이 나을 수 있다. 프롬프트 템플릿, 공손 표현, 포맷, 길이를 바꿔가며 자체 도메인 데이터로 변형 민감도를 측정하고, 평균 점수가 아니라 개별 프롬프트에서 응답이 뒤집히는 비율을 확인해야 한다. 저자들이 밝힌 한계도 분명하다. SAGO는 어디서 얼마나 행동이 변하는지는 측정하지만 원인 메커니즘이나 책임 있는 내부 구성 요소는 규명하지 못해 표현 표류, 디코딩 민감성, 미러링이 얽힌 채 남는다. 데이터셋이 영어 전용이라 다른 언어, 문자 체계, 문화 특정 프롬프트 관습에서 같은 해리가 성립하는지는 검증되지 않았다. Δ-BLEU는 어휘 이탈을 잡기 때문에 무해한 패러프레이즈를 반영할 수 있어 의미 수준 보완으로 Δ-BERT를 함께 쓴다. 데이터셋당 16개 프롬프트라는 운영점은 전형적 프롬프트별 불안정성에는 타당하지만 희귀하거나 최악의 실패는 더 큰 표본이 필요할 수 있다. 구조적 변형과 사회적 레지스터 미러링은 GPT-4o-mini 판정에 의존해 스타일 편향이 끼어들 수 있고, API 접근 제약으로 클로즈드 모델 결론은 관측 가능한 축에 국한된다.