수학 추론 모델의 정답은 순서에 불변하나 내부 표현은 순서에 민감하다.
Order-Invariant Answers, Order-Sensitive Representations in Mathematical Reasoning
무엇인가
이 논문이 던지는 질문은 정확도 바깥에 있다. 수학 문제에서 전제나 규칙의 순서를 바꿔도 논리적 의존 관계와 정답은 변하지 않는다. 이런 과제를 저자는 답 불변(answer-invariant) 과제라고 부른다. 그렇다면 재정렬된 문제를 정확히 푸는 모델은 내부적으로도 순서를 무시하는 공통 표현을 형성할까? 기존 연구는 전제 순서가 수학·연역 추론 정확도에 영향을 준다는 것을 보였고, 저자는 여기에 표현 공간 분석이라는 관점을 더한다. 결론은 통념과 반대다. 정확도가 높은 모델일수록 서로 다른 순서를 내부에서 더 뚜렷하게 구분한다.
어떻게 동작하나
과제는 합성 다단계 함수 합성 문제다. 예를 들어 F(3)=7, G(7)=-2, F(5)=9, G(9)=4라는 매핑이 주어지고 G(F(3))을 물으면, 모델은 3 →F 7 →G -2라는 관련 체인을 찾아 방해 매핑을 무시해야 한다. 일반화하면 각 문제는 관련 체인 f1(a0)=a1, …, fD(aD-1)=aD를 갖고, D는 합성 깊이, m은 같은 함수 기호를 쓰지만 다른 숫자를 갖는 방해 체인 수다. 따라서 문제 하나에 (m+1)D개의 규칙 줄이 들어간다. 저자는 이 줄들의 순서만 여러 순열로 바꿔 제시한다. 규칙의 내용과 논리적 의존 관계, 질의, 정답은 모두 고정된다.
무엇과 다른가
이 차이를 정량화하는 지표가 순열 신호대잡음비(permutation SNR)다. 설정마다 T개의 문제 인스턴스가 있고, 각 인스턴스는 P개의 공유 순열 패턴으로 제시된다. 모델의 은닉 표현 h_{t,p}^{(ℓ)}는 답 생성 이전 프롬프트의 non-padding 토큰에 대해 평균 풀링한 벡터다. 순열 패턴 p의 클러스터 중심을 μ_p, 전체 중심을 μ라 할 때, SNR_perm^(ℓ) = (1/P)Σ_p ||μ_p − μ||² / ((1/PT)Σ_pΣ_t ||h_{t,p} − μ_p||² + ε)로 정의된다. 분자는 클러스터 간 분산, 분모는 같은 순서로 제시된 문제들 사이의 클러스터 내 분산이며, ε은 수치 안정성을 위한 항이다. 값이 클수록 순서별 표현이 문제 간 변동에 비해 더 뚜렷하게 분리된다는 뜻이고, 마지막으로 임베딩 출력과 모든 트랜스포머 레이어에 걸쳐 평균을 내 모델·설정당 값 하나를 얻는다.
어떻게 쓰나
실험은 1B~8B 파라미터의 instruction-tuned 언어 모델 16개로 구성된다. Qwen2.5, Llama, Mistral, Gemma, NVIDIA Ace 계열이 포함되며 일반 목적 모델과 코드·수학 변형이 섞여 있다. 합성 설정은 (D,m)이 (2,4), (2,7), (3,4)인 세 가지로, 합성 깊이와 방해 체인 수를 바꾼다. 각 설정은 T=100개 문제 인스턴스와 P=50개 순열 패턴으로 이루어져 모델당 5,000개 프롬프트가 생성된다. 프롬프트마다 응답을 하나 샘플링하고, 추출한 숫자 답이 정답과 일치하는지를 채점해 전체 문제와 순서에 대해 평균한 것이 정확도다.
전제와 한계
결과는 세 설정 모두에서 정확도와 레이어 평균 순열 SNR 사이의 양의 순위 상관이다. 스피어만 상관계수는 (D,m)=(2,4)에서 0.86, (2,7)에서 0.73, (3,4)에서 0.62였다. 즉 순열 SNR이 높은 모델이 정확도 순위에서도 더 높은 경향을 보였고, 이 관계는 평가한 합성 깊이와 방해 개수 전반에서 반복됐다. 모델 크기를 통제한 뒤의 상관은 부록 C에서 다룬다. 저자들이 강조하는 것은 이 방향이 반직관적이라는 점이다. 순서를 바꿔도 정답은 같은데, 재정렬 문제를 더 잘 푸는 모델이 오히려 순서 패턴을 더 선명하게 구분한다.
이 발견이 만드는 구분이 답 불변성과 표현 불변성이다. 서로 다른 규칙 순서는 같은 답을 요구하지만, 모델은 그 순서들을 서로 다르게 표현하면서도 정답에 도달할 수 있다. 오히려 정확도가 높을수록 순서별 표현이 더 분리되는 상관이 관측됐다. 정확한 추론이 순서를 무시하는 하나의 공통 표현으로 수렴한다는 기대와 정면으로 어긋나는 결과다.
개발자 관점에서 이 논문은 평가 설계에 대한 경고로 읽힌다. 정답 일치율만 보면 모델이 프롬프트 순서에 얼마나 민감한지, 그리고 그 민감도가 표현 공간에서 어떻게 나타나는지 알 수 없다. 프롬프트 순서를 셔플링해 정확도를 재측정하고, 은닉 상태를 순서별로 묶어 클러스터 분리도를 계산하는 식의 표현 수준 진단을 정확도 지표와 함께 볼 필요가 있다는 것이다. 특히 규칙·전제·컨텍스트를 나열하는 형태의 프롬프트를 다루는 시스템이라면, 순서를 바꿨을 때 답은 유지되더라도 내부 표현과 후속 동작이 달라질 수 있다는 점을 전제로 검증해야 한다.
한계는 저자들이 명시한다. 첫째, 증거는 상관관계에 머물며 순서를 인코딩하는 것이 추론을 개선한다는 인과를 입증하지 않는다. 둘째, 합성 과제에 국한된 결과이고 사용된 모델들이 부분적으로 계보를 공유한다. 셋째, 더 넓은 수학 과제로 확장되는지는 확인되지 않았다. 저자들은 향후 과제로 순서 관련 표현에 개입하는 실험과 더 다양한 수학 과제에서의 검증을 제안한다.