LLM은 선택지가 많아질수록 정답 확신이 무너지고 앞쪽 후보에 끌린다
Overwhelmed by Choice: Studying LLM Decision Making at Scale
무엇인가
이 논문은 LLM의 다지선다·후보 선택 평가가 실제로는 선택지가 적은 환경에서만 검증되어 왔다는 문제를 다룬다. 기존 MCQ 벤치마크는 대개 선택지가 10개 미만이지만, 리랭킹, 의료 코딩과 진단, 분류체계 예측, 에이전트의 도구 선택 같은 실제 응용은 수백 개의 경쟁 후보 중 하나를 골라야 한다. 저자들은 후보 집합의 크기 자체를 평가 프로토콜의 변수로 놓고, 선택지가 늘어날 때 소규모 벤치마크에서 얻은 결론이 여전히 유효한지 체계적으로 검증한다.
어떻게 동작하나
실험 설정은 단일 정답 후보 선택이다. 모델은 지시문 I, 질의 q, 그리고 정확히 하나의 정답을 포함하는 인덱스된 후보 집합 O={(1,o1),(2,o2),…,(N,oN)}를 받는다. 후보 수 N은 5, 10, 20, 40, 80, 160으로 늘려가며, 확장 실험에서는 N=640까지, 그리고 1,000개 예시 평가와 부트스트랩 신뢰구간으로도 확인한다. Qwen3, Gemma, Llama, Phi 계열 오픈소스 모델을 기본 제로샷 프롬프팅으로 평가하고, 리랭킹·과학 분류·의료 진단·장문맥 추론·정보 추출 과제를 아우른다. 정확도뿐 아니라 모델 신뢰도 역학, 후보 간 상호작용, 컨텍스트 길이와 어텐션 위치 효과까지 분석한다.
무엇과 다른가
가장 먼저 반박하는 것은 "그냥 긴 문맥을 못 읽어서 그렇다"는 설명이다. 무관한 컨텍스트 길이를 늘려도 후보 수 확대에서 나타나는 저하 패턴이 재현되지 않았고, 선택지 자체를 길게 만드는 distractor-verbosity 통제에서도 마찬가지였다. 어텐션 분포와 실제 예측 위치 분포를 비교한 실험(HotpotQA, N=80)에서는 Llama-3.1-8B가 후보 위치 전반에 비교적 균형 있게 어텐션을 주고 Phi-4-mini는 뒤쪽에 훨씬 많이 주는데도, 두 모델 모두 예측은 일관되게 앞쪽으로 쏠렸다. 즉 어텐션 배분이 예측 위치 행동을 직접 설명하지 못하며, 문제는 검색(retrieval)이 아니라 후보 간 비교 단계에 있다.
어떻게 쓰나
저자들이 찾아낸 실패 패턴은 두 가지다. 첫째는 gold-margin collapse다. 각 후보 점수는 <Answer> idx </Answer> 형식으로 정답 인덱스를 생성할 때의 토큰 로그확률 합으로 계산하고, gold margin은 정답 점수에서 최고 점수의 오답 점수를 뺀 값이다. 후보가 늘수록 gold margin은 꾸준히 줄어들고 일부 대규모 구간에서는 음수가 된다. 중요한 건 원인인데, 오답 쪽 점수(log-sum-exp로 계산한 distractor mass)는 비교적 안정적인 반면 정답 점수가 훨씬 빠르게 무너진다. 경쟁자가 강해지는 게 아니라 정답에 대한 확신이 사라지는 것이다. 둘째는 early-option dominance다. 후보가 많아질수록 예측이 앞쪽 위치에 지배되고, 정답을 뒤쪽에 삽입하는 통제 실험에서 뒤쪽 정답은 점점 회수하기 어려워진다. 삽입 전 최강 오답을 pre-anchor라 부르고 두 지표를 측정하는데, anchor persistence는 정답 삽입 후에도 최종 예측이 pre-anchor로 남는 비율, retained anchor rate는 예측이 바뀌더라도 pre-anchor가 여전히 최고 점수 오답으로 남는 비율이다. 뒤쪽에 삽입된 정답은 확률이 낮아져 pre-anchor를 억제하지 못하고, 그 결과 앞쪽 오답 선호가 최종 예측까지 살아남는다.
전제와 한계
이 분석을 바탕으로 두 가지 추론 시점 개입을 평가한다. Hierarchical Partitioning은 큰 후보 공간을 작은 그룹으로 나눠 단계적으로 선택하게 함으로써 실질적인 비교 복잡도를 줄인다. Permutation-based Inference는 후보 순서를 여러 번 섞어 예측을 집계함으로써 초기 후보 지배를 완화한다. 강한 추론 베이스라인으로 Chain-of-Thought도 함께 넣었다. 결과적으로 두 방법 모두 단일 패스 추론을 능가하고, 후보가 많아질수록 격차가 커진다. N=160에서 HotpotQA와 MIMIC 모두 정확도가 약 20%포인트 향상된다. 반면 CoT는 절대 정확도를 올려주지만 큰 후보 집합에서는 여전히 크게 저하된다. 메커니즘 분석에서 두 개입은 최종 결정 단계의 gold margin을 더 크게 유지하고 초기 위치 편향을 약화시켰다. Permutation이 작은 N에서 최종 라운드 gold margin이 오히려 낮게 나오는 것은, 초기 합의로 끝난 쉬운 예시가 최종 비교 단계에 들어가지 않아 더 어려운 부분집합만 남기 때문이다.
개발자 입장에서 이 논문이 주는 실무적 신호는 분명하다. 리랭킹 top-k를 늘리거나, 에이전트에 등록하는 도구 목록을 키우거나, 진단·분류 후보를 넓히는 순간 정확도가 조용히 떨어질 수 있다. 작은 선택지 벤치마크에서의 좋은 점수는 대규모 후보 비교 능력을 보장하지 않는다. 또한 프롬프트에 후보를 나열하는 순서 자체가 결과를 좌우하므로, 순서를 섞어 집계하거나 계층적으로 후보를 좁히는 구조가 실질적인 완화책이 된다. CoT 같은 추론 강화만으로는 이 문제가 해결되지 않는다는 점도 기억할 만하다. 후보 수를 평가 프로토콜 변수로 취급하고, 배포 환경과 비슷한 N에서 직접 테스트해야 한다.
저자들이 밝힌 한계도 분명하다. 연구 범위는 주로 영어, 텍스트 전용, 단일 정답 후보 선택 과제의 추론 시점 행동에 국한된다. 통제 실험은 gold-margin collapse와 early-option dominance라는 행동 패턴을 규명하지만, 모델 내부 메커니즘에 대한 완전한 인과 설명을 제공하지는 않는다. 제안한 재구성 전략은 추가 추론 연산을 요구한다. 다국어·멀티모달·상호작용 설정으로의 확장과 더 연산 효율적인 개입 방법 개발이 향후 과제로 남아 있다.