FLEET는 LLM의 무기억 샘플링을 엔트로피 기반 궤적 검색으로 바꾼다
FLEET: From Logits Entropy to Enhanced Trajectories in Text Generation
무엇인가
대규모 언어모델(LLM)을 실무에 붙일 때 흔히 쓰는 테스트타임 스케일링 기법은 같은 프롬프트에 온도를 올려 여러 개의 답을 뽑고 그중 하나를 고르는 방식이다. 이 논문은 그 방식이 근본적으로 준최적이라고 주장한다. 온도 샘플링은 이전 생성물과 그에 대한 평가를 전혀 기억하지 못하는 무기억(memoryless) 절차라서, 샘플을 많이 뽑을수록 의미상 중복되는 답이 차지하는 비율이 커지고 수확 체감이 발생한다는 것이다. 저자들은 이를 세 가지 구조적 한계로 분해한다. 첫째, 과제 성패를 가르는 소수의 분기점(branching point)에서 최적 토큰이 최빈값이 아닐 때 샘플링은 계속 쓸모없는 후보에 확률 질량을 배분하고, 분기점이 늘어날수록 정답 궤적을 뽑을 결합 확률이 지수적으로 줄어든다. 온도를 올리면 비최빈 최적 토큰을 뽑을 확률은 올라가지만 그렇지 않던 안정적인 단계까지 분산이 함께 부풀어 오히려 전체 성공률이 떨어진다. 둘째, 실제로는 어휘의 좁은 부분집합만 유효한데 구두점이나 함수어, 결정적 코드 문법처럼 엔트로피가 낮은 단계에도 무차별적으로 확률적 샘플링이 적용된다. 셋째, 온도 T와 top-k, top-p, min-p 같은 절단 임계값이 통합된 이론적 근거 없이 프롬프트·모델·과제에 민감한 임시 튜닝 파라미터로 남는다. 저자들은 기존 절단 기법이 둘째와 셋째는 완화하지만 첫째는 해결하지 못한다고 진단하고, 보상 정보를 기억에 담아 탐색할 상태와 활용할 상태를 구분하는 경량 메모리 메커니즘을 제안한다.
어떻게 동작하나
제안 방법 FLEET(From Logits Entropy to Enhanced Trajectories)의 핵심은 생성 과정을 무작위 샘플링이 아니라 완성 공간에 대한 체계적 검색으로 바꾸는 것이다. 먼저 모델의 비정규화 로짓에서 조건부 엔트로피 H와 바렌트로피(varentropy) V를 계산해 고불확실성 상태를 분기점으로 검출한다. 엔트로피 하나만 쓰지 않는 이유는 두 지표가 분포 모양의 상보적 측면을 설명하기 때문이다. H는 전체 불확실성을 재지만 동의어 군집이나 결정적 추론 단계처럼 의미상 중복되는 토큰이 많을 때 거짓 양성을 낸다. 반면 V는 로그확률이 평균 엔트로피 주위에 얼마나 흩어져 있는지를 재서 의미상 동등한 동의어 분포에서는 비교적 불변이고, 확률 질량이 서로 다른 후보 군집으로 갈라지는 다봉(multimodal) 결정 단계에서 두드러지게 치솟는다. 두 지표는 임베딩 차원으로 정규화된다. 또한 저자들은 마지막 층 로짓이 후반부 확률 평활화 때문에 가장 민감한 불확실성 신호를 주지 못한다고 보고, 중간 층 l < L의 은닉 표현 h^(l)을 언어모델 헤드 W_U로 어휘 공간에 직접 투영하는 로짓 렌즈(logit lens) 기법을 쓴다(l_t^(l) = W_U h_t^(l) + b_U).
무엇과 다른가
연속 벡터 공간의 은닉 상태를 이산적인 검색 상태로 묶기 위해 VectorDSU(Vector Disjoint Set Union)라는 온라인 자료구조를 도입한다. 이는 두 은닉 벡터의 코사인 유사도가 보정된 임계값 τ 이상이면 각각을 투영한 어휘 분포 사이의 KL 발산이 ε 이하로 유계라는 표현 정렬 성질에 기반한다. 새 은닉 상태 h가 들어오면 기존 대표 벡터 μ_i 중 코사인 유사도가 가장 높은 것에 배정하고, 최대 유사도가 τ 미만이면 새 컴포넌트를 만든다. 각 컴포넌트는 메모리 노드로 동작하며 실행된 토큰 a_t, 도달한 다음 상태 C_{t+1}, 궤적을 따라 누적된 보상 R̄(s_t, a_t)로 이루어진 전이 튜플을 기록한다. 이 메모리 위에서 몬테카를로 트리 탐색의 pUCT를 쓴다. pUCT(s,a) = Q(s,a) + c_puct · P(s,a) · √N(s) / (1 + N(s,a)) 형태로, Q는 알려진 모든 결과에 걸친 보상 기대값이고 P(s,a)는 로짓에 재샘플링 온도 T_resample을 적용한 뒤 상위 k개 토큰으로 제한한 사전 확률이다. 아직 방문하지 않은 토큰들은 하나의 탐색 행동으로 묶어 사전 질량을 합산해 두고, 이미 평가된 준최적 토큰은 개별적으로 벌점을 받는다. 최종 토큰 선택을 강제로 바꾸는 대신, FLEET는 디코딩 파이프라인을 유지한 채 이미 디코딩·평가되었지만 갱신된 pUCT 목적함수를 최대화하지 못하는 토큰에 로짓 벌점 λ를 가하는 소프트 제약으로 개입한다(l̂_{t,a} = l_{t,a} − λ·I[N(s_t,a)>0 ∧ a ≠ argmax pUCT]). 실험에서는 λ를 최대 로짓으로 동적 설정하고 FLEET가 처리한 점수로 그리디 디코딩을 수행했다. 외부 과제 신호가 없을 때 탐색된 행동에는 0.5의 곱셈 사전확률이, 미탐색 통합 행동에는 1이 주어지는데, 저자들은 0.5를 학습된 도메인 확률이 아니라 탐색 편향으로 명시한다. 임계값은 최근 엔트로피-바렌트로피 쌍을 담은 고정 용량 버퍼로 관리하며, H > τ_H ∧ V > τ_V를 만족하는 비율이 목표 ρ(i) = min(i^{1/3}, 100)%보다 낮으면 버퍼의 경험적 분포를 이용해 임계값을 완화한다.
어떻게 쓰나
실험은 객관적으로 검증 가능한 보상 함수를 가진 두 벤치마크에서 수행됐다. 알고리즘 코드 생성에는 LiveCodeBench(2023년 12월 컷오프 이후 개최된 대회의 쉬운(easy) 과제 222개로 제한), 수학 추론에는 GSM8K를 썼다. 베이스 모델은 Llama 3.2-3B이고, 결과 보상 모델(ORM)로는 같은 Llama 3.2-3B 아키텍처에 파인튜닝된 Skywork-Reward-V2를 배치했다. 문제마다 n = 32개의 궤적을 생성하고 1 ≤ k ≤ n 구간의 전체 스케일링 곡선을 보고한다. 평가는 두 갈래다. 정답 검증(Ground-Truth Verification)은 시퀀스 완료 시 결정적 피드백을 주는데, LiveCodeBench는 통과한 단위 테스트 비율에 비례하는 연속 부분 보상을, GSM8K는 0 또는 1의 희소 이진 신호를 준다. ORM 유도는 정답 접근 없이 대리 보상 모델이 종단 평가자 역할을 하는 현실적 배포 환경을 모사한다. 온도 샘플링 기준선은 표준 조합적 Pass@k 추정량(Pass@k = 1 − C(n−c, k)/C(n, k))을 쓰고, 결정적 그리디 디코딩을 쓰는 FLEET는 처음 k개 궤적 중 하나라도 정답이면 1인 접두 기반 값으로 계산한다. 기준선의 샘플링 온도는 별도 분할에서 베이지안 탐색으로 독립 최적화했고, 생성 길이는 1,024 토큰으로 제한했다.
전제와 한계
정답 검증 체제에서 FLEET는 두 도메인 모두에서 표준 확률적 샘플링을 앞섰다. 가장 큰 개선은 LiveCodeBench로, Pass@32 정확도가 59.9%에서 66.2%로 6.31%포인트 절대 상승했고 222개 과제 중 14개를 추가로 해결했다. GSM8K에서는 기준선 온도 샘플링이 이미 97.27%로 포화 상태였는데도 FLEET는 같은 후보 예산 안에서 기준선이 풀지 못한 수학 문제 7개를 추가로 디코딩했다. 저자들은 VectorDSU가 직교적인 탐색 경로를 강제해 중복 궤적 탐색을 피하기 때문에 후보 예산이 늘수록 FLEET의 스케일링 곡선이 더 가파르고 견고하다고 설명한다. 초록에서는 반복 샘플링 기준선과 같은 정확도를 3배 속도로 달성한다는 결과도 보고된다.
ORM 유도 체제에서는 그림이 갈린다. LiveCodeBench에서 ORM 선택 기준 FLEET는 해결률을 19.36%(43개)에서 25.22%(56개)로 끌어올려 기준선을 앞섰다. 그러나 ORM 선택 성능 0.2522와 FLEET 후보 풀의 정답 검증 정확도 0.6937 사이에는 큰 보상 순위 격차가 드러난다. 검색 프레임워크는 정답 알고리즘 해를 후보 풀 안에서 실제로 찾아내지만, 대리 보상 모델이 그것을 오답 위로 안정적으로 순위 매기지 못한다는 뜻이다. 저자들은 ORM이 LiveCodeBench의 신뢰할 만한 검증자가 아니면서도 그 피드백이 FLEET를 보상 해킹으로 몰아가지 않는다고 덧붙인다(정답 검증 점수가 정답 유도 점수보다 일찍 정체하지 않았다). GSM8K에서는 ORM 선택 기준으로 기준선 온도 샘플링이 0.8544 대 0.8362로 FLEET를 근소하게 앞섰는데, 저자들은 보상 모델이 정답 근사가 아니라 선호 데이터 조건화의 부산물로 간접 단서를 쓴 탓이라고 가설을 세운다. 다만 FLEET의 정답 검증 지표는 0.9780(1,290문제 해결)으로 단독 정답 검증 성능과 동일했다. 하이브리드 구성, 즉 검색 역학은 조밀한 ORM 점수 메모리를 쓰되 최종 평가는 정답을 쓰는 경우 FLEET는 같은 후보 예산에서 LiveCodeBench 과제 7개를 추가로 해결했다.
실무 관점에서 이 논문이 주는 신호는 세 가지다. 첫째, 여러 샘플을 뽑아 다수결이나 보상 모델로 고르는 파이프라인에서 중복 답변 비율이 성능 상한을 만들고 있다면, FLEET류의 상태 메모리 접근이 후보 다양성을 구조적으로 확보하는 대안이 될 수 있다. 둘째, FLEET는 기존 디코딩 파이프라인을 교체하지 않고 로짓에 소프트 벌점을 가하는 방식으로 개입하며, 그리디 디코딩 구성에서 결정적이고 단일 보정 패스로 주요 하이퍼파라미터를 도출한다고 주장하므로 도입 비용 자체는 낮은 편이다. 다만 은닉 활성값과 출력 확률 분포에 접근해야 하므로 내부 상태를 노출하지 않는 API 기반 모델에는 그대로 적용하기 어렵다. 셋째, ORM을 최종 선택자로 쓰는 구성에서는 검색이 찾아낸 정답을 ORM이 제대로 순위 매기지 못하는 병목이 실제로 관측됐다. 후보 생성 능력과 최종 랭킹 능력을 분리해서 측정해야 한다는 실무 교훈이 여기서 나온다.
저자들이 명시한 전제와 한계는 다음과 같다. 평가는 Llama 3.2-3B라는 단일 dense 자기회귀 아키텍처에 국한되며, Mixture-of-Experts, 멀티모달, 성찰(reflection) 비중이 큰 추론 아키텍처에는 아키텍처별 보정이 필요할 수 있다고 밝힌다. FLEET는 모델 내부 활성값과 출력 확률 분포에 대한 접근을 전제한다. VectorDSU 메모리가 한 워커나 과제의 상태-행동 통계를 다른 FLEET 워커에 공급하는 교차 세션·교차 도메인 전이 인터페이스를 제공하지만, 그 이득은 이번 실험에서 평가되지 않았다. GSM8K는 기준선이 97.27%로 천장 효과를 보여 개선 여지 자체가 작다. ORM 유도 실험에서는 대리 보상 모델의 순위 오류가 확인됐고, FLEET가 유도하는 탐색 경로가 프록시 보상 모델이 선호하는 전형적 문체 패턴에서 벗어나 후보 예산이 커질수록 선택이 준최적으로 흐를 수 있다고 서술한다. 또한 탐색된 행동에 주는 0.5 사전확률은 학습된 도메인 확률이 아니라 탐색 편향이며, 로짓 벌점 λ를 최대 로짓으로 두는 설정은 실험 특화 휴리스틱이다.
관련 논문
- 하이브리드 LLM의 KV 너머의 기억을 4B에서 9B로 프리픽스 재생 없이 넘긴다Qwen3.5 4B 하이브리드 모델의 살아 있는 추론 메모리를 9B 모델로 접두사 재처리 없이 넘기는 LatentPort 연구를 정리한다. 번역된 KV에 Gated DeltaNet 영속 상태를 더해 NLL을 0.747 nats/token 낮췄다.
- 검색된 기억을 그대로 믿지 않게 만드는 0-파라미터 메모리 결정 계층LLM 메모리 시스템은 검색 효율에 집중해 왔지만, 검색된 기억을 신뢰할지 판단하는 문제는 상대적으로 다뤄지지 않았다. 이 논문은 상충하는 기억이 RAG 환각을 키우는 문제를 세 신호 기반의 해석 가능한 결정 컨트롤러로 다룬다.