LLM은 이미 Jev식 결정 모델이며 파인튜닝은 언제 필요한가
LLM-as-Jev: LLMs Are Already Jev-Style Decision Models -- When and How to Fine-Tune Them
무엇인가
이 논문이 다루는 문제는 소프트웨어가 정해진 후보 집합 중 하나를 고르는 결정, 예컨대 지원 티켓 라우팅, 사용자 의도 식별, 규칙 충족 여부 검증을 LLM으로 처리할 때 생기는 마찰이다. 일반 챗 모델은 답을 자유 텍스트로 생성하므로 이를 구조화된 값으로 다시 파싱해야 하고, 지연과 형식 오류 위험이 따라붙는다. Jev는 자유 텍스트 생성 없이 후보 선택지에 대한 범주형 확률분포를 직접 반환해 하위 소프트웨어가 출력을 그대로 소비하게 한다. Jev의 가중치와 학습법은 비공개지만 공개 리더보드 JevBench에는 60개 이상의 커뮤니티 Jev식 모델이 올라와 있고 성능 편차가 크다. 같은 Qwen3.5-4B 백본에서 Plumb은 LoRA 반복 학습으로 89.6%를 얻은 반면, Hopper(82.3%)와 reflex(79.2%)는 파라미터를 건드리지 않고 옵션 문자 로짓만 읽는 SemIf(81.0%)와 비슷한 수준에 머문다. 저자들은 이 대비에서 두 질문을 뽑는다. 사전학습 LLM이 결정 능력을 얼마나 이미 갖고 있는가, 그리고 파인튜닝은 어떤 조건에서 실질 이득을 주는가.
어떻게 동작하나
제안하는 LLM-as-Jev는 아키텍처, 토크나이저, 어휘를 바꾸지 않는 프레임워크다. 사용자 프롬프트에 상태와 후보들을 [1]부터 [K]까지 대괄호 숫자 식별자로 한 줄씩 나열하고, "Select one option. Answer only with its bracketed numeric identifier."라고 지시한다. 어시스턴트 턴은 고정 접두사 "Best answer: ["로 프리필하며, 후보 k를 고르는 것은 "k]"를 생성하는 것과 같다. 모든 후보 접미사가 닫는 대괄호로 끝나므로 어떤 완성도 다른 완성의 접두사가 될 수 없고, 이 성질 덕분에 후보 수에 상한이 없다. 문자 하나를 읽는 방식이 16개나 26개로 묶여 있는 것과 대비된다. 후보 접미사들은 접두사 트리를 이루는데 그 깊이는 토크나이저에 달려 있다. 숫자를 개별 토큰으로 처리하는 Qwen은 깊이가 log10 K에 2를 더한 수준이고, 999까지의 정수를 한 토큰으로 묶는 Phi-4 계열은 깊이 2가 된다. 점수는 후보 접미사 토큰들의 로그확률을 누적한 뒤 전체 후보에 대해 소프트맥스로 정규화한다. 모든 후보를 하나의 프롬프트 안에서 함께 조건화해 비교하는데, 후보를 개별적으로 채점하는 jev-local은 같은 조건에서 Qwen3.5-9B로도 74.9%에 그친다. 접미사가 미리 알려져 있으므로 프롬프트 프리픽스의 KV 활성값을 캐시한 뒤 teacher forcing으로 후보 분기들을 병렬 채점할 수 있어, 151개 선택지 과제도 프리필 한 번과 최대 세 번의 짧은 forward pass로 끝난다.
무엇과 다른가
파인튜닝 레시피의 핵심은 트리 인수분해 listwise 손실과 세 개의 KL 앵커다. 후보 접미사 트라이의 각 노드에서 유효한 전이 토큰만 남기고 국소 재정규화한 확률의 골드 후보 음의 로그우도를 최소화한다. 골드 경로를 따라서만 확률을 계산하면 되므로 K=151 같은 고카디널리티 과제도 계산이 가능하다. 다만 이 손실은 유효 토큰들 사이의 상대적 선호만 벌하고, 유효 형식에 배정된 절대 확률 질량이나 불법 토큰, 결정과 무관한 위치는 전혀 제약하지 않는다. 그래서 동결된 참조 모델을 기준으로 세 가지 KL 앵커를 건다. 유효 대 불법 토큰 질량의 베르누이 KL, 불법 토큰으로 재정규화한 분포의 KL, 후보 접미사 밖 위치의 KL이다. 참조 모델의 상위 64개 토큰만 남기고 나머지를 꼬리 버킷으로 합치는 근사는 데이터 처리 부등식에 의해 전체 KL의 엄격한 하한이면서 계산을 크게 줄인다. 전체 목적함수는 listwise 손실에 앵커 항들을 λ로 가중해 더한 형태이고 기본값은 λ=1이다. 학습은 전체 파라미터 또는 디코더 블록의 선형 계층에 적용하는 LoRA로 하며 LoRA 가중치는 학습 후 병합해 추론 지연을 동일하게 유지한다. AdamW와 FSDP, 단일 에폭, 후보 순서 셔플을 쓰고, 학습 데이터는 공개된 사람 주석 데이터셋만으로 구성하며 교사 모델의 합성 라벨을 쓰지 않는다. 평가 벤치마크와 13단어 n-gram이 겹치는 학습 인스턴스는 걸러낸다.
어떻게 쓰나
학습 없이 얻은 결과가 논문의 중심 주장이다. 동결된 Qwen3.5-4B는 JevBench 공개 231문항 중 188개를 맞혀 81.4%를 기록했고, 이는 같은 백본을 쓴 SemIf(186개, 81.0%, 승 15 대 패 13, p=0.85)와 파인튜닝된 reflex 4B(184개)를 앞서거나 맞먹는 수치다. 더 큰 Winnow-12B(86.6%)와 상용 GPT-5.6 Sol(94.4%)만이 앞선다. 외부 벤치마크 macro 정확도에서는 SemIf를 3.2%포인트 앞서며 313승 154패(p<10^-12)를 기록했고, MMLU에서 +123/-56, MMLU-Pro에서 +96/-41, ARC-Challenge에서 +28/-8로 격차가 컸다. 두 시스템이 같은 기본 가중치를 쓰므로 이 차이는 후보를 함께 조건화하고 접두사 없는 채점을 쓰는 설계에서 나온다. Banking77의 77개 의도는 단일 추론 패스로 69.0%를 맞혔는데, 문자 로짓 방식으로는 프롬프트 형식을 근본적으로 바꾸지 않고는 불가능한 규모다. 보정 품질도 사후 온도 스케일링 없이 ECE 0.057로 SemIf(0.061)와 reflex 4B(0.070)를 앞선다. 그리디 자기회귀 생성으로 물었을 때도 81.4%로 동일한 정확도와 파싱 실패 0을 보여, 병렬 채점과 자연 생성이 같은 후보를 고른다. 멀티모달도 별도 튜닝 없이 같은 인터페이스로 동작해 MMBench CircularEval 82.4%, MMStar 64.6%를 냈고, 이미지 입력을 빼면 15.2%와 28.8%로 무너져 결정이 실제 시각 이해에 의존함을 확인했다.
전제와 한계
파인튜닝의 효과는 보편적이지 않고 학습 데이터가 덮는 과제에 집중됐다. 의도 분류 중심 혼합물은 Banking77을 끌어올렸지만 JevBench 정확도를 81.4%에서 100스텝에 77.5%, 한 에폭 후 74.9%로 떨어뜨렸다. 이진 검증에서 "yes"로 쏠리는 확증 편향, "none of the above" 폴백 억제, 표층 키워드 의존, 과신이라는 네 가지 실패 모드가 나타났고, KL 앵커로는 막을 수 없었다. 앵커는 유효 후보 사이의 확률 재분배를 허용하기 때문이다. 검증, 폴백, 형식 논리, 이진 선택을 고루 담은 Reason-9k 혼합물은 이런 단축을 제거하고 81.4%를 회복했다. 반대로 데이터 양만 늘린 Reason-21k와 Reason-30k는 오히려 JevBench를 악화시켰는데(p≤0.03), 학습 데이터가 모두 570단어 미만 단문이라 장문 추론 능력을 훼손한 탓이다. 장문 코퍼스를 더한 Reason+Long-12k가 이 회귀를 멈추고 0.6B의 장문 정확도를 두 배로 올렸다(p=0.02). 모델 규모도 결과를 가른다. 0.6B는 형식 준수 자체가 약해 파인튜닝이 전반적 향상을 주지만, 4B는 전체 파라미터 튜닝으로 JevBench에서 순이득이 없었고(74.9~81.4% 대 81.4%) Banking77 같은 특정 영역에만 개선이 제한됐다. LoRA만이 4B 기준선을 2.6%포인트 올려 84.0%, ECE 0.050을 달성했다(p=0.01).
정규화 설정에서는 앵커가 생성 안정성의 필수 조건이었다. 앵커가 없으면 4B가 231개 질의 중 69개에서 식별자 뒤에 불필요한 텍스트를 계속 생성했고, 0.6B는 대화에서 종료 실패를 보였다. λ가 0.01만 되어도 이런 형식 파괴 생성이 거의 사라진다. λ=1이 두 규모 모두에서 JevBench 정확도와 보정 오차 면에서 최고였고 권장 기본값이다. 0.6B에서 λ를 0.1 이하로 낮추면 Banking77 의도 정확도가 약간 오르지만 종료되지 않는 답변이 통계적으로 유의하게 늘어난다(p=0.007). 유능한 백본에는 LoRA가 최선이며, 다만 LoRA만으로 KL 앵커를 대체할 수는 없어 정규화 없는 LoRA도 텍스트 모드에서 종료 실패를 겪는다.
실무 관점에서 저자들이 제시하는 지침은 다음과 같다. 먼저 학습 없는 베이스라인을 기본으로 삼아라. 유능한 파운데이션 모델과 번호 기반 접두사 없는 인터페이스 조합만으로 잘 보정된 출발점이 되고, 멀티모달 백본은 시각 결정 능력이 제로샷으로 나오며, 새로 공개된 LLM도 학습 지연 없이 즉시 평가할 수 있다. 파인튜닝은 사전학습 모델이 명확히 약한 지점, 예컨대 작은 파라미터 규모나 고카디널리티 라우팅 과제에만 쓰고, 이질적인 결정 과제 전반의 정확도를 끌어올릴 것이라 기대하지 마라. 학습 혼합물은 이진 검증, 폴백 선택지, 실제 프롬프트 길이 분포까지 포함해 배포 분포와 맞춰야 하며, 다양한 지시 표현을 넣고 키워드만으로 풀리는 사소한 인스턴스는 걸러내야 한다. 수백 스텝 수준의 짧은 예산이면 충분하다. KL 앵커는 반드시 유지하고 λ=1을 기본으로 두라. 유능한 백본에는 LoRA를 쓰라. 마지막으로 체크포인트 선택은 in-distribution 학습 손실이 아니라 OOD 전이 프로브로 하고, 열린 프롬프트에 대한 자기회귀 완성을 직접 확인하라. 표준 우도 지표는 문법 붕괴와 생성 폭주를 감지하지 못한다.
저자들이 밝힌 한계와 전제도 분명하다. 평가는 JevBench 공개 231문항(쉬움 48, 표준 72, 어려움 111)에만 한정되며, 비공개·봉인 테스트 스위트는 쓰지 않았으므로 보고된 수치는 공식 리더보드 순위가 아니라 진단용 정확도다. 데이터 혼합물 반복이 공개 JevBench 샘플에 대한 오류 분석에서 출발했기 때문에 4.3.3절의 결과는 탐색적으로 취급하며, JevBench는 하이퍼파라미터 튜닝과 체크포인트 선택에서 엄격히 제외했다. 후보를 함께 채점하는 방식은 옵션 순서에 민감한 위치 편향을 갖는데, 학습 시 순서 셔플로 완화할 뿐 추론 시 순열 평균은 계산 비용 때문에 적용하지 않아 잔여 편향이 남는다. 학습 데이터는 공개된 사람 주석 데이터셋으로 제한했고, 실험은 Qwen3.5-4B와 Qwen3-0.6B 두 모델에서만 수행됐다.