타입 지정 결정 모델은 정의가 아니라 옵션 라벨을 읽는다
Labels Override Definitions in Jev-Style Typed Decision Models
무엇인가
Jev가 2026년 9월 공개한 이후 라우팅·콘텐츠 검열·트리아지용으로 퍼진 '타입 지정 결정 모델(typed decision model)'은 텍스트를 생성하지 않는다. 호출자가 상태(state)와 질문, 그리고 각 선택지의 짧은 라벨과 서술형 정의(definition)를 넘기면 모델은 선택지별 확률을 한 번의 포워드 패스로 돌려준다. 정의 필드는 개발자가 적용할 규칙을 적을 수 있는 유일한 자리이고, 라벨은 답을 되읽기 위한 식별자다. 인터페이스는 반환된 확률이 정의에 대한 사후확률이라고 암시한다. 이 논문은 그 암시가 실제로 성립하는지, 즉 확률이 정의를 따르는지 라벨을 따르는지를 묻는다. 저자들은 라벨 쪽으로 기우는 현상을 '옵션-라벨 편향(option-label bias)'이라 부른다. 같은 연산은 언어모델을 분류기로 쓸 때 라벨 문자열에 점수를 매기는 방식과 동일하므로, 문제는 전용 모델에만 국한되지 않는다.
어떻게 동작하나
방법의 핵심은 요청이 나르는 두 채널, 즉 라벨과 정의를 독립적으로 흔드는 것이다. 같은 요청을 여섯 가지 변형으로 다시 쓴다. aligned는 과제 고유의 클래스 이름을 그대로 쓰고, arbitrary는 이름을 A, B 같은 무의미한 문자로 바꾸며(정의만 정보를 가짐), arbitrary exchanged는 같은 무의미한 이름에 정의를 서로 뒤바꿔 붙인다. misleading은 각 클래스를 다른 클래스의 이름 아래 제시하되 정의는 여전히 자기 클래스를 정확히 서술한다. label only는 정의를 자리표시자로 지우고, neither는 두 채널을 모두 제거한 무정보 대조군이다. 상태도 real, null(빈 상태), mismatch(다른 항목의 상태)로 나눠 모델이 입력을 실제로 쓰는지 확인한다. 여기에 합성 라우팅 스위트 PolicyBench를 새로 만든다. 지원 티켓을 여섯 속성 위 템플릿으로 생성하고, 정책은 오직 정의에만 자연어로 적히며, 정답은 생성 속성에서 계산되므로 라벨 노이즈도 오염도 없다. 지표는 정확도, 뒤집힘률(flip rate), 상태 맹목성(state-blindness)이다.
무엇과 다른가
결과는 라벨의 압승이다. laya-typed-decisions에서 정의를 전부 삭제해도 정확도가 떨어지지 않았다(0.8559 대 0.8487, 구간 겹침). 반대로 라벨을 문자로 바꿔 정의만 정보를 갖게 하면 0.7971로, 두 채널 모두 없는 대조군 0.5690을 크게 웃돈다. 정의는 모델이 읽을 수 있는데도 라벨이 있으면 쓰이지 않는다는 뜻이다. 라벨과 정의가 서로 다른 클래스를 가리키면 정확도가 0.1357까지 떨어져 무정보 대조군보다도 낮다. PolicyBench-XF에서 선택지를 A, B로 부르면 정확도가 +0.1511 [+0.1377, +0.1646](n=3500) 올랐고, 잘못된 클래스를 가리키는 라벨조차 올바른 라벨보다 +0.0942 [+0.0754, +0.1129] 높았다. 무의미한 라벨의 종류는 상관없어서 무관한 단어·숫자·문자가 각각 0.8537, 0.8740, 0.8931을 기록했고, 의미 있는 이름은 0.7420에 그쳤다. 상태 맹목성도 aligned 라벨에서 0.634, arbitrary에서 0.524로, 의미 있는 라벨이 상태를 보완하는 게 아니라 밀어낸다.
어떻게 쓰나
네 모델 중 von만 다르다. 라벨이 클래스 이름이든, 무의미한 문자든, 틀린 클래스 이름이든 정확도가 0.8511로 같고, 정의를 지운 두 조건에서는 0.5102로 찬스 수준이 된다. 즉 von에게 라벨은 입력이 아니다. 두 코드베이스의 차이는 표현식 하나다. laya는 각 선택지를 "{label}: {definition}"으로 쓰고, von은 정의만 쓴다. 가중치를 전혀 바꾸지 않고 이 표현식을 양방향으로 바꾸자 laya 세 체크포인트는 정확히 불변(+0.0000 [+0.0000, +0.0000])이 됐고, von에는 효과가 생겨 라벨이 정의와 모순될 때 정확도가 0.8511에서 0.2281로 떨어졌다. PolicyBench 대조값도 정확히 0에서 +0.0333 [+0.0246, +0.0423]으로 움직였다. 선행 연구(Sun et al., 2026)는 이 실패를 이 모델들이 텍스트 디코더 대신 쓰는 제약된 결정 헤드 탓으로 돌렸지만, 저자들은 같은 선택지 문자열에 점수를 매기는 Qwen2.5-7B 라벨 로그확률 리드아웃에서도 같은 효과(+0.1203 [+0.1019, +0.1395], n=2100)를 확인하며 원인을 프롬프트 렌더링으로 특정한다.
전제와 한계
논문은 라벨과 무관한 두 번째 실패도 측정한다. 예/아니오 질문 앞에 "Is it false that"을 붙이면 laya-td는 0.9825 [0.977, 0.988]의 항목에서 결정이 뒤집히는데, 반환 확률은 거의 그대로다. 정확도는 0.6419에서 0.3576으로 가고 두 값의 합이 1에 가까운 것은 확률은 그대로인 채 정답 라벨만 뒤집혔기 때문이다. 극성을 보라고 명시적으로 지시해도 0.3546으로 달라지지 않는다. 라벨 불변인 von조차 0.9711 [0.964, 0.979]에서 뒤집혀, 두 실패가 서로 독립임을 보여준다. 신뢰도 점수도 무너진다. 평범한 라벨에서는 정답/오답을 AUROC 0.8123으로 분리하지만, 라벨과 정의가 어긋나 정확도가 0.1357로 떨어진 조건에서는 0.2433이 된다. 0.5 미만은 순위가 뒤집혔다는 뜻으로, 모델이 가장 확신한다고 보고한 결정이 더 자주 틀린다. von은 두 조건 모두 0.8055로 같다.
완화책 네 가지는 원칙이 아니라 측정값으로 제시된다. M1은 선택지를 A, B로 이름 붙이고 규칙 전부를 정의에 넣는 것으로, PolicyBench-XF에서 +0.1511의 가치가 있지만 클래스 이름 자체가 좋은 예측자인 일반 분류 과제에서는 오히려 정확도를 깎는다(라벨 제거 시 0.8487에서 0.8067로 하락). 반대로 PolicyBench에서 라벨을 빼면 laya-td가 0.7420에서 0.8914로 오른다. M2는 빈 상태로 한 번 호출해 얻은 분포를 나눠 정규화하는 문맥 보정으로, aligned 라벨에서 laya-td에 +0.0391, Qwen2.5-7B 리드아웃에 +0.0748을 주지만 라벨이 이미 무의미해진 뒤에는 손해이고, 정의가 곧 입력인 von에는 정확도를 정확히 0.5000으로 떨어뜨리는 해악이 된다. M3은 라벨을 무시하라는 지시문으로 +0.0138 [+0.0077, +0.0200]에 그친다. M4는 aligned와 arbitrary 두 렌더링이 불일치하는 항목을 표시하는 것으로, 남은 항목의 정확도를 0.7420에서 0.8921로 올리며 커버리지 0.8100, 정밀도 0.8977을 기록한다. 라벨이 의미를 지켜야 할 때 쓰는 옵션이며, 그렇지 않다면 M1이 전체 커버리지에서 0.8931로 더 낫다.
실무자는 논문 나머지를 읽지 않고도 세 가지를 할 수 있다. 첫째, 두 번 호출 테스트를 돌린다. 같은 질문을 정의는 그대로 두고 라벨만 바꿔 두 번 물어 반환 분포를 비교하는 것으로, 정답 라벨도 홀드아웃 데이터도 가중치 접근도 필요 없어 호스팅 모델에도 적용된다. 분포가 같으면 정의만으로 충분하게 써야 하는 von형 모델이고, 다르면 라벨이 결정에 영향을 주는 laya형이므로 완화책을 적용한다. 둘째, 규칙이 클래스 이름이 아니라 정의에 산다면 선택지를 A, B로 바꾼다. 셋째, 신뢰도 임계값으로 이 실패를 걸러내려 하지 않는다. 라벨과 정의가 어긋날 때 신뢰도는 오답을 더 높게 매기므로, 임계값 게이트는 맞힌 항목을 상위 모델로 넘기고 틀린 항목을 그대로 받아들이게 된다. 참고로 score 타입 질문은 라벨과 정의가 같은 문자열이라 이 회피책을 적용할 수 없다.
저자들이 밝힌 한계는 분명하다. 상용 모델 Jev 자체는 측정하지 않았고, 주장은 공개 가중치 구현과 언어모델 리드아웃에 한정된다. 메커니즘 주장도 열린 코드베이스 두 곳에서 책임 있는 한 줄을 제시한 것이지 폐쇄된 코드를 들여다본 것이 아니다. PolicyBench는 합성 템플릿이라 정확한 정답과 균형, 오염 면역을 얻는 대신 자연스러움을 포기했고, 자연 과제 스위트가 그 반대편을 맡는다. misleading 조건은 라벨과 정의가 모순된, 다소 미명세한 요청이라 논증의 중심은 모순이 전혀 없는 arbitrary 대 arbitrary exchanged, 그리고 arbitrary 대 aligned 대비에 놓인다. 정의 문구는 저자들이 직접 쓴 것이라 표현이 달라지면 절대 수치는 움직인다. laya-multilingual은 PolicyBench 전반에서 찬스 수준이라 그 대비값에서는 결론을 끌지 않는다.