SanSi는 같은 층을 반복 적용해 타입 지정 결정의 정확도를 높인다

SanSi: A Looped Typed Decision Model for System 1.5 Thinking

HF Daily2610.07730

Shuyu Gan, Young-Jun Lee, Dongyeop Kang2026-10-06

무엇인가

타입 지정 결정 모델(typed decision model)은 상태와 질문, 그리고 호출자가 선언한 선택지 목록을 받아 텍스트 생성 없이 한 번의 순전파로 선택지별 확률을 돌려준다. 상용 Jev API와 오픈 재구현 Kev가 이 형식을 쓰고, 그 확률은 수락·에스컬레이션·라우팅 결정에 쓰인다. 문제는 한 번의 패스가 모든 결정에 고정된 양의 연산만 준다는 점이다. 논문은 "Omar는 정직하다, Bert는 Omar가 진실을 말한다고 한다, Ben은 Bert가 거짓말한다고 한다" 같은 연쇄 추론에서 Jev API의 정확도가 1단계 100%에서 3단계 62.5%로 떨어지고 6단계부터는 우연 수준이 된다는 측정을 근거로 든다. 더 큰 모델은 파라미터와 메모리를 늘리고, 생성형 추론은 토큰과 지연을 늘리면서 타입 지정 계약을 깨뜨린다. 저자들은 그 사이에 있는 선택지로 층 반복(looping)을 놓고 이를 System 1.5 사고라고 부른다.

어떻게 동작하나

SanSi의 구조는 다음과 같다. 백본은 반복 실행을 전제로 사전학습된 Ouro-1.4B(24층 스택)이며, 정규화된 은닉 상태 h_t = N(F(h_{t-1}))를 t번째 루프의 출력이자 t+1번째 루프의 입력으로 다시 넣는다. 입력 토큰은 다시 주입하지 않는다. 프롬프트는 선택지를 A, B, … 로 나열하고 "Answer:"로 끝나며, 마지막 프롬프트 토큰 위치의 은닉 상태 z_t에 대해 로짓을 ℓ_t = (W + U_t V_t) z_t / τ_t 로 계산하고 선언된 K개 선택지에 대해서만 소프트맥스를 취해 p_t를 얻는다. W는 선택지 글자에 해당하는 동결된 언어모델 헤드 행이고, 랭크 16 보정 U_t V_t와 스케일 τ_t는 루프마다 하나씩 학습되며 항등에서 출발한다. p_t가 h_t만으로 계산되므로 한 번의 실행으로 예산 1~8 루프의 결정을 모두 얻는다. 학습 손실은 모든 루프에 대해 교차엔트로피와 Brier 점수를 더한 값을 T개 루프에 평균한 것이고, 각 루프의 손실은 모든 루프를 거쳐 역전파된다. 백본 가중치는 동결하고, 모든 어텐션·피드포워드 투영에 랭크 64 LoRA(60.6M, 전 루프 공유)와 리드아웃(0.27M)을 붙여 총 61M만 학습한다. T=8(사전학습의 4루프의 두 배)로, 16개 항목 1,000스텝으로 훈련한다.

무엇과 다른가

평가는 59개 출처에서 모은 10,027개 테스트 결정으로 구성했다. 학습 12,800개, 개발 2,471개이며 테스트 중 382개는 답할 수 없는 항목, 766개는 크라우드 라벨 분포를 가진다. 비교 대상은 같은 형태의 비루프 모델 SmolLM2-1.7B, 같은 백본을 1루프로 학습·실행한 Ouro-1.4B, 크기가 비슷한 최신 모델 Qwen3.5-2B, 파라미터가 세 배인 Qwen3.5-4B, 그리고 같은 데이터를 Kev 자체 코드·레시피로 학습한 Kev-4B(our data)다. 모든 모델은 같은 학습 항목, 같은 순서, 같은 LoRA 랭크, 같은 리드아웃과 손실로 시드 3개씩 학습한다.

어떻게 쓰나

주요 수치는 SanSi 72.0% 대 SmolLM2-1.7B 58.4%로 13.5점 차이다(95% 구간 [12.5, 14.5]). 같은 백본을 1루프로 학습한 Ouro-1.4B는 58.6%로 SmolLM2와 구분되지 않으므로, 이 차이는 루프에서 나온다. Qwen3.5-2B보다는 5.3점 앞서고, Qwen3.5-4B보다는 1.8점 뒤진다. 비용은 추론 7.7배, 학습 9.5배의 GPU 시간이다. 항목 유형별 이득은 분류 +3.1점으로 가장 작고, 다단계 추론 +15.1, 긴 문서 +16.7, 문장쌍 +14.2, 지식 질문 +17.6점으로 가장 크다. 학습 데이터로부터의 거리로 보면 분포 내 10.5점, 근거리 전이 10.0점, 원거리 전이 15.8점이다. 루프별로는 2루프가 8.5점, 3루프가 3.5점, 4루프가 1.2점을 더하고 5~8루프를 합쳐 0.4점만 더한다. 3루프에서 전체 이득의 88%인 70.4%에 도달한다. 더 큰 백본을 쓴 SanSi-2.6B는 75.8%로 Qwen3.5-4B를 2.0점 앞서면서 파라미터는 63%만 쓴다. 참고로 Kev-4B(our data)는 74.3%이고, 상용 Jev API는 전체 테스트에서 78.9%, 학습에 쓰지 않은 출처만 보면 83.5%(SanSi-2.6B는 71.9%)다.

전제와 한계

루프가 답을 어떻게 바꾸는지도 측정한다. 답할 수 있는 9,645개 항목에서 8루프는 1루프 답의 21.0%를 고치고 7.3%를 망가뜨린다(고침이 약 3배). 4루프 이후 90.2%의 답이 확정되고, 5루프부터는 고침과 망가뜨림이 균형을 이룬다. 어떤 루프에서 맞았지만 8루프에서 틀린 항목이 최대 11.7%라서, 루프 선택 규칙이 얻을 수 있는 상한이 정해진다. 답이 처음 안 바뀌는 시점을 정착(settling)이라 하면 56.7%는 1루프 뒤 안 바뀌고 89.1%가 4루프까지 정착한다. 단일 패스 모델 세 개가 모두 맞히는 항목은 평균 1.4루프에, 하나만 맞히는 항목은 3.0루프에 정착한다. 끝까지 안 바뀐 답은 82.2%가 맞지만 8루프에서 정착한 답은 35.6%만 맞다. 확률 쪽에서는 정답 신뢰도가 0.769에서 0.869로, 오답도 0.567에서 0.660으로 함께 오르고, 정답/오답 분리 AUROC는 0.760에서 0.795로 조금 좋아진다. ECE는 0.105에서 3루프의 0.082까지 내려가지만 답이 정착한 뒤 신뢰도가 계속 올라 8루프에서 0.093으로 되돌아간다. 핵심 근거가 제거된 382개 항목에서 단정적 답변 비율은 27.1%에서 17.5%로 줄고, 근거 유무 구분 AUROC는 0.835에서 0.935로 오른다(3배 큰 Qwen3.5-4B는 0.948). 깊이 통제 과제인 거짓말 연쇄와 물건 교환에서 SanSi는 1루프에 깊이 3, 2루프에 6, 4루프에 11까지 버티며, 학습 범위(≤8)를 넘는 9~16단계에서 1루프는 49.9%(우연 수준)인 반면 8루프는 72.6%를 맞힌다. 같은 데이터로 학습한 Qwen3.5-4B는 두 과제 모두 깊이 3에 그치고 미학습 깊이에서 50.0%다.

활용 사례로 SanSi를 강화학습의 판정자로 쓴 실험이 있다. 2WikiMultiHopQA에서 SmolLM2-1.7B를 GRPO로 학습시키되 정답 없이 SanSi의 확률만 보상으로 준다. 8루프에서 읽으면 생성기 F1이 39.5에서 47.3으로(+7.7), 4루프에서 읽으면 45.8로(+6.3) 오르고, 2루프는 변화가 없으며 1루프는 29.1로 오히려 손상된다. 학습 초기 20스텝에서 정답 일치 답변을 구분하는 AUROC가 1루프 0.78, 4루프 0.91, 8루프 0.90이기 때문이다. 절제 실험에서는 마지막 루프에만 손실을 주면 8루프 정확도가 70.9%로 1.1점 떨어지고 1루프가 35.6%로 붕괴한다. Brier 항을 빼면 정확도는 71.6%로 거의 같지만 ECE가 0.104로 오르고 답할 수 없는 항목에 단정적 답을 주는 비율이 20.0%로 늘어난다. 4루프만 학습하면 4루프에서 70.8%이고, 학습한 루프보다 더 돌리면 8루프 72.0%에서 16루프 70.1%로 떨어진다. 루프 사전학습이 안 된 SmolLM2에 루프를 붙이면 이득이 없다(33.5%, 58.3%). 8개 루프의 확률을 평균하면 정확도는 71.8%로 유지하면서 ECE가 0.093에서 0.044로 반감한다.

개발자 관점에서 이 논문이 주는 실무적 판단은 명확하다. 파라미터를 늘리지 않고 추론 시점 연산량을 늘려 정확도를 사는 선택지가 실제로 작동하며, 그 이득은 한 번의 패스로 끝나는 분류 작업에서는 거의 없고 여러 정보를 결합해야 하는 추론·긴 문서·지식 질문에서 크다. 예산을 고정할 수 있다는 점도 실용적이다. 한 번의 실행으로 1~8루프 결과가 모두 나오므로, 쉬운 항목은 1~2루프에서 끊고 어려운 항목만 더 돌리는 라우팅을 같은 모델로 구현할 수 있다. 다만 세 가지를 확인해야 한다. 첫째, 이득은 루프 사전학습된 백본에 의존하므로 아무 모델에 층을 반복해 붙여도 같은 효과를 기대할 수 없다. 둘째, 8루프는 단일 패스 대비 7.7배, 3배 큰 모델 대비 3.3배의 GPU 시간을 쓰므로 지연·비용 예산과 함께 봐야 한다. 셋째, 확률을 그대로 임계값으로 쓰는 파이프라인이라면 3루프 이후 신뢰도가 계속 올라 캘리브레이션이 나빠진다는 점, 그리고 루프 평균을 취하면 추가 비용 없이 ECE를 절반으로 줄일 수 있다는 점을 반영해야 한다.

저자들이 밝힌 한계는 다음과 같다. SanSi는 루프 사전학습된 Ouro 계열 두 크기(1.4B, 2.6B)에만 기반하고 분석 대부분이 1.4B 모델에 집중되어 있어, 다른·더 큰 루프 백본으로 결과가 얼마나 옮겨가는지는 향후 과제다. 루프 이득은 이 사전학습에 의존한다. 비용 측면에서 8루프 결정은 Qwen3.5-4B의 약 3.3배, 4루프는 1.6배 GPU 시간이 들고 SanSi-2.6B는 약 6.3배다. 루프 수를 고정해서 읽으며 쉬운 항목에서 일찍 멈추는 규칙은 다루지 않았다. 추론 깊이 분석은 프로그램으로 생성한 두 과제에만 근거하고, 판정자 사례 연구는 데이터셋 하나와 생성기 하나만 쓴 예시이지 SanSi를 범용 보상 모델로 평가한 것이 아니다. 평가 스위트는 영어이고 기존 데이터셋을 조립한 것이며 항목 유형 구성이 저자들의 선택이므로 유형별·그룹별 결과를 함께 보고한다. 또한 백본이 사전학습 중 이 공개 데이터셋 일부를 봤을 가능성을 배제하지 못한다.