도구 사용 LLM의 내부 개입이 실제 수리인지 판정하는 SAKIKO
When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs
무엇인가
이 논문은 도구를 호출하는 에이전트 LLM이 외부 API를 부르기 전에 K개의 행동 중 하나를 고르는 문제를 다룬다. 선택지는 직접 응답, API 호출, 명확화 요청, 과제 거절이다. 저자들은 이 단계의 실패를 생성 텍스트의 환각과 구분되는 별도의 실패 모드로 규정한다. 즉 전제 조건이 없는데 도구를 부르거나, 명확화가 필요한데 성급히 답하거나, 답할 수 있는 질문을 거절하거나, 꼭 필요한 도구 호출을 빠뜨리는 식이다. 기존 활성화 조향 연구는 대개 도구 대 비도구의 이진 행동 공간을 가정해, 잘못된 상태를 벗어나면 자동으로 정답 상태에 도달한다고 본다. 그러나 K개 행동이 있는 실제 환경에서는 오류 상태를 떠나도 확률 질량이 제3의 잘못된 행동으로 옮겨갈 수 있다. 그래서 저자들은 행동의 변화가 곧 수리라는 등식을 문제 삼는다.
어떻게 동작하나
제안하는 SAKIKO는 수리를 하나의 조향 연산이 아니라 증거 심사 과정으로 형식화한다. 다섯 단계로 구성된다. 첫째 Discovery는 학습 분할의 혼동행렬에서 방향성 오류 채널 c=(y*→ŷ0)를 열거하고, 학습·검증 양쪽에서 최소 지지도를 넘는 채널만 남긴다. 둘째 Detection은 동결된 중간층 표현 위에 선형 Router r(h_obs)→(ĉ, p_ĉ)를 학습시키고, 확률이 임계값 τ를 넘을 때만 개입을 발화시킨다. 라우팅되지 않은 입력은 손대지 않는다. 셋째 Correction은 Router가 발화한 채널에 대해 MLP 출력이 디코더 잔차 스트림으로 합쳐지기 전 층 ℓinj에서 h'=h+q_c·s_c·d_c를 적용한다. 여기서 d_c는 단위 노름 조향 방향, s_c는 층 스케일, q_c는 정규화된 용량이며, 설정값 θ_c={d_c, ℓobs, ℓinj, q_c, τ_c}는 고정된다. 넷째 Destination Verification은 개입 후 궤적을 K개 행동 전체에서 추적하고, 다섯째 Statistical Licensing은 사전 등록된 증거 위계에 따라 신뢰구간으로 이득을 검정한다.
무엇과 다른가
평가 지표는 결과를 다섯 갈래로 나눈다. 채널 오류 N_c는 소스 잔류 S_c, 정답 도달 A_c, 다른 오류 O_c로 쪼개지고, 소스 탈출 X_c=A_c+O_c, 목표 적중률 TH_c=A_c/X_c, 채널 전체로 정규화한 목표 이득 TG_c=(A_c−O_c)/N_c가 정의된다. 담보 손상은 두 분모로 보고하는데 E1=B/|C|는 모집단 수준, E2=B/|C_exp|는 Router가 실제 건드린 정답 표본 수준이다. 순이득도 두 관례를 구분한다. G_whole은 평가 모집단의 모든 베이스라인 오류가 정답이 된 수에서 파괴 B를 뺀 값이고, G_channel은 심사 대상 채널 안의 도달만 세므로 전자가 더 크다(Qwen3-8B에서 +40 대 +38). 수리 라이선스는 REPAIR(π)≡CORRECTABLE(π)∧PRESERVING_pop(π)∧LICENSABLE(π)의 결합으로, 표본 지지도, 랜덤 대조군 대비 특이성(p≤0.05), TH_c와 E1 임계값, 부트스트랩 신뢰구간, 베이스라인 재현을 포함한 10개 조건 게이트가 ADMIT 또는 DECLINE을 낸다.
어떻게 쓰나
실험은 3.8B~9B 규모 7개 LLM을 2,556/548/548 분할로 평가한다. 벤치마크는 When2Call(네 가지 실행 전 행동, teacher forcing), MetaTool(Qwen2.5-7B에서 이진 양방향 조향), ACEBench(자유 생성 기반 4행동 온톨로지)다. ACEBench는 리드아웃 자체는 정확도 0.756, 매크로 F1 0.687로 인증됐지만 채널 발견 기준을 통과하지 못했고(최소 전이 지지도 부족, 패러프레이즈 일치 0.56 대 0.80), 사전 등록 프로토콜에 따라 개입 실험 없이 은퇴했다. 역사적 코호트는 Phi-3.5-mini, Qwen2.5-7B, Llama-3.1-8B, Mistral-7B로 세 채널을 G_whole로 평가하고, 전향적 봉인 코호트는 Qwen3-4B, Qwen3-8B, Gemma-2-9B로 cannot_answer→tool_call 채널에 대해 벡터·임계값·용량 {0.125, 0.25, 1.0}을 사전 등록하고 TG_c로 평가한다. 봉인 설정마다 65개 arm(명명 6개, 랜덤 59개)을 돌리고, 랜덤 59개에 대한 애드원 몬테카를로 검정 p=(1+ΣI[TG_rand≥TG_real])/60을 쓴다.
전제와 한계
조향 자체는 상당한 효과를 낸다. When2Call에서 Qwen2.5-7B는 순이득 +79(교정 92 대 퇴행 13), Phi-3.5-mini는 +55를 기록했다. 봉인 코호트에서 Qwen3-8B는 TG_c=0.276(오류 87개 중 순 도달 +24), Qwen3-4B는 0.081(+10/124), Gemma-2-9B는 0.073(+7/96)이었다. Qwen3-8B에서 Router는 오류의 82.8%에 발화해 소스 탈출 59.8%, 목표 도달 43.7%를 만들었다. MetaTool 양방향 조향은 성급한 호출과 누락된 호출을 모두 교정해 5회 독립 실행 평균 +8.6과 +13.0을 냈다. 구조적 대조군도 통과한다. Phi-3.5-mini에서 보정 벡터 +55는 노름 맞춤 랜덤 +14, 부호 반전 +14, 층 오배치 +3을 크게 앞섰고, Qwen2.5-7B의 +79는 부호 반전 +16과 랜덤 10개 평균 +25.2(최대 +50)를 앞섰다. 봉인 평가는 모든 아키텍처에서 p=1/60=0.017로 최소 유의성 바닥을 찍었고, 정답 도달 수는 Qwen3-8B 38 대 최대 8, Qwen3-4B 37 대 2, Gemma-2-9B 17 대 0이었다. 반면 Llama-3.1-8B는 랜덤 20개 중 5개가 개입 이득과 같거나 컸고, Mistral-7B는 보정 방향 +12가 부호 반전 +19와 랜덤 평균 +29에 뒤졌다. Qwen3.5-9B는 기준 정답 인스턴스가 29개로 사전 등록 최소 지지도 30에 못 미쳐 개입 전에 자동 중단됐다.
목적지 감사는 집계 지표가 감추는 것을 드러낸다. Phi-3.5-mini에서 라우팅된 오류 200개 중 153개가 소스를 탈출했지만 정답에 도달한 것은 107개뿐이고 46개는 다른 오류로 흘러 TH_c=0.699였다. Qwen3-8B에서는 내부 활성화 조향과 외부 로짓 이동이 순이득 +38 대 +35, 정답 도달 38 대 37로 거의 같았지만, 내부 조향은 52개 탈출 중 14개만 다른 오류로 보낸 반면(TH_c=0.731) 로짓 이동은 58개 중 21개를 오프타깃으로 돌렸다(TH_c=0.638). 담보 손상은 더 심각하다. Phi-3.5-mini는 Router가 건드린 정답 93개 중 52개를 파괴해 E2=55.9%, E1=19.7%를 기록했고, 허용치 ε_tol=0.05를 크게 넘었다. Router 신뢰도는 파괴된 표본과 온전한 표본을 구분하지 못했으며(Cliff's δ=−0.094, p=0.44), 임계값 τ=0.9에서도 파괴율이 50%를 넘었다. Qwen3-4B는 모집단 손실 E1=1.3%가 국소적 악화 E2=5.7%를 가렸고, Qwen3-8B는 파괴 0이지만 노출 표본이 6개뿐이라 노출 조건 경계 39.3%가 무정보였다.
통계 라이선싱은 낙관적 점추정을 걸러낸다. Qwen3-8B만 ADMIT를 받았다. TH_c=0.731, CI [0.604, 0.846], TG_c=0.276, CI [0.115, 0.425], 파괴 B=0으로 모든 조건을 통과했다. Qwen3-4B와 Gemma-2-9B는 점추정이 양수인데도 DECLINE을 받았는데, TG_c 신뢰구간이 각각 [−0.048, 0.202]와 [−0.031, 0.177]로 0을 포함했기 때문이다. Gemma-2-9B는 노출 손실 E2=9.1%(11개 중 1개 파괴)도 함께 지적됐다. 저자들은 0.58의 적중률을 0.50 귀무가설에 대해 판정하려면 탈출 표본 245개가 필요하다고 계산한다(0.73이면 약 30개). 마지막으로 When2Call에서 search_flights 호출을 정보 요청으로 바꾸는 동일한 전환이 문맥에 따라 세 갈래로 갈린다. 출발지 누락 사례는 정답 도달 107건, 서비스 불가 상태 질의는 불필요한 항공편 번호를 요구하는 다른 오류 46건, 완전 명세 질의는 이미 맞던 호출을 깨뜨린 52건이었다. 표준 정확도는 이를 +1, ±0, −1로 세어 순이득 +55(107−52)로 뭉갠다.
저자들이 밝힌 한계는 분명하다. 이 라이선스는 범주적 행동 모드 선택만 인증하며, 하위 실행의 타당성이나 노출된 결정의 안전성은 보증하지 않는다. 보존은 사전 등록이 고정한 E1, 즉 모집단 수준에서만 심사되므로 ADMIT는 Router가 실제로 건드린 결정에서 담보 손상이 억제됐다는 뜻이 아니고, 노출 조건 보존을 달성한 설정은 하나도 없었다. 또한 선형 디코딩 가능성이 조향 가능성을 함의하지 않으며, 프로브 정확도가 최적 주입 위치·용량·개입 성공과 어긋난다. ACEBench의 은퇴와 Qwen3.5-9B의 사전 탈락처럼, 프로토콜 게이트는 유효한 설정을 라이선스하는 만큼 무효한 설정을 조기에 중단시킨다.