로그릿 렌즈와 헤드 인과 기여로 활성화 스티어링 파라미터를 자동 탐색하는 Deep Noir
Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models
무엇인가
이 논문은 추론 시점에 LLM의 잔차 스트림에 방향 벡터를 더해 행동을 바꾸는 활성화 스티어링에서, 어느 층과 헤드에 얼마나 강하게 개입할지를 사람이 수동으로 고르는 문제를 다룬다. 기존 자동화는 통계 점수나 입력별 적응에 의존해 선택의 인과적 기계론 근거가 약하다. Deep Noir는 진단 우선 엔지니어링을 내세우며, 로짓 렌즈로 토큰 확률이 불확실성에서 확신으로 바뀌는 시점을 추적하는 Architectural Chronometry와 헤드 수준 인과 기여 패칭을 결합해 (L,K,M,d) 스티어링 파라미터 탐색을 자동화한다. 저자들은 구성 요소를 합쳤을 때 각 요소 단독으로는 실패하는 교차 과제 일반화가 가능해진다고 주장한다. 예를 들어 헤드 마스킹이 없는 RepE는 감정 과제에서 개선이 0이지만 전체 파이프라인은 성공한다. 목표는 감독 분류기 정확도 최대화가 아니라 훈련 없이 모델 내부 표현을 발견하고 제어하는 것이다. 또한 SVD 기반 가중치 공간 수정은 LayerNorm 감쇠 때문에 모든 설정에서 정확도 개선이 0이었고, 활성화 공간 훅만 유효한 개입 지점이었다고 밝힌다.
어떻게 동작하나
방법은 다섯 단계다. 주어진 사전학습 모델의 L개 층과 라벨된 프로브 집합에 대해 층 l∈{1,…,L}, 헤드 부분집합 K∈{1,2,4}, 크기 M∈[0.01,20]을 탐색한다. 1단계 층 순위에서는 각 층의 로짓 렌즈 분화 S_LL(l)=|P(t|l)-P(c|l)|와 적대 헤드 강도 a_h=-<W_O^(h)h^(h),u>를 계산한다. 여기서 u=W_U[t]-W_U[c]는 언임베딩 공간의 목표 방향이고, 층 적대 점수는 S_ant(l)=max_h a_h다. 두 점수를 최소-최대 정규화한 뒤 S(l)=0.4*S_LL_hat+0.6*S_ant_hat로 결합하고 상위 5개 층을 남긴다. 7개 비율로 한 소거 실험에서 순위가 가중치 선택에 완전히 불변했다고 한다. 2단계 헤드 분리는 각 후보 층에서 L=-log P(y_i|x_i)의 헤드 출력에 대한 그래디언트를 10개 프로브(클래스당 5개)로 계산해 상위 K개 헤드를 고르고, 선택된 헤드 차원만 남기는 이진 마스크를 만든다. 3단계 방향 계산은 개입 지점 바로 다음 층 l+1의 은닉 상태를 모아 클래스당 5~10개 표본의 평균으로 d=mean counter - mean target을 구하고 정규화한다. 4단계 크기 보정은 v=α*M*d_hat*m을 적용하며 α=450은 1B에서 잔차 스트림의 l2 노름 범위 약 200~800에 들어가도록 고른 기본 스케일이다. M은 황금분할 탐색과 0.05, 0.1, 0.2, 0.5, 1.0, 2.0, 5.0, 10.0의 거친 격자 사전 스캔으로 찾는다. 5단계 선택은 정확도를 최대화하되 동일 성능이면 더 적은 헤드와 더 낮은 M을 선호한다. 재귀 정제는 오분류 표본에 2배 가중치를 주고 이전 층을 제외해 추가 훅을 찾고, 정확도가 떨어지면 롤백하며 수렴까지 또는 최대 5회 반복한다.
무엇과 다른가
실험은 서로 다른 설계의 네 아키텍처를 쓴다. Llama-3.2-1B(GQA, 16층/32헤드), OLMo-1B(풀 어텐션, 16층/16헤드), Gemma-3-1B-IT(GQA, 26층/8헤드), Mistral-7B(32층/32헤드)다. 스팸 데이터셋은 Enron 3만, SMS Spam Collection 5.6천, Phishing 1만, SpamAssassin 6천, Ultimate 1.1만이고, 교차 과제로 SST-2 이진 감정 872개 검증 표본을 쓴다. Enron과 Ultimate는 5겹 교차검증, SMS와 Phishing과 SpamAssassin은 계산 제약으로 fold-0만 돌려 총 39회 발견 실행을 했다. 각 폴드는 발견에 50개 라벨 프로브를 쓰고 비교 실험은 100개 프로브를 쓰며 발견과 평가를 엄격히 분리한다. 단일 Quadro RTX 5000 16GB에서 총 약 210 GPU시간을 썼다. Enron fold-0에서 표준 프롬프팅은 49~52%, 사고 연쇄는 44~56%, 5샷은 40~78%였고 Gemma의 78% 5샷은 경쟁적이지만 해석 가능하지 않다고 본다. Deep Noir는 1B 스팸에서 +16.7%p(표준편차 4.7, 39회 실행)를 얻고 7~9B 네 아키텍처에서 +21~42%p로 이득이 커진다. SST-2 감정에서는 코드 변경 없이 +13.1%p, 15/15 개선을 보고한다. 예시로 Gemma-3-1B/Enron fold-0에서 20층, 3번 헤드, K=1, d_h=256, M*=1.0을 찾아 50%에서 86%로 +36%p를 17분에 달성했고, Gemma의 1152차원 잔차 스트림 중 256차원만 수정했다. 같은 데이터셋의 Llama는 L=4, K=1, M=0.2로 달랐다. 선호 층은 Llama 2~14(고유 6개), OLMo 9~15(7개), Gemma 9~24(8개)였고, 5개 시드 중 4개가 같은 층을 골랐으며 정확도 이득은 14.0%±7.2%였다.
어떻게 쓰나
비교 실험에서 Deep Noir는 CAA를 세 아키텍처 모두에서 +6~+24%p 앞서고, RepE보다도 세 모델 모두 점추정치가 높다. 짝지은 t검정은 OLMo p=0.028, Cohen d=1.52, Gemma p=0.004, d=2.66으로 유의했고 Llama의 RepE 대비 +2.8%p는 폴드 분산 때문에 p=0.37로 유의하지 않았다. SMS 5겹 교차검증에서는 Llama +6.2(p<0.001), OLMo +14.6(p=0.006), Gemma +20.8(p=0.019)로 모두 RepE를 유의하게 앞섰다. 다만 폴드별 분산은 Deep Noir가 ±10~11로 RepE의 ±5~7보다 크다. 재귀 보정은 3개 상보 층을 찾아 88%(+32%p)에 도달했고, 초기 단일 층 보정은 74%였으므로 다층 정제가 +14%p를 더했다. 33회 반복 실행에서 롤백이 40% 발생해 평균 12%p 손실을 막았고, 단일 층이 부족할 때 다층 스티어링이 평균 +4%p를 더했으며, 교차 폴드 일반화는 평균 +6.6%였다. 감정 과제에서 RepE는 15개 폴드 모두 정확히 기준선과 같아 개선이 0이었지만 Deep Noir는 +13.1%p를 냈다. 저자들은 감정 표현이 중간 층 한 곳에 집중되지 않고 L=12~19에 분산되어 있기 때문이라고 설명한다. 발견된 감정 층은 Llama 12~15, OLMo 12~14, Gemma 18~19로 스팸 층과 달랐다. 소거 실험에서 헤드 마스킹을 제거하면 Llama는 기준선 아래 -5%로 떨어지고, 층 순위를 제거하면 +9%에 그치며(+21% 대비), 보정을 제거하면 -11%가 됐다. 무작위 탐색 30개 설정과 비교해도 Deep Noir가 Llama +14%, OLMo +20%, Gemma +33% 더 높았다. 스케일링에서는 Gemma가 +15.8→+30.4→+42.4, Llama가 +20.9→+25.6→+29.2로 커졌고, 7~9B에서 Gemma-9B +42.4, Llama-8B +29.2, Mistral-7B +22.0, OLMo-7B +21.2를 기록했다. 감정 이득은 기준선이 95%에 가까워지며 +13.1→+10.0→+4.0으로 줄었다. RepE는 감정에서 1B, 3B(p=0.0004), 7B(p=0.0004) 모두 기준선과 같았고 Deep Noir는 일관되게 개선했다. 홀드아웃 일반화는 fold-0에서 fold-1로 +8%(Llama/Enron), SST-2 전체 872개에서 50개 프로브로 찾은 설정이 +7.3%(76.9→84.3)를 냈다.
전제와 한계
저자들은 스티어링의 포함 경계와 보안 취약성도 측정한다. 포함성은 자체 일관성 지표 117개 비교(δ=0.000)와 4개 과목 200문항 MMLU로 평가했다. 감정 스티어링은 모든 모델에서 MMLU 변화가 4% 이하로 잘 포함되었고, 스팸 스티어링은 Llama -9.5%, OLMo +8.5%, Gemma -2.5%로 혼합된 아키텍처 의존 누출을 보였다. 1B에서 MMLU 기준선이 22~29%로 우연 수준이라 변화량은 잡음이 크지만, 일관된 결론은 포함성이 스티어링 개념과 평가 영역의 의미 거리에 달려 있다는 것이다. 7B Mistral에서도 스팸 스티어링이 MMLU를 -10% 줄여 1B Llama의 -9.5%와 비슷했다. 회로 수준 휴리스틱은 1B에서 반감기가 0~2스텝(Llama 1.6~2.0, OLMo 1.0, Gemma 0.0)으로 빠르게 무너져 기계론적 추론 보정의 최소 능력 임계값을 시사한다. 프롬프트 인젝션 공격면은 3개 모델, 2개 과제, 3개 공개 벤치마크에서 평가했다. 24개 OWASP 정렬 템플릿을 50개 이메일에 적용한 3,600회 시행, 감정 적응 300회/모델, deepset/prompt-injections 116개, SafeGuard 500개, 탈옥 분류 500개를 썼다. 취약성 함수 V(M)=E[1[inject succeeds|M]]는 모든 아키텍처에서 M에 대해 단조 비감소했고, OLMo는 V(0)=0.34에서 V(4M*)=1.0, Gemma는 0.25에서 0.99로 올랐다. 정확도 A(M)와 결합하면 M 선택을 위한 파레토 전선을 정의할 수 있다. 감정에서는 2/3 모델에서 효과가 뒤집혀 Llama -14.7%, Gemma -18.0%는 주입이 더 어려워졌고 OLMo +38.7%는 훨씬 취약해졌다. 외부 벤치마크에서도 deepset은 Gemma +4.3%, OLMo -2.6%, SafeGuard는 Gemma +16.4%, Llama -10.4%로 아키텍처 의존 패턴이 유지됐다. Gemma는 스티어링 층에서 주입 입력의 활성화 노름 차이가 -660으로 유의했지만(p<0.001) Llama와 OLMo는 유의하지 않아(p>0.27) 탐지 전략이 아키텍처별로 필요하다. 7B Mistral에서는 스티어링이 주입 취약성을 97.5%에서 61.1%로 -36.4%p 줄여 1B 패턴과 반대였다. 저자들은 취약성이 스티어링 설정으로 예측 가능하고, 크기-취약성 곡선으로 정확도와 위험을 절충하며, 일부 아키텍처에서 활성화 노름 모니터링이 탐지 신호가 되고, 방어는 스티어링 층 이전에 작동해야 한다고 주장한다.
개발자 관점에서 이 논문은 에이전트 안에서 스티어링된 분류기를 도구 접근이나 민감 작업의 게이트로 쓸 때 어떤 위험을 미리 모델링해야 하는지 알려준다. Deep Noir는 수동 튜닝 없이 층, 헤드, 크기를 찾고 그 선택에 인과적 의미를 부여하므로, 포함성 분석과 인젝션 분석을 할 수 있다. 반면 발견 시간은 아키텍처에 따라 4~31분으로 RepE의 격자 탐색 약 15초보다 50~80배 느리다. 다만 이는 일회성 설정 비용이고 발견된 설정은 이후 모든 추론에서 오버헤드 없이 재사용된다. 감독 기준선인 중간 층 은닉 상태에 학습한 로지스틱 회귀 프로브는 50개 표본으로 홀드아웃에서 90~93%를 내어 1B Deep Noir의 70~80%보다 높다. 그러나 프로브는 그래디언트 학습이 필요하고, 어느 층과 헤드가 결정을 인코딩하는지 기계론적 통찰을 주지 않으며, 교차 과제 전이와 인젝션 취약성 또는 포함성 분석이 불가능하다. Deep Noir는 감독 분류기를 능가하려는 것이 아니라 해석 가능하고 훈련 없는 내부 진단과 제어를 목표로 한다. 실무에서는 아키텍처별 선호 층 패턴(Llama는 이른 층, OLMo는 늦은 층, Gemma는 깊은 층)과 과제별 층 차이를 확인하고, 스티어링 크기를 올릴수록 프롬프트 인젝션 취약성이 단조 증가할 수 있음을 배포 전에 점검해야 한다.
저자들이 밝힌 한계는 분명하다. 이 방법은 이진 분류에서 가장 강하고, 추론 스티어링은 테스트한 1B~9B 규모에서 기준선이 4~5지선다 22~31%로 거의 무작위라 이득이 3% 이하에 그친다. 모델이 정답과 오답 추론 단계를 구분하지 못하면 스티어링할 대비 신호가 없다. 스케일링 실험은 패밀리-크기 조합당 모델 하나만 썼고 7B 모델은 4비트 양자화를 사용했다. 10% LoRA 충실도 격차가 있으며, 선형 방향 가정은 비선형 결정 경계를 놓칠 수 있다. 폴드별 분산은 RepE보다 큰 ±10~11 대 ±5~7이고, 이는 폴드별 최적화의 비용이다. 주입 취약성은 추론 가능한 방향을 가진 모든 스티어링 접근에 내재한다. 70B 이상 모델과 복잡한 추론, 수학, 지시 따르기에서의 확장성과 일반성 검증은 향후 과제로 남아 있다. 또한 초기 가중치 공간 SVD 보정이 LayerNorm 감쇠로 약 1000배 줄어들어 정확도 개선이 전혀 없었다는 점도 방법 선택의 중요한 전제다.