챗 템플릿이 LLM의 자기 언급 화법을 바꾸는 것을 활성화 조향으로 재현했다.
LLM에게 자기 자신에 관한 질문을 던지면 "저는 그냥 AI입니다" 같은 면책성 문구가 따라붙는 경우가 많다. 이 화법이 모델 가중치에 새겨진 성질인지, 아니면 배포 방식이 만들어낸 결과인지를 분리해 분석한 논문이 나왔다. arXiv에 올라온 "As a Language Model...": Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It이 그것으로, 저자는 Jędrzej Maczan이다.
실험의 핵심 도구는 챗 템플릿이다. 9B 파라미터 이하의 널리 쓰이는 오픈소스 인스트럭트 모델 8종을 대상으로 확인한 결과, 챗 템플릿이 적용되면 면책성 화법이 강해지고 "I feel"처럼 경험을 서술하는 화법은 약해졌다. 반대로 템플릿이 없으면 면책 화법은 줄고 경험적 화법이 늘었다. 템플릿이 마치 스위치처럼 두 가지 말투의 세기를 조절한다는 뜻이다.
연구진은 여기서 멈추지 않고 모델 내부를 들여다봤다. 3개 모델의 활성화 공간에서 이 화법 전환을 좌우하는 방향 벡터를 찾아냈다. 해당 방향을 활성화에서 제거하면 면책 화법이 줄고, 더하면 늘어났다. 같은 크기의 무작위 방향을 적용했을 때는 효과가 거의 나타나지 않았다. 특히 챗 템플릿 없이 쓰던 인스트럭트 모델에 이 면책 방향을 주입하자, 템플릿이 있는 것처럼 면책성 발언을 하기 시작했다.
이 주제가 중요한 이유는 모델의 자기 보고가 AI 안전 논의와 모델 자기지식 연구에서 증거처럼 쓰여 왔기 때문이다. 모델이 스스로에 대해 말하는 내용을 모델의 내적 사실로 간주하는 관행에 이 결과는 의문을 제기한다. 같은 가중치라도 어떤 템플릿으로 감싸 호출하느냐에 따라 자기 서술이 달라진다면, 그 발언은 모델의 속성이 아니라 배포 설정의 산물인 셈이다.
실무적으로는 평가 설계가 달라진다. 인스트럭트 모델과 베이스 모델을 비교하거나, 서로 다른 채팅 포맷을 쓰는 모델을 한 벤치마크에 올릴 때 템플릿 차이가 교란 변수로 작용할 수 있다. 자기 인식·내성 관련 실험을 한다면 템플릿 유무를 통제하고, 필요하면 활성화 조향으로 화법을 고정한 뒤 비교하는 편이 안전하다. 시스템 프롬프트나 채팅 포맷을 바꿔가며 응답 품질을 튜닝하는 팀에게도 같은 시사점이 적용된다.
한계도 분명하다. 화법 전환은 9B 이하 모델 8종에서 확인됐고, 활성화 공간에서 방향을 찾아낸 것은 그중 3개 모델이다. 더 큰 모델이나 다른 계열에서 동일한 방향이 존재하는지는 이 논문이 답하지 않는다. 논문은 COLM 2026 워크숍과 KONVENS 2026 Eval4SD 워크숍에 채택됐다.
결론적으로 이 연구가 남기는 메시지는 단순하다. 모델이 자기 자신에 대해 하는 말을 문자 그대로 받아들이지 말라는 것이다. 그 발언은 가중치만으로 결정되지 않고, 호출 시점의 템플릿이 일부를 정한다.