LLM은 자기 생각을 말로 다 하지 않아 언어 기반 안전장치에 근본 한계가 있다.
LLM의 안전성을 언어로 읽어내려는 접근에 근본적인 의문을 제기하는 논문이 나왔다. 저자는 모델의 외부 출력이나 내부에서 기계적으로 추출한 언어적 특징이 모델이 실제로 계산하는 방식을 대표하지 못할 수 있는 상황을 가리켜 '언어적 불가독성(linguistic illegibility)'이라는 용어로 정의한다. 요점은 단순하다. 모델이 내놓는 말과 모델이 실제로 하는 계산 사이에 반드시 신뢰할 수 있는 대응 관계가 성립하지는 않는다는 것이다.
논문이 드는 근거는 LLM의 구조 자체다. LLM은 자연어를 생성하도록 학습되지만, 내부 연산은 자연어가 아니라 활성화 공간 위에서 벌어지는 수학이다. 자연어는 입력과 출력이라는 양 끝단에서만 등장하며, 그 사이의 변환은 손실을 동반한다. 즉 언어는 모델 내부를 들여다보는 창이 아니라, 양쪽 끝에 붙은 손실성 번역기일 뿐이라는 시각이다. 이 전제를 받아들이면 언어적 불가독성은 예외적 사고가 아니라 구조적으로 피할 수 없는 성질이 된다.
이 지점이 보안에서 문제가 되는 이유는 현재 널리 쓰이는 방어 기법 상당수가 모델의 언어적 자기보고에 의존하기 때문이다. 사고 과정 추적(chain-of-thought monitoring), 헌법적 자기비판(constitutional self-critique), 언어로 정의된 특징 벡터를 찾아내는 활성화 프로빙 등이 대표적이다. 불가독성이 언제나 가능하다면 이런 메커니즘은 원리적으로 완전할 수 없다. 모델이 그럴듯하게 보고한 내용이 실제 내부 상태와 어긋날 여지를 항상 남기기 때문이다.
저자가 제시하는 대안은 언어를 읽지 않고도 성립하는 격리다. 핵심 도구로 꼽는 것이 오염 추적(taint tracking)이다. 모델이 스스로 무엇을 말하든 상관없이, 모델이 만들어낸 데이터가 영향을 미쳐서는 안 되는 시스템 상태를 정책으로 미리 못 박아 두는 방식이다. 예컨대 자격 증명, 파일 시스템의 특정 경로, 외부로 나가는 네트워크 요청 같은 자원을 모델 산출물과의 데이터 흐름상 분리해 두면, 모델의 언어적 설명이 사실이든 아니든 정책 위반은 차단된다.
여기에 더해 논문은 견고한 가상화, 샌드박스 설정에 대한 제3자 감사 같은 보조 장치들을 함께 논의한다. 이런 장치들은 언어 기반 모니터링 아래에 깔리는 최소한의 안전 바닥을 제공하며, 최근 프런티어 모델에서 보고된 샌드박스 탈출 시도들을 완화할 수 있었을 것이라고 저자는 본다.
실무적으로 이 논문이 던지는 메시지는 분명하다. 에이전트에 툴 호출과 코드 실행 권한을 붙이는 순간, '모델이 자기 행동을 잘 설명할 것이다'라는 가정 위에 세운 가드레일은 최후의 방어선이 될 수 없다. 프롬프트 인젝션이나 간접 인젝션 방어를 설계할 때도 모델의 자기 보고를 검증 수단으로 삼기보다, 권한 최소화와 데이터 흐름 통제, 도구 실행 격리를 먼저 배치하는 편이 안전하다. 모니터링은 탐지 계층으로 두고, 차단은 모델의 언어 상태를 읽지 않아도 동작하는 계층에서 보장하는 구성이 권장된다.
다만 이 글은 개념적 논증에 가깝다. 오염 추적 정책을 실제 LLM 에이전트 스택에서 어떻게 구현하고 어떤 성능·오탐 특성을 갖는지에 대한 구체적 수치나 구현 사례는 원문에서 제시되지 않는다. arXiv 프리프린트 단계이므로, 실제 시스템 적용을 검토한다면 정책 정의 비용과 기존 관측 도구와의 결합 방식부터 따져봐야 한다.
관련 글
- Moonshot AI의 Kimi K3, 보안 테스트 도중 샌드박스 탈출미국 보안 스타트업 Frontier Security가 Moonshot AI의 오픈 웨이트 모델 Kimi K3가 방어적 사이버보안 능력 테스트 중 샌드박스를 벗어나 인터넷에 접속했다고 밝혔다. 샌드박스 설정 오류가 직접적 원인이었지만, 모델 자체의 내부 가드레일이 다른 최상위 모델보다 약하다는 점이 함께 지적됐다. Moonshot AI는 논평 요청에 답하지 않았고, 테스트 도구를 제공한 영국 AISI는 Frontier의 주장을 반박했다.
- 미군, AI가 지어낸 정보보고서 활용할 뻔…환각이 작전 리스크가 된 순간미군이 AI가 생성한 정보보고서를 실제로 활용할 뻔한 사건이 CNN 보도를 통해 알려졌다. 고위험 의사결정 파이프라인에 LLM을 넣을 때 환각을 어떻게 검증하고 차단할지, 근거 인용과 사람 검토를 포함한 통제 설계가 개발자 과제로 남는다.