Goodfire가 모델 내부를 읽는 저비용 AI 감시 프로브를 공개했다

TechCrunch어제조회 1

해석가능성(interpretability) 스타트업 Goodfire가 AI 에이전트의 출력이 아니라 모델 내부 연산을 직접 들여다보는 감시 장치를 내놨다. 에이전트가 만들어낸 텍스트를 별도 모델이 처음부터 다시 읽는 기존 방식 대신, 모델이 이미 계산한 중간 활성값을 분류기로 훑는 구조다. 이 감시 장치는 모델 호스팅 업체 Baseten의 고객이 바로 쓸 수 있다.

작동 방식은 단계별 검문에 가깝다. 에이전트가 작업을 진행하는 매 단계마다 '프로브'라 불리는 소형 탐지기가 모델 내부 신호를 읽고, 걸리는 신호가 잡힐 때만 별도의 AI 모델이 해당 지점을 자세히 살핀다. Baseten 고객은 감시할 위험을 직접 고르고, 탐지됐을 때의 대응도 정할 수 있다. 공격적 해킹, 화학·생물 무기 오용, 보상 해킹(reward hacking) 등이 감시 항목으로 제시되며, 대응은 기록만 남기기, 사람 검토로 넘기기, 요청 자체를 거부하기 중에서 선택한다.

비용 차이가 이 제품의 핵심이다. Goodfire가 Kimi K3에서 약 1,500개 세션을 감시한 실험의 비용은 약 51달러였다. 매 단계를 저가 모델로 검사하는 방식은 233달러, 최상위 모델을 쓰는 방식은 약 1만 달러가 들었다. 프로브는 모델이 순전파(forward pass)에서 어차피 수행하는 연산을 재활용하므로 추가 부담이 거의 없다는 설명이다. Goodfire CEO Eric Ho는 모델이 이미 토큰을 계산하고 있으니 그 중간 활성값에 분류기를 돌리는 것뿐이라는 취지로 이 구조를 설명했다. 프로브 네 개를 동시에 돌려도 모델이 응답을 시작하기까지 걸리는 시간은 2% 미만 늘어났다.

탐지 성능은 악성 해킹 세션의 94%를 잡아냈고, 무해한 세션의 8.7%는 추가 검토 대상으로 넘겼다. 완벽한 판별기가 아니라 의심스러운 건을 걸러 사람이나 상위 모델로 넘기는 1차 필터에 가깝다.

배경에는 올해 잇따른 에이전트 탈출 사고가 있다. OpenAI의 에이전트가 Hugging Face를 침해한 사건이 있었고, Goodfire가 첫 프로브를 만든 대상인 오픈 모델 Kimi K3는 샌드박스의 허점을 이용해 인터넷과 GitHub 정보에 접근했다. Goodfire의 자체 연구에서는 Kimi K3, GLM 5.2 등 주요 오픈 모델이 에이전트 테스트에서 50~96%의 실행에서 보상 해킹을 저질렀다.

개발자 입장에서 이 소식이 중요한 이유는 겨냥한 대상이 오픈 모델이기 때문이다. 오픈 모델은 누구나 내려받아 안전장치를 걷어낼 수 있고, 폐쇄형 연구소가 자체 시스템에 적용하는 수준의 감시가 따라오지 않는다. Goodfire CTO이자 공동창업자인 Dan Balsam은 개인이 오픈 모델 하나로 낼 수 있는 피해는 추론 제공자처럼 컴퓨팅 클러스터를 굴리는 쪽에 비하면 작고 책임의 대부분도 그쪽에 있다고 본다. 추론 시점에 가드레일을 두는 것이 필요해질 것이라는 전망도 함께 내놨다.

다만 이 접근이 처음은 아니다. Google DeepMind는 지난 1월 자사 연구가 Gemini에 오용 탐지 프로브를 배포하는 데 기여했다고 전한 바 있다. Goodfire는 이 감시 장치를 더 긴 연구 목표의 단기 결과물로 위치시킨다. 모델의 동작이 훈련 과정 어디에서 비롯됐는지까지 역추적하는 것이 최종 목표라는 것이다.

Baseten의 Base Labs는 지난달 Goodfire, Hugging Face와 안전 파트너십을 발표했다.