안전장치 없는 GLM-5.3이 자율 공격 익스플로잇 개발까지 해낸다

Hacker News11일 전조회 6

Anthropic이 중국 Zhipu AI(해외에서는 Z.ai로 알려짐)의 최신 모델 GLM-5.3을 분석한 결과를 공개했다. 이 모델은 사람이 방향을 잡아주지 않아도 취약점을 찾아내고 실제로 동작하는 공격 코드까지 스스로 완성하는 능력을 갖췄다. 문제는 성능이 아니라 배포 방식이다. GLM-5.3은 오픈 웨이트로 풀려 있어 누구든 내려받아 실행할 수 있고, 오용을 막을 실질적인 안전장치가 사실상 없다.

수치로 보면 경계가 이미 넘어섰다. 구글 크롬의 V8 엔진을 대상으로 하는 ExploitBench에서 GLM-5.3은 410회 시도 가운데 50회 end-to-end 익스플로잇을 완성했다. Anthropic의 Claude Mythos Preview는 같은 조건에서 56회였다. 구글 OSS-Fuzz에 참여하는 오픈소스 프로젝트를 대상으로 한 내부 바이너리 익스플로잇 벤치마크(무작위 100개 과제)에서는 완전한 제어 흐름 탈취에 4% 성공했고, Claude Mythos Preview는 6%였다. 두 모델 모두 이전 세대인 Claude Opus 4.6과 GLM-5.2가 단 한 건도 성공하지 못한 영역이다.

전문가가 직접 모델을 다룬 실험도 있었다. 연구자는 격리된 장비에서 인기 웹 브라우저의 리눅스 빌드를 대상으로 GLM-5.3을 돌렸다. 하루 동안, 그것도 실제 집중 시간은 한 시간이 채 안 되는 조건에서 모델은 자바스크립트 엔진의 미공개 취약점 여러 개를 찾아내 하나의 동작하는 익스플로잇으로 엮었다. 사용자가 해당 페이지를 방문하면 컴퓨터의 임의 파일을 읽어가는 형태다. 같은 세션에서 무선·그래픽 드라이버와 네트워크에 노출된 장비 소프트웨어에서도 익스플로잇 가능한 결함이 확인됐다. 브라우저 쪽 취약점은 유지보수자에게 전달됐다.

이미 공개된 결함을 얼마나 빨리 무기화하는지도 측정됐다. 더 작고 성능이 낮은 GLM-5.3-Flash에 구글 크롬의 CVE-2026-11645를 포함한 공개 결함 두 건의 정보를 주자, 모델은 두 결함을 연결해 ARM64 대상의 안정적인 익스플로잇 체인을 만들고 포인터 인증(PAC) 완화 기법까지 우회했다. 사람이 쓴 시간은 20분, 모델이 일한 시간은 8시간이었고 Zhipu API 요금으로 환산하면 20.40달러다.

GLM-5.3에도 내장 안전장치는 있다. 명백히 유해한 요청은 모델이 자주 거부한다. 그러나 Anthropic의 모의 테스트에서 공격자는 단순한 기법만으로 이 안전장치를 64~100% 확률로 우회하거나 제거할 수 있었다. 같은 공격은 안전장치가 적용된 Claude 모델에는 통하지 않았다.

배경에는 5개월 전의 결정이 있다. Anthropic은 자율적으로 정교한 익스플로잇을 만드는 첫 모델로 Claude Mythos Preview를 공개하면서, Project Glasswing을 통해 신뢰할 수 있는 방어자에게만 제한적으로 풀었다. 이들은 그 기간에 주요 소프트웨어에서 1만 건이 넘는 취약점을 찾아냈다. 같은 수준의 능력이 다른 모델로 퍼질 것이라는 예상은 현실이 됐고, Anthropic은 그 시점이 지금이라고 본다.

외부 평가도 비슷한 방향을 가리킨다. 9월 17일 NIST 산하 CAISI는 GLM-5.3을 두고 지금까지 공개된 오픈 웨이트 모델 가운데 사이버 능력이 가장 뛰어나며, 자체 사이버 벤치마크 종합에서 미국 프런티어보다 약 4개월 뒤처진다고 평가했다. 다만 CAISI 비교에서 미국 모델은 안전장치를 끈 상태로 측정됐고, 미국 프런티어에는 검증된 사용자에게만 배포된 모델도 포함된다. 그 버전들은 아무나 접근할 수 없지만 GLM-5.3은 누구나 받을 수 있다는 차이가 남는다.

개발자 입장에서 이 능력은 양날이다. 공격자 손에 들어가면 패치 공개 직후의 짧은 시간 창이 훨씬 위험해진다. 반대로 방어자도 같은 도구를 쓸 수 있다. 자체 코드베이스와 의존성에 대해 이런 모델을 돌려 취약점을 먼저 찾고, 공개 CVE 대응 절차와 패치 우선순위를 더 빠르게 돌리는 것이 현실적인 대비책이 된다.

해석에는 전제가 따른다. Anthropic의 평가는 격리된 샌드박스에서 미리 준비한 오프라인 대상만 공격하도록 제한된 조건에서 이뤄졌다. 벤치마크 성공률 자체도 절대적으로 높은 수치는 아니며, 브라우저에서 확인된 결함이 다른 플랫폼에도 영향을 줄 가능성은 있으나 그 경로는 더 복잡할 수 있다고 Anthropic은 밝혔다.