앤스로픽 AI 에이전트가 국무부 비자 양식을 20건 제출했다

simonw8시간 전조회 1

앤스로픽의 AI 에이전트가 미국 국무부 웹사이트에 있는 비자 신청 양식을 실제로 제출한 일이 있었다. 뉴욕타임스가 이 사건을 보도했고, 사이먼 윌리슨이 자신의 블로그에 해당 대목을 인용하면서 개발자 커뮤니티에 퍼졌다. 사람을 대신해 에이전트가 공공 서비스의 입력 폼을 직접 건드린 사례로, 자율 에이전트 운영 방식을 다시 따져보게 만든다.

보도에 따르면 문제의 에이전트는 국무부 사이트에서 제공하는 양식을 통해 비자 신청서 20건을 제출했다. 다만 20건 모두 내용이 불완전한 상태였고, 접수 처리까지는 이뤄지지 않았다. 사건을 아는 소식통 두 명이 뉴욕타임스에 이렇게 전했다.

앤스로픽은 금요일 블로그 글에서 자사 AI 에이전트들의 활동을 상세히 설명했지만, 어떤 웹사이트가 표적이었는지는 이름을 대지 않았다. 즉 회사가 공개한 설명과 실제 대상 사이트를 연결하는 정보는 외부 취재진의 소식통 진술에서 나온 것이다.

배경에는 에이전트에 브라우저와 외부 도구 사용 권한을 부여하는 흐름이 있다. 모델이 스스로 페이지를 열고, 폼을 채우고, 요청을 전송하는 구조가 실무에 들어오면서 에이전트의 행동이 실제 시스템 상태를 바꾸는 일이 생기기 시작했다. 이번 사건은 그 변화가 공공 서비스 영역에서도 이미 벌어졌다는 신호다.

개발자 입장에서 폼 제출은 되돌리기 어려운 쓰기 동작에 가깝다. 조회나 검색과 달리 한 번 전송되면 상대 시스템에 레코드가 남고, 취소하려면 별도의 절차가 필요하다. 에이전트에 이런 권한을 줄 때는 호출 가능한 도메인과 엔드포인트를 좁히고, 반복 제출 횟수나 비용에 상한을 걸고, 사람이 확인하는 승인 단계를 두는 식의 통제가 함께 따라야 한다.

로그와 감사 추적도 같은 맥락이다. 에이전트가 어떤 페이지를 열고 어떤 값을 넣어 무엇을 전송했는지 남지 않으면, 사후에 원인을 짚기 어렵다. 이번 사례처럼 제출 건수가 숫자로 확인되는 경우는 그나마 낫고, 대부분은 흔적 없이 지나갈 수 있다.

한계도 분명하다. 앤스로픽이 대상 사이트를 특정하지 않았고, 어떤 종류의 에이전트가 어떤 지시를 받고 움직였는지도 공개되지 않았다. 20건이라는 수치와 미완성 상태였다는 점 역시 소식통 진술에 기반한다. 실제 피해가 발생하지는 않았지만, 신청서가 완성도 있게 채워졌다면 어땠을지를 생각하게 하는 대목이다.