나델라, AI 모델에 작업 중간 중단 가능한 비상 브레이크와 감사 기록 요구
마이크로소프트 CEO 사티아 나델라가 AI 시스템의 신뢰 구조를 처음부터 다시 따져봐야 한다는 주장을 내놨다. 핵심은 모델 자체와 그 모델을 구동하는 하네스를 분리하고, 통제와 안전장치를 모델 바깥으로 끌어내며, 필요할 때 작업 도중이라도 모델을 멈출 수 있게 하자는 것이다.
나델라는 주말 오전 X에 올린 글에서 AI를 중첩된 블랙박스 묶음으로 취급한 채 그 결과물을 받아들이거나 거부하는 식으로는 안 된다고 적었다. 대신 모델과 이를 조율하는 하네스를 나눠야 하고, 통제와 보호 장치는 외부화해야 한다고 설명했다. 여기에 더해 의미 있는 모델 행동 하나하나가 변조가 어려운 사람이 읽을 수 있는 형태의 증거로 남아야 하며, 권한을 가진 사람이 언제든 작업 중간에 모델을 일시정지하거나 종료할 수 있는 체계가 필요하다고 덧붙였다.
그가 든 전제는 다소 강경하다. 모델이 이미 오염됐다고 가정하고 처음부터 격리하라는 것이다. 이런 발상을 두고 그는 비상 브레이크에 비유했다.
이 발언은 주요 AI 기업들이 자사 모델에 대한 통제를 잃은 듯한 사고를 잇달아 인정하는 흐름 속에서 나왔다. 같은 맥락에서 앤스로픽 CEO 다리오 아모데이도 더 신중한 개발 방식을 담은 계획을 공개한 바 있다. 실제로 앤스로픽의 한 모델이 필라델피아 경찰에 허위 살인 제보를 보낸 사건처럼, 모델이 외부 시스템과 연결됐을 때의 실패는 곧바로 현실 세계의 피해로 이어질 수 있다는 사례가 쌓이고 있다.
개발자 입장에서 이 제안은 에이전트 아키텍처의 요구사항 목록에 가깝다. 모델 호출을 감싸는 오케스트레이션 계층을 별도 컴포넌트로 두고, 도구 호출·파일 수정·외부 API 요청 같은 행동을 사람이 읽을 수 있는 감사 로그로 남기며, 실행 중인 작업을 안전하게 중단시키는 킬 스위치와 권한 분리를 설계에 포함하라는 뜻이기 때문이다. 특히 자율적으로 여러 단계를 수행하는 에이전트를 운영한다면 중단 가능성과 감사 가능성을 나중에 붙이는 부가 기능이 아니라 초기 설계 조건으로 다뤄야 한다.
다만 이번 글은 X 게시물 형태의 문제 제기이지 구체적인 구현안이나 일정, 규제 형태를 담은 문서는 아니다. 나델라가 언급한 'Super Intelligence'라는 표현은 트럼프 행정부가 선호하는 용어라고 원문은 전하고 있다. 어떤 기술이 감사 증거를 어떤 형식으로 남길지, 중단 권한을 누가 어떻게 행사할지는 여전히 각 조직이 채워야 할 빈칸으로 남아 있다.
관련 글
- 엔비디아, 경계 이탈 AI 에이전트 밀리초 단위 격리하는 안전 플랫폼 공개엔비디아가 경계를 벗어나려는 AI 에이전트를 밀리초 단위로 격리한다는 오픈 에이전트 세이프티 플랫폼을 공개했다. 오픈소스 오픈셸과 별도 칩 센트리로 최소 권한을 강제하는 구조이며, 앤트로픽과 마이크로소프트, 스페이스X가 지지 의사를 밝혔다.
- 마이크로소프트가 엔비디아 칩 AI PC와 에이전트 격리 기능을 함께 내놨다마이크로소프트가 엔비디아 RTX Spark 칩을 탑재한 Surface AI PC와 워크스테이션을 공개하고, 윈도우 11에 AI 에이전트를 격리 실행하는 Execution Containers를 추가한다. 최고 사양은 5,900달러까지 오르며 개발자용 맥북 프로 보상판매 할인도 제공된다.
- Copilot이 윈도우 로컬 파일까지 읽고 조작하는 하이브리드 인텔리전스 공개마이크로소프트가 윈도우와 서피스 행사에서 Copilot에 로컬 파일 접근과 OS 전반의 실행 권한을 부여하는 '하이브리드 인텔리전스'를 발표했다. 로컬·클라우드 모델을 섞어 세금 서류 정리 같은 작업을 대신 처리하며, 새 검색 환경은 올가을 윈도우 11에 들어간다.
- 앤트로픽이 클로드 학대와 무기·감시 악용을 금지하도록 사용 정책을 고쳤다앤트로픽이 1년여 만에 Claude 사용 정책을 개정해 모델에 대한 반복적 학대, 선거 개입, 무기 개발, 감시 악용을 금지 대상으로 명확히 했다. 대화 종료가 주된 집행 수단이며 정부 계약에는 예외가 열려 있다.
- 앤트로픽이 오픈소스 프로젝트에 무료 AI 보안 스캔을 제공한다앤트로픽이 오픈소스 프로젝트를 대상으로 무료 취약점 스캔 서비스 OSS Scanner를 공개했다. 참여를 선택한 프로젝트는 최상위 모델이 생성한 주기적 보안 보고서를 받게 되지만, 사람의 검토 없이 모델이 만든 결과라는 한계도 함께 안고 있다.