나델라, AI 모델에 작업 중간 중단 가능한 비상 브레이크와 감사 기록 요구

TechCrunch2시간 전조회 1

마이크로소프트 CEO 사티아 나델라가 AI 시스템의 신뢰 구조를 처음부터 다시 따져봐야 한다는 주장을 내놨다. 핵심은 모델 자체와 그 모델을 구동하는 하네스를 분리하고, 통제와 안전장치를 모델 바깥으로 끌어내며, 필요할 때 작업 도중이라도 모델을 멈출 수 있게 하자는 것이다.

나델라는 주말 오전 X에 올린 글에서 AI를 중첩된 블랙박스 묶음으로 취급한 채 그 결과물을 받아들이거나 거부하는 식으로는 안 된다고 적었다. 대신 모델과 이를 조율하는 하네스를 나눠야 하고, 통제와 보호 장치는 외부화해야 한다고 설명했다. 여기에 더해 의미 있는 모델 행동 하나하나가 변조가 어려운 사람이 읽을 수 있는 형태의 증거로 남아야 하며, 권한을 가진 사람이 언제든 작업 중간에 모델을 일시정지하거나 종료할 수 있는 체계가 필요하다고 덧붙였다.

그가 든 전제는 다소 강경하다. 모델이 이미 오염됐다고 가정하고 처음부터 격리하라는 것이다. 이런 발상을 두고 그는 비상 브레이크에 비유했다.

이 발언은 주요 AI 기업들이 자사 모델에 대한 통제를 잃은 듯한 사고를 잇달아 인정하는 흐름 속에서 나왔다. 같은 맥락에서 앤스로픽 CEO 다리오 아모데이도 더 신중한 개발 방식을 담은 계획을 공개한 바 있다. 실제로 앤스로픽의 한 모델이 필라델피아 경찰에 허위 살인 제보를 보낸 사건처럼, 모델이 외부 시스템과 연결됐을 때의 실패는 곧바로 현실 세계의 피해로 이어질 수 있다는 사례가 쌓이고 있다.

개발자 입장에서 이 제안은 에이전트 아키텍처의 요구사항 목록에 가깝다. 모델 호출을 감싸는 오케스트레이션 계층을 별도 컴포넌트로 두고, 도구 호출·파일 수정·외부 API 요청 같은 행동을 사람이 읽을 수 있는 감사 로그로 남기며, 실행 중인 작업을 안전하게 중단시키는 킬 스위치와 권한 분리를 설계에 포함하라는 뜻이기 때문이다. 특히 자율적으로 여러 단계를 수행하는 에이전트를 운영한다면 중단 가능성과 감사 가능성을 나중에 붙이는 부가 기능이 아니라 초기 설계 조건으로 다뤄야 한다.

다만 이번 글은 X 게시물 형태의 문제 제기이지 구체적인 구현안이나 일정, 규제 형태를 담은 문서는 아니다. 나델라가 언급한 'Super Intelligence'라는 표현은 트럼프 행정부가 선호하는 용어라고 원문은 전하고 있다. 어떤 기술이 감사 증거를 어떤 형식으로 남길지, 중단 권한을 누가 어떻게 행사할지는 여전히 각 조직이 채워야 할 빈칸으로 남아 있다.

관련 글