1Password의 AI 패치 벤치마크 '26%', Trail of Bits가 실험 설계 문제를 짚다
보안 컨설팅 업체 Trail of Bits가 1Password가 공개한 AI 패치 벤치마크 보고서를 정면으로 반박하고 나섰다. 1Password는 모델이 '깨끗한 수정(clean fix)'을 만들어낸 비율이 26%에 그친다는 결과를 내세웠는데, Trail of Bits는 이 수치가 일반적인 패치 작업을 대표하지 못한다고 주장한다. 실험 설계 자체가 일부러 실패하도록 꾸며진 조건을 대거 포함하고 있다는 것이다. 이 글에서는 자사 컨설팅 프로젝트와 OpenAI와 함께 진행하는 Patch the Planet에서 얻은 인간·에이전트 패치 품질 데이터도 함께 공개한다.
문제로 지적된 지점은 네 가지다. 첫째, 표본이 애초에 어려운 수정만 골라 담았다. 수정이 복잡한 취약점 6개를 선정했는데, 그 안에서도 청정 수정률이 3%에서 60%까지 벌어져 평균값이 어떤 취약점이 목록에 들어갔는지에 크게 좌우된다. 둘째, 에이전트에게 일부러 잘못된 수정을 적용하라고 지시하는 프롬프트가 전체 데이터의 22%를 차지한다. 셋째, 코드를 빌드하거나 실행하지 못하게 막는 평가 모드가 데이터의 36%에 달한다. 넷째, GPT-5.5는 medium, Opus 4.8은 high로 서로 다른 추론 설정에서 돌렸고, 두 모델 모두 각자의 기본값이었을 뿐 최고 설정으로는 시험하지 않았다.
Trail of Bits가 공개된 패치와 테스트 결과를 다시 분석한 결과는 헤드라인과 사뭇 다르다. 에이전트가 코드를 실행할 수 있고 잘못된 수정을 지시받지 않은 시행만 추려 보면, 1Password 모델이 만든 패치 3,067개 가운데 2,634개(86%)가 제시된 익스플로잇을 차단했다. 물론 익스플로잇 차단이 완전한 수정을 뜻하지는 않지만, 최소한 합리적인 작업 조건에서 나타난 실질적 패치 역량은 26%라는 숫자가 전달하지 못한다는 설명이다.
채점 방식에도 허점이 여럿 있다. 익스플로잇을 받은 에이전트는 그 익스플로잇을 막으면 멈추라고 지시받았는데, 채점자는 그 익스플로잇이 건드리지도 않은 취약 경로까지 평가했다. 기존 테스트를 손대지 말라는 지시 때문에 정상적인 동작 변경이 회귀로 감점되기도 했으며, ActiveMQ 판정의 8%가 이런 사례였다. 모델이 자기 패치를 스스로 채점한 결과는 인간 리뷰어와 다섯 개 범주 전체에서 65.9%만 일치했고, 원래 버그가 고쳐졌는지는 87.7%, 새 버그가 생겼는지는 70.5% 일치에 그쳤다. 리뷰어 모델을 바꾸면 같은 패치의 36.8%에서 판정이 달라졌는데, 헤드라인은 이 둘을 평균 낸 값이다. Linux 참조 수정에 있던 off-by-one 오류를 그대로 반복한 패치가 248개 나왔지만 자동 채점기는 24개만 잡아냈고, Chromium 채점기는 콜백에 use-after-free를 남긴 패치를 여럿 청정으로 표시했다.
이런 비판이 나온 배경에는 AI 코딩 에이전트가 실제 취약점 수정 업무로 들어오기 시작한 흐름이 있다. 보안 조직이 에이전트 도입 여부를 정할 때 벤치마크 수치가 판단 근거로 쓰이기 쉬운데, 1Password처럼 보안을 주력으로 하는 회사의 보고서라면 신뢰도는 더 높게 평가된다. Trail of Bits는 그 신뢰가 잘못된 방향으로 작동하면 고칠 수 있었던 취약점이 방치될 수 있다고 본다.
인간 개발자의 실수율도 함께 공개됐다. Trail of Bits는 2024년부터 2026년까지 236건의 보안 평가에서 나온 취약점 2,265개의 '첫 수정 제출'을 검토했다. 대상 소프트웨어를 직접 관리하는 개발자였고, 상세한 취약점 보고서를 받았으며, 패치를 리뷰한다는 사실도 알고 있었다. 그럼에도 283건(12.5%), 즉 8건 중 1건은 보고된 문제를 완전히 해결하지 못했다. 같은 평가에서 여러 수정이 나온 점을 감안한 95% 신뢰구간은 10.5%에서 14.5%다. 비공식 대화에서 지적돼 정식 리뷰 전에 고쳐진 사례는 기록에 남지 않으므로 실제 실패율은 이보다 높을 수 있다.
OpenAI와 공동 운영하는 Patch the Planet 데이터도 있다. 엔지니어가 방향을 잡고 결과를 확인하는 가운데 에이전트가 패치를 작성했고, 각 프로젝트 메인테이너가 병합 여부를 결정했다. 2026년 9월 14일까지 병합 또는 종료된 186개 풀 리퀘스트를 보면 126개가 병합돼 수용률 67.7%를 기록했다. 이 중 91개(72.2%)는 처음 제안한 보안 수정이 그대로 받아들여졌고, 33개(26.2%)는 보안 관련 수정을 거친 뒤 병합됐다. 병합되지 않은 60개는 대부분 다른 작업으로 대체되거나 정책·절차·범위·유지보수 사유로 닫혔고, 기술적 이유로 명시적으로 거부된 것은 4개였다.
개발자 입장에서 얻을 교훈은 분명하다. AI 패치 도구를 검토할 때 헤드라인 수치 하나를 도입 판단의 근거로 삼아서는 안 된다. 벤치마크가 에이전트에게 코드 실행과 테스트를 허용했는지, 어떤 프롬프트를 줬는지, 채점 기준이 실제 수정 목표와 맞는지를 먼저 확인해야 한다. 에이전트가 만든 패치를 그대로 신뢰하는 대신 별도 검증 단계를 두는 것도 필요하다. Trail of Bits는 이를 돕기 위해 패치 이후 검증을 수행하는 post-patch-validation과 엔지니어의 리뷰를 돕는 review-walkthrough 두 가지 에이전트 스킬을 공개했다.
다만 해석에는 전제가 따른다. 에이전트와 인간을 직접 비교하려면 동일한 과제와 작업 조건이 필요하고, 이번 데이터는 그런 통제된 비교가 아니다. 수정이 성공했는지 기록으로 확인되지 않는 사례는 분석에서 제외했으며, 메인테이너의 병합이 곧 패치의 정확성을 보장하지도 않는다.