Anthropic, Claude Opus 5.5 공개…Fable 5.1급 성능에 비용은 40% 절감

Hacker News18일 전조회 2

Anthropic이 새 모델 패밀리 Claude 5.5의 첫 주자로 Claude Opus 5.5를 내놨다. 대부분의 작업에서 Claude Fable 5.1과 비슷한 수준의 결과를 내면서 실행 비용은 Opus 5보다 40% 낮다는 점이 이번 릴리스의 핵심이다. 에이전틱 코딩과 컴퓨터 사용, 지식 노동 영역에서 자사 벤치마크 선두를 차지했고, 안전성 감사에서는 지금까지 테스트한 모델 가운데 가장 좋은 점수를 기록했다.

성능 수치를 보면 Terminal-Bench 4.0에서 66.4%, FrontierCode v1.1에서 54.4%, CursorBench 4.0에서 57.8%를 기록했다. 지식 노동 지표인 GDPval-AA v2.1은 1846, 업무 자동화를 보는 AutomationBench는 40.0%, 도구를 쓴 Humanity's Last Exam은 67.7%다. 과학 연구용 Terminal-Bench-Science 0.1은 58.7%, 컴퓨터 사용을 평가하는 OSWorld 2.0은 81.8%(partial), 차트 인식 Chartography는 도구 사용 시 89.0%였다. 다만 Anthropic은 이 정도 능력대에서는 벤치마크 격차가 실제 체감 차이를 설명하는 지표로서 신뢰도가 떨어진다고 덧붙였다. 자사 사용 경험에서 Opus 5.5와 Fable 5.1의 차이는 점수 차이보다 좁다는 설명이다.

긴 작업에서의 효율이 특히 두드러진다. 초기 테스터 중 한 명은 68만 줄 규모의 코드 마이그레이션을 하루 안에 끝냈는데, 같은 일을 엔지니어링 팀이 처리하면 몇 주가 걸리는 분량이다. 웹 앱 전체 페이지의 로드 시간을 줄이는 작업에서는 40번 중 39번 성공했고, Opus 5는 더 작은 개선에 그치면서 앱 동작까지 바꿔놨다. 20만 줄 코드베이스를 감사하고 수정하는 데는 3시간이 채 걸리지 않았는데, Opus 5는 20시간 넘게 걸리면서 토큰도 2.5배 더 썼다. HAProxy를 C에서 Rust로 옮기는 내부 테스트에서는 9.5시간에 끝내 Fable 5.1의 12시간을 앞섰고 비용은 51% 덜 들었다.

가격은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로 Opus 5보다 20% 낮다. 에이전트·코딩 작업 비용의 대부분을 차지하는 캐시 읽기는 100만 토큰당 0.20달러로 60% 인하됐다. 출력 생성 속도도 Opus 5보다 30% 이상 빠르다. Claude Code와 Claude Platform에서는 최대 2.5배 속도의 Fast 모드를 쓸 수 있으며, 이때는 입력 8달러·출력 40달러가 적용된다.

안전성 쪽에서는 수천 개의 시뮬레이션 시나리오로 모델을 검사하는 자동 행동 감사에서 역대 최고 점수를 냈다. 되돌리기 어려운 행동을 하거나 주어진 경계를 벗어날 가능성이 최근 모델들보다 크게 낮아졌고, 프롬프트 인젝션에 대한 저항성도 Opus 5보다 강해졌다. 정렬 테스트 범위도 장기 작업, 불가능한 작업, 실제 사고를 모델링한 시나리오까지 넓혔다. 세부 평가 내용은 Opus 5.5 시스템 카드에 담겼다.

생물학과 사이버보안 영역에서 Claude Mythos 5.1과 비슷한 수준에 도달한 만큼, Fable 5.1에 적용한 것과 유사한 보호조치가 함께 배포된다. 검증된 조직은 생명과학 검증 프로그램에 신청해 생물학 연구에 Opus 5.5를 쓸 수 있고, 사이버 검증 프로그램도 몇 주 안에 접근 범위가 넓어져 검증된 보안 실무자가 업무에 활용할 수 있게 된다.

이번 모델은 Anthropic이 프런티어 개발 속도 조절을 공개적으로 촉구한 이후 나온 첫 릴리스다. 출시 전에 Frontier Design과 METR 등 외부 평가자들이 테스트를 맡았다.

개발자 입장에서 가장 직접적인 변화는 비용 구조다. 토큰 단가가 내려간 데다 작업당 토큰 소모도 줄어 실제 청구 금액은 40%가량 낮아진다. FrontierCode 기본 설정 기준으로 GPT-6 Astra를 약 20% 비용으로 앞서고, Terminal Bench 4.0에서는 Astra와 비슷한 성능을 40% 비용에 낸다. CursorBench에서는 GPT-5.6 Sol을 11점 차로 앞서면서 비용은 3분의 1 수준이다. Pro·Max·Team 요금제의 5시간 사용 한도도 올라가고, 구독자는 비율 제한 리셋을 저장해 원하는 시점에 쓸 수 있다. Claude Sonnet 5.5와 Claude Haiku 5.5도 몇 주 안에 같은 개선을 담고 나온다.

주의할 점도 있다. 벤치마크 우위가 실제 차이를 보장하지 않는다는 건 Anthropic 스스로 인정한 부분이다. 또 Opus 5.5는 프로덕션 보호조치를 켠 상태로 평가됐는데, 보호조치가 개입한 경우 사이버보안 작업은 Claude Opus 4.8이, 생물학과 프런티어 LLM 개발 작업은 Claude Opus 5가 대신 수행했다. 이 때문에 해당 벤치마크 점수는 실제보다 낮게 나왔을 가능성이 있다. AutomationBench는 폴백 모델 없이 돌려 보호조치 개입을 실패로 처리했기 때문에 실사용 성능보다 낮은 수치라는 설명도 붙었다.

관련 글