Anthropic, Claude Sonnet 5.5 공개…코딩 벤치마크 10.3%→70.6%, 작업당 비용 최대 30% 절감
Anthropic이 Claude 5.5 패밀리의 두 번째 모델인 Claude Sonnet 5.5를 내놨다. 같은 패밀리의 Opus 5.5가 복잡하고 판단이 많이 필요한 작업을 겨냥한다면, Sonnet 5.5는 범위가 분명한 일상 업무와 버그 수정, 문서·슬라이드·스프레드시트 같은 결과물 제작에 강점을 두는 저비용·고속 모델이다. 디자인 감각도 함께 강조했다. 전작인 Sonnet 5와 비교해 생성 속도는 30% 이상 빨라졌고, 대부분의 작업에서 비용은 최대 30%까지 줄어든다.
성능 향상 폭은 코딩 영역에서 두드러진다. 에이전트 코딩 평가인 Terminal-Bench 4.0에서 Sonnet 5.5는 70.6%를 기록해 Sonnet 5의 10.3%를 크게 앞섰다. FrontierCode 1.1(Main)에서는 Max effort 기준 46.2%로 Sonnet 5의 42.4%를 넘었고, Opus 5.5의 54.4%와 GPT-6 Sol의 49.3% 사이에 자리한다. 실제 Cursor 세션에서 뽑은 다중 파일 작업을 다루는 CursorBench 4.0에서는 55.5%로 Opus 5.5의 57.8%에 약 2점 차로 따라붙었다. 지식 노동 평가인 GDPval-AA v2.1(1844)과 AA-Briefcase v1.1(1811)에서는 Opus 5.5에 각각 2점, 11점 뒤졌다. 도구를 쓴 Humanity's Last Exam은 64.5%, 컴퓨터 사용 평가 OSWorld 2.1은 80.1%, 차트 인식 Chartography는 도구 없이 61.6%를 기록했다. 스크린샷만으로 포켓몬 레드를 깬 첫 Sonnet 모델이라는 점도 내세운다.
가격표는 Sonnet 5와 같다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러, 캐시 읽기 100만 토큰당 0.20달러다. 절감은 단가가 아니라 토큰 소비에서 나온다. 같은 일을 하는 데 필요한 토큰이 훨씬 적어 작업당 비용이 최대 30% 낮아진다는 설명이다. effort 레벨별 곡선도 달라졌다. Low나 Medium effort에서 Sonnet 5의 최고 점수를 약 10분의 1 비용으로 넘어서는 벤치마크가 여럿 있고, FrontierCode High effort에서는 같은 설정의 Sonnet 5보다 10점 높으면서 작업당 비용은 약 15분의 1 수준이다. Claude 앱 기본값인 Medium effort의 Terminal-Bench 결과, Claude 플랫폼 기본값인 High effort의 FrontierCode 결과도 같은 맥락에서 강조된다.
패밀리 구성도 함께 정리됐다. Opus 5.5가 지속적인 판단이 필요한 복잡한 작업을 맡고, Sonnet 5.5가 그보다 가벼운 실무를 분담하는 구도다. 대량 처리와 비용 민감한 애플리케이션을 겨냥한 Claude Haiku 5.5는 몇 주 안에 5.5 패밀리에 합류할 예정이다.
실무에서 체감할 변화는 속도와 반복 횟수다. 초기 테스터들은 Sonnet 5.5가 코드베이스를 빠르게 파악한다는 점을 꼽았고, 도구 호출을 묶어서 처리하는 빈도가 Sonnet 5보다 높아 단계 수와 비용이 함께 줄었다고 전했다. Cursor의 ML 디렉터는 CursorBench 4.0에서 55.5%로 Opus 5.5 다음에 오르는 성능이라며 성능과 비용의 균형을 원하는 개발자에게 맞을 것이라고 평가했다. Base44의 AI 엔지니어링 리드는 실제 앱 빌드 118건에서 Sonnet 5.5가 Opus 5와 같은 수준의 점수를 냈고, 빌드당 평균 반복이 3.6회로 Opus 5의 7.7회보다 적었다고 밝혔다. 도구 호출 실패가 비교 모델 중 가장 적었고, 빌드 도중 사용자에게 질문하려 멈추는 일도 드물었다는 설명이다. Epic Games의 COO는 수만 줄 규모의 게임플레이 시스템 아키텍처를 다루면서도 응답이 빠르고 여러 시간짜리 작업을 소화했다고 언급했다.
안전 관련 변화도 있다. 자동 행동 감사에서 Sonnet 5.5는 대부분의 정렬 지표에서 Sonnet 5와 같거나 개선된 결과를 냈다. 사이버보안 능력이 Opus 5와 비슷한 수준으로 평가되면서, 가장 강력한 모델에 적용해 온 사이버 세이프가드와 폴백을 처음으로 Sonnet 라인에 탑재했다. 생물학 세이프가드는 Sonnet 5와 동일하다. 두 장치 모두 위험도가 높은 좁은 범위의 요청만 대상으로 하며, 일상적인 소프트웨어 개발과 대부분의 생명과학 작업에는 영향을 주지 않는다고 밝혔다.
다만 벤치마크 점수가 모델 능력의 한 단면이라는 단서도 붙었다. Anthropic 자체 테스트와 외부 테스터 모두 지속적인 판단이 필요한 복잡하고 개방형인 작업에서는 Opus 5.5가 여전히 확실히 앞선다고 본다. 또 Terminal-Bench와 OpenAI가 GPT-6 Sol 성능을 공개하지 않아 일부 비교표에는 GPT-5.6 Sol 수치를 대신 표기했다는 점도 함께 밝혔다.