Anthropic이 Claude Haiku 5.5를 공개하며 소형 모델 가격을 75% 낮췄다
Anthropic이 소형 모델 라인업의 새 버전인 Claude Haiku 5.5를 내놨다. 회사가 지금까지 공개한 소형 모델 가운데 가장 빠르고 가장 저렴하면서 성능도 가장 높다는 게 자체 설명이다. 요약, 컨텍스트 압축, 데이터베이스 질의, 분류처럼 호출량이 많고 단가에 민감한 작업을 겨냥해 설계됐다.
성능 지표부터 보면 이전 세대와의 격차가 크다. 전문 직업군 작업을 평가하는 GDPval-AA v2.1에서 1620점을 기록해 Haiku 4.5의 735점을 두 배 이상 앞섰고, 같은 벤치마크에서 GPT-6 Luna는 1437점, Sonnet 5.5는 1840점이었다. AA-Briefcase v1.1에서는 1578점(Haiku 4.5 614점)이다. 컴퓨터 조작 능력을 재는 OSWorld 2.1 오프라인 서브셋에서는 72.4%로 Haiku 4.5의 15.7%에서 크게 뛰었고, Humanity's Last Exam은 도구 없이 45.9%, 도구를 쓰면 57.4%다. 에이전트 코딩 쪽 Terminal-Bench 4.0은 39.2%(Haiku 4.5는 0.0%), FrontierCode 1.1 Main은 46.4%, 시각 추론 벤치마크 Chartography는 46.4%를 나타냈다.
가격은 이번 발표의 핵심이다. 100k 토큰 이하 프롬프트 기준으로 100만 토큰당 입력 0.10달러, 출력 0.50달러, 캐시 읽기 0.01달러, 캐시 쓰기 0.125달러다. 100k를 넘는 프롬프트에는 각각 0.50달러, 2.50달러, 0.05달러, 0.625달러가 적용된다. Haiku 4.5가 입력 1.00달러, 출력 5.00달러였으니 체감 단가는 10분의 1 수준까지 내려간다. Anthropic은 평균적으로 약 75% 저렴해졌다고 설명하며, 이전 Haiku 모델로 들어온 요청의 약 90%가 100k 이하 프롬프트였다는 점을 근거로 들었다.
Haiku 등급 모델로는 처음으로 조정 가능한 effort 설정이 들어간 것도 눈에 띈다. 다른 상위 모델들처럼 비용을 우선할지 추론 능력을 우선할지 사용자가 직접 고를 수 있다는 뜻이다. Anthropic은 OSWorld, GDPval-AA, Humanity's Last Exam 세 벤치마크에서 effort 단계별 정확도 대비 비용 곡선을 함께 공개했다.
모델 가격만 바뀐 게 아니다. Sonnet 5.5의 캐시 읽기 단가가 100만 토큰당 0.20달러에서 0.10달러로 절반이 됐다. 캐시 읽기가 전체 토큰 소비에서 큰 비중을 차지하기 때문에, 대부분의 에이전트 작업에서 Sonnet 5.5 운영 비용이 약 20% 줄어든다. Claude Max와 Team 구독자에게는 에이전트와 애플리케이션을 만들 때 쓸 수 있는 월간 API 크레딧도 새로 지급된다.
초기 테스트에 참여한 기업들의 반응은 속도와 비용 양쪽에 집중돼 있다. Asana는 AI 에이전트 제품 평가에서 작업 완료 지연이 30% 이상 줄고 에이전트 턴당 추론이 최대 2.5배 빨라졌다고 전했다. HubSpot은 CRM 과제 평가 스위트에서 세 번 평균 92.8%를 기록해 자사가 본 최고 점수라고 밝혔고, AlphaSense는 주당 약 800만 건 호출되는 문서 질의 기능에서 400개 쿼리 기준 0.84 대 0.76으로 개선됐다고 했다. Box는 Haiku 4.5보다 11점 높으면서 지연은 절반 수준이었다고 평가했고, Cognition은 Devin Fusion에서 Haiku 5.5를 사이드킥으로 두고 FrontierCode 66.2점을 유지하면서 비용과 지연을 줄였다고 설명했다.
이 모델의 자리는 명확하다. Opus 5.5나 Sonnet 5.5가 큰 작업을 이끌고, Haiku 5.5가 그 아래에서 조회·요약·분류를 맡는 서브에이전트 구성이다. 큰 모델이 문서 전체를 붙들고 씨름하는 대신, 필요한 항목만 빠르게 뽑아오는 역할을 소형 모델이 담당하게 된다. 실시간 고객 지원이나 브라우저 자동화처럼 응답 속도가 중요한 작업에도 맞는다.
실무에서는 모델 ID claude-haiku-5-5로 바로 쓸 수 있고, Amazon Web Services, Google Cloud, Microsoft Azure를 포함한 주요 플랫폼에 모두 올라와 있다. 기존 Haiku 4.5를 쓰던 파이프라인이라면 마이그레이션 가이드를 참고해 교체하는 편이 좋다. 다만 effort 설정이 새로 생긴 만큼, 비용만 보고 기본값을 그대로 두기보다 워크로드별로 어느 단계가 적합한지 확인하는 과정이 필요하다.
주의할 지점도 있다. Anthropic은 Haiku 5.5가 정렬 평가에서 Haiku 4.5보다 대부분 항목이 개선됐고 오용 협조 성향도 낮아졌다고 밝혔지만, 사이버보안 세이프가드는 Haiku 4.5보다 더 제한적이다. 최근 다른 모델들보다는 덜 제한적이어서 Sonnet 5.5보다 넓은 범위의 방어 작업을 허용하는 대신, 침투 테스트처럼 공격자 쪽에서 쓰일 가능성이 높은 기법은 여전히 막는다. 생물학 관련 세이프가드는 Sonnet 5, Sonnet 5.5, Opus 5와 동일한 수준이며, 연구 목적의 생물학·사이버 활동을 하는 조직은 별도의 검증 프로그램을 신청해야 한다.