Claude Opus 5.5, 서드파티 지능 지수 57.62점… GPT-6 Astra와 5점 차라는 평가 나와
Anthropic이 Claude Opus 5.5를 공개한 뒤, 서드파티 평가기관인 Artificial Analysis가 자사의 Intelligence Index를 버전 v4.3.2로 갱신하면서 이 모델의 점수를 함께 내놨다. 집계된 값은 57.62점이며, 측정 대상은 'max with fallback' 구성이다. 벤더가 직접 내세우는 성능 주장과는 별개로, 외부 지표에서 어느 정도 위치인지를 가늠할 수 있는 참조점이 하나 추가된 셈이다.
원문 제목은 이 점수가 GPT-6 Astra를 5점 차로 앞선다고 표현한다. 다만 원문에 실린 내용은 점수와 지수 버전, 측정 구성 정도이며 항목별 세부 점수나 평가 방식에 대한 설명은 포함돼 있지 않다. 'max with fallback'이라는 조건이 구체적으로 어떤 추론 강도와 라우팅 설정을 뜻하는지도 원문에서는 확인되지 않는다.
배경에는 모델별 자체 벤치마크 발표가 흔해진 상황이 있다. 각 개발사가 자신에게 유리한 조건과 과제를 골라 수치를 내놓는 일이 많아지면서, 여러 모델을 같은 틀에 놓고 비교하려는 독립 지수의 수요가 커졌다. Artificial Analysis의 Intelligence Index도 그런 용도로 인용되는 지표 중 하나다.
실무에서는 이 수치를 모델 선택의 출발점 정도로 쓰는 게 안전하다. 지수 점수는 특정 설정에서 측정된 값이므로, 실제 서비스에서 쓰는 프롬프트 길이·도구 호출·지연 시간 조건에서는 순위가 달라질 수 있다. 특히 추론 강도를 높이는 설정은 비용과 응답 시간을 함께 끌어올리기 때문에, 점수 상승분이 자기 워크로드에서 감당 가능한지 따로 확인해야 한다.
주의할 점도 있다. 원문 자체가 짧게 잘려 있어 지수 산출 방식, 항목별 구성, 비교 대상 모델의 측정 조건이 모두 확인되지 않는다. 단일 지수의 5점 차이만으로 두 모델의 우열을 단정하기는 어렵고, 이 수치는 Artificial Analysis가 발표한 값이라는 범위에서 받아들이는 편이 낫다.
관련 글
- Mercury 2.5, 초당 770토큰으로 치고 나왔다…지능은 중간권·가격은 합격점Artificial Analysis가 공개한 Mercury 2.5 분석에 따르면 이 추론 모델은 초당 770토큰 출력 속도와 26만 토큰 컨텍스트를 갖췄다. 지능 지수는 12점으로 중간값 13점에 못 미치지만, 태스크당 0.06달러로 가격 경쟁력은 확보했다.
- 예산별 최적 LLM, 매일 다시 계산되는 가성비 프런티어Artificial Analysis의 무료 API를 매일 수집해 예산별 최적 LLM을 계산하는 '가성비 프런티어' 페이지가 공개됐다. 100만 토큰당 블렌디드 가격과 Intelligence Index를 대조해 일별 변동까지 한 표에서 보여준다.
- GPT-6 Astra, 채팅 한 번으로 차량 주행 과제 수행… 3회 시도 벤치마크 공개GPT-6 Astra가 하나의 연속된 채팅 안에서 최대 3회 시도로 차량 주행 과제를 수행한 평가 결과가 공개됐다. 코스 중심선 기준 진행률과 GPS 주행 거리, 완주 시간, 명령 호출 수, 토큰·비용을 함께 측정한다.
- Anthropic, Claude Opus 5.5 공개…Fable 5.1급 성능에 비용은 40% 절감Anthropic이 Claude 5.5 패밀리의 첫 모델 Claude Opus 5.5를 공개했다. Fable 5.1에 준하는 성능을 내면서 Opus 5보다 실행 비용이 40% 낮고, 캐시 읽기 단가도 60% 인하됐다.
- Opus 5.5 기본 사고 등급이 medium으로, 기존 xhigh 사용자들은 재조정 고민Opus 5.5의 기본 사고 등급이 medium으로 바뀌었다는 사용자 공유가 올라왔다. 기존에 xhigh를 쓰던 개발자라면 high로 충분한지, 기본값 변경이 추론 비용과 응답 품질에 어떤 영향을 주는지 점검할 필요가 있다.