xAI grok-4.7 공개, CursorBench에서 Opus 5 Extra High와 근소한 차이

V2EX19일 전조회 2

xAI의 새 플래그십 모델인 grok-4.7이 모델 호스팅 서비스 Modelflare에 공개됐다. 기존 grok-4.5와 grok-4.6도 계속 사용할 수 있어, 최신 버전을 쓰거나 이전 버전에 머무는 선택지가 함께 열려 있다.

스펙은 컨텍스트 50만 토큰, 텍스트와 이미지 입력, 텍스트 출력이다. API는 Chat Completions와 Responses 두 방식을 지원한다. 코딩 에이전트 평가인 CursorBench에서는 Extra High 설정의 grok-4.7이 46.3%를 기록해 같은 설정의 Opus 5 Extra High(46.1%)를 0.2%포인트 앞섰다. Opus 5 Max는 46.6%로 더 높다. Cursor가 공개 표가를 기준으로 환산한 작업당 비용은 grok-4.7 Extra High가 약 6.01달러, Opus 5 Extra High가 약 11.43달러다.

이 점수를 내려면 추론 강도를 조절하는 reasoning_effort 값을 xhigh로 지정해야 한다. 기본값은 high다. 즉 같은 모델이라도 설정 한 단계에 따라 벤치마크 결과와 호출 비용이 함께 움직인다.

가격은 Modelflare의 두 그룹 모두에서 열려 있다. 기본 표가는 grok-4.6과 같고 여기에 그룹 배율이 곱해진다. grok-award(0.03x)는 100만 토큰당 입력 0.06달러, 출력 0.18달러, 캐시 읽기 0.015달러다. grok-stable(0.11x)은 입력 0.22달러, 출력 0.66달러, 캐시 읽기 0.055달러다. 사용하려면 API Key 설정에서 그룹을 고르고 모델 이름에 grok-4.7을 넣으면 된다.

개발자 입장에서 눈에 띄는 지점은 성능 차이보다 비용 차이다. 최상위 설정끼리 비교하면 점수는 거의 붙어 있는데 환산 단가는 두 배 가까이 벌어진다. 다만 이 수치는 Cursor가 자체 기준으로 계산한 값이라 실제 청구 금액과는 다를 수 있고, 호스팅 그룹 선택에 따라서도 크게 달라진다.

해석에는 주의가 필요하다. Cursor는 점수에 변동이 있어 근접한 차이가 통계적으로 유의미하다고 보기 어렵다고 설명한다. 46.3%와 46.1% 같은 0.2%포인트 차이는 단일 벤치마크 결과만으로 우열을 단정하기 어렵다는 뜻이다.

관련 글