xAI grok-4.7 공개, CursorBench에서 Opus 5 Extra High와 근소한 차이
xAI의 새 플래그십 모델인 grok-4.7이 모델 호스팅 서비스 Modelflare에 공개됐다. 기존 grok-4.5와 grok-4.6도 계속 사용할 수 있어, 최신 버전을 쓰거나 이전 버전에 머무는 선택지가 함께 열려 있다.
스펙은 컨텍스트 50만 토큰, 텍스트와 이미지 입력, 텍스트 출력이다. API는 Chat Completions와 Responses 두 방식을 지원한다. 코딩 에이전트 평가인 CursorBench에서는 Extra High 설정의 grok-4.7이 46.3%를 기록해 같은 설정의 Opus 5 Extra High(46.1%)를 0.2%포인트 앞섰다. Opus 5 Max는 46.6%로 더 높다. Cursor가 공개 표가를 기준으로 환산한 작업당 비용은 grok-4.7 Extra High가 약 6.01달러, Opus 5 Extra High가 약 11.43달러다.
이 점수를 내려면 추론 강도를 조절하는 reasoning_effort 값을 xhigh로 지정해야 한다. 기본값은 high다. 즉 같은 모델이라도 설정 한 단계에 따라 벤치마크 결과와 호출 비용이 함께 움직인다.
가격은 Modelflare의 두 그룹 모두에서 열려 있다. 기본 표가는 grok-4.6과 같고 여기에 그룹 배율이 곱해진다. grok-award(0.03x)는 100만 토큰당 입력 0.06달러, 출력 0.18달러, 캐시 읽기 0.015달러다. grok-stable(0.11x)은 입력 0.22달러, 출력 0.66달러, 캐시 읽기 0.055달러다. 사용하려면 API Key 설정에서 그룹을 고르고 모델 이름에 grok-4.7을 넣으면 된다.
개발자 입장에서 눈에 띄는 지점은 성능 차이보다 비용 차이다. 최상위 설정끼리 비교하면 점수는 거의 붙어 있는데 환산 단가는 두 배 가까이 벌어진다. 다만 이 수치는 Cursor가 자체 기준으로 계산한 값이라 실제 청구 금액과는 다를 수 있고, 호스팅 그룹 선택에 따라서도 크게 달라진다.
해석에는 주의가 필요하다. Cursor는 점수에 변동이 있어 근접한 차이가 통계적으로 유의미하다고 보기 어렵다고 설명한다. 46.3%와 46.1% 같은 0.2%포인트 차이는 단일 벤치마크 결과만으로 우열을 단정하기 어렵다는 뜻이다.
관련 글
- Anthropic, Claude Opus 5.5 공개…Fable 5.1급 성능에 비용은 40% 절감Anthropic이 Claude 5.5 패밀리의 첫 모델 Claude Opus 5.5를 공개했다. Fable 5.1에 준하는 성능을 내면서 Opus 5보다 실행 비용이 40% 낮고, 캐시 읽기 단가도 60% 인하됐다.
- Opus 5.5 기본 사고 등급이 medium으로, 기존 xhigh 사용자들은 재조정 고민Opus 5.5의 기본 사고 등급이 medium으로 바뀌었다는 사용자 공유가 올라왔다. 기존에 xhigh를 쓰던 개발자라면 high로 충분한지, 기본값 변경이 추론 비용과 응답 품질에 어떤 영향을 주는지 점검할 필요가 있다.
- 7겹 품질 방어선을 설계하면 AI 코딩 생산성은 2배가 되고 버그는 그대로다.AI 코딩 에이전트로 코드 생산량이 늘어도 품질을 지키는 방법은 따로 있다. 요구사항 검토부터 프로덕션 모니터링까지 7단계 방어선을 겹겹이 쌓으면 버그를 늘리지 않고 생산성을 2배로 올릴 수 있다는 실무 경험이 공유됐다.