프런티어 모델 출시에는 보통 가격 인상이 따라붙는다. SpaceXAI가 9월 21일 정식 출시한 Grok 4.7은 그러지 않았다. 입력은 100만 토큰당 2달러, 출력은 6달러로 한 달 전 Grok 4.6과 똑같다. 나머지 성적표를 흥미롭게 만드는 것도 바로 이 결정이다.
핵심 요약 (Key takeaways)
- Grok 4.7은 100만 토큰당 입력 2달러·출력 6달러 가격을 그대로 유지한다. Claude Fable 5.1 입력가의 5분의 1, 출력가의 8분의 1 수준이다.
- Terminal-Bench 4.0 점수는 한 세대 만에 20.3%에서 38.0%로 올랐다. 이번 공개에서 가장 큰 상승 폭이다.
- 모든 수치는 SpaceXAI가 직접 측정한 것이고, 대표 벤치마크는 SpaceX가 지난달 인수를 마무리한 Cursor가 관리한다.
가격 동결이 승리 기록보다 중요한 이유
에이전트 연산을 구매하는 쪽이 사는 것은 벤치마크 점수가 아니라, 장시간 작업이 예측 불가능하게 태우는 토큰이다. 2달러와 6달러인 Grok 4.7은 GPT-5.6 Sol의 4달러·20달러보다 싸고, Fable 5.1의 10달러·50달러와는 격차가 훨씬 크다. 이미 Grok 4.6 기준으로 예산을 잡아둔 팀은 추가 비용 없이 업그레이드를 그대로 가져간다. 성능이 뛰면 요금제도 함께 올라가는 시장에서 보기 드문 일이다.
이 구도는 패배한 항목을 읽는 방식도 바꾼다. Grok 4.7이 뒤처진 지점에서 질문은 '이 모델이 뒤처졌는가'가 아니라 '그 격차가 토큰 비용 5~8배를 낼 만한 가치인가'가 된다.
벤치마크 7종, 한자리에
SpaceXAI는 Grok 4.7을 xHigh 설정으로, Grok 4.6은 High, GPT-5.6 Sol과 Fable 5.1은 Max 설정으로 돌려 비교했다.
| 벤치마크 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
*High 설정 점수.
그대로 세면 Sol에 5승, Fable 5.1에 3승이고, Grok 4.6 대비로는 모든 항목이 올랐다. 전기공학과 법률 항목의 격차는 경쟁 모델이 아예 학습하지 않은 영역이 있다고 볼 만큼 일방적이다. Terminal-Bench는 정반대다. Fable 5.1의 57.9%가 20%포인트 가까이 앞서 있고, 몇 시간짜리 터미널 작업은 여전히 돈을 더 내면 그만큼 얻는 게 있는 가장 분명한 영역으로 남았다.
SpaceXAI가 바꾼 것
회사는 성능 향상의 원인으로 더 큰 베이스 모델과, 분 단위가 아니라 시간 단위로 측정되는 과제 쪽으로 치우친 강화학습 확장 실행을 꼽는다. 발표에 따르면 그 결과로 자기 검증 능력과 장문 컨텍스트 처리가 개선됐다. 모델은 Grok Bot 하네스를 네이티브로 다루도록 추가 학습도 받았다. 개방형 과제에서 에이전트의 행동을 가르는 것은 순수 추론력이 아니라 하네스 숙련도인 경우가 많다는 점에서 눈여겨볼 대목이다.
안전 장치도 함께 다시 만들었다. SpaceXAI는 LatchBio의 생물안전 벤치마크에서 62.4%를, 자체 HackerBench v0.3에서 위험한 이중용도 프롬프트 통과율 3.3%를 기록했다고 밝혔다. 초청받은 보안 파트너에게는 모델의 레드팀 기능 접근 권한을 열어주기 시작했다.
기억해둘 두 가지 단서
첫째는 출처다. 발표의 앞자리를 차지한 CursorBench 4.0을 관리하는 Cursor는 지난달 인수로 이제 SpaceX 자회사가 됐다. 자사 소유 벤치마크가 대표 지표로 올라온 이상, 이 수치가 퍼지기 전에 독립 검증이 필요하다. 둘째는 비교 대상 선정이다. 이달 초 Sol보다 높은 가격에 나온 OpenAI의 GPT-6 Astra는 보조 차트에만 등장한다. 그 차트에서 Grok 4.7의 Elo 1,695는 Astra의 1,542를 앞서지만 Anthropic의 1,735에는 못 미친다.
Grok 4.7은 Cursor와 Grok Build에서 쓸 수 있고 Grok API, 서드파티 하네스, 라우터, 클라우드 플랫폼을 통해서도 접근할 수 있다. Grok 4.6 출시 때와 마찬가지로, 진짜 시험대는 출시 당일의 표가 아니라 앞으로 몇 주간 중립 평가기관이 내놓을 측정값이다.
FAQ · 자주 묻는 질문
Grok 4.7의 가격은 얼마인가
입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 Grok 4.6과 같다. 출력 속도를 두 배로 높인 고속 버전은 가격도 두 배다.
Grok 4.7은 Claude Fable 5.1보다 나은가
과제에 따라 다르다. Grok 4.7은 DeepSWE v1.1, EEBench, Harvey 법률 벤치마크에서 앞선다. Fable 5.1은 CursorBench 4.0, AA Briefcase, Terminal-Bench 4.0, HealthBench Professional에서 앞서지만 입력 토큰 단가가 5배 비싸다.
Grok 4.7의 벤치마크 결과는 독립 검증을 거쳤나
아니다. 공개된 점수는 모두 SpaceXAI가 자체 평가로 얻은 것이고, CursorBench는 지난달 SpaceX가 인수한 Cursor가 관리한다. 제3자 측정 결과는 아직 나오지 않았다.






