Grok 4.7, 가격 그대로 터미널 점수는 두 배… 결국 청구서 싸움이다

SpaceXAI가 한 달 만에 내놓은 새 프런티어 모델이 $2/$6 요금을 유지하면서, 모든 벤치마크 격차가 '점수당 비용' 문제로 바뀌었다

|4분 읽기0
A GPU cluster in a data centre — the compute tier behind the extended reinforcement learning run SpaceXAI credits for Grok 4.7's gains
A GPU cluster in a data centre — the compute tier behind the extended reinforcement learning run SpaceXAI credits for Grok 4.7's gains

프런티어 모델 출시에는 보통 가격 인상이 따라붙는다. SpaceXAI가 9월 21일 정식 출시한 Grok 4.7은 그러지 않았다. 입력은 100만 토큰당 2달러, 출력은 6달러로 한 달 전 Grok 4.6과 똑같다. 나머지 성적표를 흥미롭게 만드는 것도 바로 이 결정이다.

핵심 요약 (Key takeaways)

  • Grok 4.7은 100만 토큰당 입력 2달러·출력 6달러 가격을 그대로 유지한다. Claude Fable 5.1 입력가의 5분의 1, 출력가의 8분의 1 수준이다.
  • Terminal-Bench 4.0 점수는 한 세대 만에 20.3%에서 38.0%로 올랐다. 이번 공개에서 가장 큰 상승 폭이다.
  • 모든 수치는 SpaceXAI가 직접 측정한 것이고, 대표 벤치마크는 SpaceX가 지난달 인수를 마무리한 Cursor가 관리한다.

가격 동결이 승리 기록보다 중요한 이유

에이전트 연산을 구매하는 쪽이 사는 것은 벤치마크 점수가 아니라, 장시간 작업이 예측 불가능하게 태우는 토큰이다. 2달러와 6달러인 Grok 4.7은 GPT-5.6 Sol의 4달러·20달러보다 싸고, Fable 5.1의 10달러·50달러와는 격차가 훨씬 크다. 이미 Grok 4.6 기준으로 예산을 잡아둔 팀은 추가 비용 없이 업그레이드를 그대로 가져간다. 성능이 뛰면 요금제도 함께 올라가는 시장에서 보기 드문 일이다.

이 구도는 패배한 항목을 읽는 방식도 바꾼다. Grok 4.7이 뒤처진 지점에서 질문은 '이 모델이 뒤처졌는가'가 아니라 '그 격차가 토큰 비용 5~8배를 낼 만한 가치인가'가 된다.

벤치마크 7종, 한자리에

SpaceXAI는 Grok 4.7을 xHigh 설정으로, Grok 4.6은 High, GPT-5.6 Sol과 Fable 5.1은 Max 설정으로 돌려 비교했다.

벤치마크Grok 4.7Grok 4.6GPT-5.6 SolFable 5.1
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

*High 설정 점수.

그대로 세면 Sol에 5승, Fable 5.1에 3승이고, Grok 4.6 대비로는 모든 항목이 올랐다. 전기공학과 법률 항목의 격차는 경쟁 모델이 아예 학습하지 않은 영역이 있다고 볼 만큼 일방적이다. Terminal-Bench는 정반대다. Fable 5.1의 57.9%가 20%포인트 가까이 앞서 있고, 몇 시간짜리 터미널 작업은 여전히 돈을 더 내면 그만큼 얻는 게 있는 가장 분명한 영역으로 남았다.

SpaceXAI가 바꾼 것

회사는 성능 향상의 원인으로 더 큰 베이스 모델과, 분 단위가 아니라 시간 단위로 측정되는 과제 쪽으로 치우친 강화학습 확장 실행을 꼽는다. 발표에 따르면 그 결과로 자기 검증 능력과 장문 컨텍스트 처리가 개선됐다. 모델은 Grok Bot 하네스를 네이티브로 다루도록 추가 학습도 받았다. 개방형 과제에서 에이전트의 행동을 가르는 것은 순수 추론력이 아니라 하네스 숙련도인 경우가 많다는 점에서 눈여겨볼 대목이다.

안전 장치도 함께 다시 만들었다. SpaceXAI는 LatchBio의 생물안전 벤치마크에서 62.4%를, 자체 HackerBench v0.3에서 위험한 이중용도 프롬프트 통과율 3.3%를 기록했다고 밝혔다. 초청받은 보안 파트너에게는 모델의 레드팀 기능 접근 권한을 열어주기 시작했다.

기억해둘 두 가지 단서

첫째는 출처다. 발표의 앞자리를 차지한 CursorBench 4.0을 관리하는 Cursor는 지난달 인수로 이제 SpaceX 자회사가 됐다. 자사 소유 벤치마크가 대표 지표로 올라온 이상, 이 수치가 퍼지기 전에 독립 검증이 필요하다. 둘째는 비교 대상 선정이다. 이달 초 Sol보다 높은 가격에 나온 OpenAI의 GPT-6 Astra는 보조 차트에만 등장한다. 그 차트에서 Grok 4.7의 Elo 1,695는 Astra의 1,542를 앞서지만 Anthropic의 1,735에는 못 미친다.

Grok 4.7은 Cursor와 Grok Build에서 쓸 수 있고 Grok API, 서드파티 하네스, 라우터, 클라우드 플랫폼을 통해서도 접근할 수 있다. Grok 4.6 출시 때와 마찬가지로, 진짜 시험대는 출시 당일의 표가 아니라 앞으로 몇 주간 중립 평가기관이 내놓을 측정값이다.

FAQ · 자주 묻는 질문

Grok 4.7의 가격은 얼마인가

입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 Grok 4.6과 같다. 출력 속도를 두 배로 높인 고속 버전은 가격도 두 배다.

Grok 4.7은 Claude Fable 5.1보다 나은가

과제에 따라 다르다. Grok 4.7은 DeepSWE v1.1, EEBench, Harvey 법률 벤치마크에서 앞선다. Fable 5.1은 CursorBench 4.0, AA Briefcase, Terminal-Bench 4.0, HealthBench Professional에서 앞서지만 입력 토큰 단가가 5배 비싸다.

Grok 4.7의 벤치마크 결과는 독립 검증을 거쳤나

아니다. 공개된 점수는 모두 SpaceXAI가 자체 평가로 얻은 것이고, CursorBench는 지난달 SpaceX가 인수한 Cursor가 관리한다. 제3자 측정 결과는 아직 나오지 않았다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & Chatbots

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung12일 전
Mercury 2.5, 초당 1,107토큰에 100만 토큰당 4센트로 나왔다
LLM & Chatbots

Mercury 2.5, 초당 1,107토큰에 100만 토큰당 4센트로 나왔다

전화 에이전트 스타트업은 Mercury가 최악의 응답 시간을 수 분에서 1초로 줄였다고 밝혔다. Inception Labs의 새 디퓨전 모델은 그런 숫자를 겨냥해 만들어졌다.

Seung Jung8일 전
이름은 그대로, 가중치만 바뀐다 — API 모델명은 무엇을 보장하나
LLM & Chatbots

이름은 그대로, 가중치만 바뀐다 — API 모델명은 무엇을 보장하나

고정해둔 엔드포인트 식별자가 다른 가중치를 내보내기 시작한다. 옵트아웃은 없다. 엔지니어들은 이것이 자신들이 의존해온 변경 관리 계약을 깨뜨린다고 말한다.

Seung Jung12일 전
ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다
LLM & Chatbots

ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다

OpenAI가 ChatGPT Images 2.5를 내놨다. 지연 시간을 최대 50% 줄이고 Sketch 캔버스와 템플릿, 고정 댓글, API 모델 두 종을 함께 공개했다.

Seung Jung11일 전
ChatGPT는 쇼핑 답변 79%에서 콕 집어 추천한다, Gemini는 7%
LLM & Chatbots

ChatGPT는 쇼핑 답변 79%에서 콕 집어 추천한다, Gemini는 7%

AI 쇼핑 답변 1,536건 감사에서 ChatGPT는 79%가 1인칭 선호를 밝힌 반면 Gemini는 7%에 그쳤다. 인용 출처도 거의 겹치지 않았다.

Seung Jung5일 전
Gemini가 윈도우에 상륙했다, Alt+Space 한 번으로 뜨는 데스크톱 비서
LLM & Chatbots

Gemini가 윈도우에 상륙했다, Alt+Space 한 번으로 뜨는 데스크톱 비서

Google의 윈도우용 Gemini 네이티브 앱이 Alt+Space로 어떤 프로그램 위에든 뜬다. Gmail·Google Drive에 연결되며 Windows 10·11에서 전 세계 이용이 가능하다.

Seung Jung11일 전