Ember-1, 토큰당 단가는 Kimi K3와 같고 토큰은 40% 덜 쓴다

Fireworks Research는 추론 강도 설정을 낮추는 대신 추론 흔적 자체를 짧게 쓰도록 학습시킨 것이 벤치마크 7종과 고객사 두 곳의 실서비스 코딩 트래픽에서 정확도를 지켜낸 비결이라고 밝혔다.

|5분 읽기0
Server racks in a computer room installation — Ember-1 targets the inference bill that long reasoning traces run up in multi-turn agentic workloads.
Server racks in a computer room installation — Ember-1 targets the inference bill that long reasoning traces run up in multi-turn agentic workloads.

Fireworks AI가 Moonshot AI의 Kimi K3를 기반으로 만든 추론 모델 Ember-1을 공개했다. 베이스 모델과 같은 품질에 도달하면서 토큰은 약 40% 덜 뱉는다는 설명이다. 9월 24일 Fireworks의 서버리스 플랫폼에서 리서치 프리뷰로 가동에 들어갔고, 공개 단가표는 K3와 똑같다. 캐시되지 않은 입력 100만 토큰당 3달러, 캐시된 입력 100만 토큰당 0.30달러, 출력 100만 토큰당 15달러다. 토큰당 값은 하나도 바뀌지 않았다. 청구액이 내려가는 이유는 청구서에 올라가는 토큰 수가 줄기 때문이다.

핵심 요약

  • Ember-1의 공개 단가는 입력 100만 토큰당 3달러, 출력 100만 토큰당 15달러로, 학습 기반이 된 Kimi K3 베이스 모델과 같다. 컨텍스트 창은 1,048,576토큰이다.
  • Fireworks는 공개 벤치마크 7종과 고객사 두 곳의 실서비스 트래픽에서 K3의 추론을 35~50% 줄이면서도 정확도를 잃지 않았다고 보고했다.
  • 고객사 두 곳의 코딩 워크로드를 대상으로 한 실시간 A/B 테스트에서 Ember-1은 비슷한 품질에 과제당 토큰을 약 35% 적게 썼고, 두 곳 중 한 곳은 이미 실서비스로 옮겼다.

추론 흔적이 비용의 주범이 된 이유

K3 같은 추론 모델은 생성 토큰의 대부분을, 때로는 90% 넘는 분량을 사용자가 읽는 답변이 아니라 내부 숙고에 쓴다.

에이전트 루프는 그 비용을 복리로 바꾼다. 매 턴마다 이전 대화 전체를 다시 집어넣기 때문에 첫 턴에 쓴 흔적은 그 뒤 모든 턴에서 또 값을 치른다. Fireworks가 설명한 대로 컨텍스트 창은 턴 수에 거의 제곱으로 불어난다.

뻔한 우회로는 버티지 못한다. K3의 추론 강도 설정을 낮추면 토큰은 줄었지만 정확도를 너무 많이 내놔야 했다는 것이 회사 발표의 설명이다. 그래서 Fireworks는 절약을 설정으로 넣는 대신 학습으로 심는 쪽을 택했다.

Fireworks는 어떻게 추론을 줄여 학습시켰나

여기까지 오는 데 자사 서버리스 학습 제품에서 50회 넘는 학습 실험과 200회 넘는 평가가 들었다. 정확도를 잃지 않고 사고 연쇄 출력을 압축하는 새 알고리즘도 함께 만들었다. Fireworks는 고객 데이터가 아니라 자사 데이터를 썼다고 밝혔다.

팀이 의도적으로 지켜낸 추론 유형이 하나 있다. 자기 점검이다. 전제를 다시 짚거나 결과를 앞선 판단까지 되짚는 과정은 모델이 자기 실수에서 빠져나오는 데 도움이 된다. 그래서 목표는 그 기능을 유지한 채 성과 없는 반복만 잘라내는 쪽이었다. 학습 구성은 수학과 코딩부터 검색, 도구 사용, 소프트웨어 엔지니어링까지 폭넓게 유지했다. 벤치마크 모양의 문제에서만 간결해지는 뻔한 실패를 막기 위한 안전장치다.

공개 벤치마크 7종과 고객사 두 곳의 실서비스 트래픽에서 Fireworks는 K3의 추론을 정확도 손실 없이 35~50% 줄일 수 있었다고 보고한다. 학습된 행동은 실패한 시도에서도 절제를 보여, 청구액을 가장 크게 불리는 장기 반복을 정확히 끊어낸다.

벤치마크와 A/B 테스트가 보여준 것

Fireworks는 며칠 앞서 공개한 자사 Specialized Intelligence Index로 Ember-1을 평가했다. 10개 전문 분야에 걸쳐 의사가 검증한 임상 사례 500건으로 구성된 Doximity의 Bedside Bench도 여기에 포함된다. 이 항목의 과제당 비용에서 Ember-1이 GPT-5.6 Sol과 GPT-6 Astra, Claude Opus 5를 포함해 오픈·클로즈드 모델을 통틀어 새로운 파레토 프런티어를 세웠다는 것이 회사 주장이다.

정작 중요한 비교는 추론 강도 세 단계로 돌린 K3 자신과의 대결이다. 표본 50개를 넘는 모든 벤치마크에서 Fireworks는 Ember-1을 비용·품질 프런티어 위나 그 근처에 놓는다. K3를 가장 싸게 돌리는 방법이 더는 "덜 생각하라고 지시하기"가 아니라는 뜻이다.

실서비스 근거는 범위가 좁지만 더 구체적이다. 고객사 두 곳의 코딩 워크로드를 대상으로 한 실시간 A/B 테스트에서 Ember-1은 비슷한 품질에 과제당 토큰을 약 35% 적게 썼고, 과제 완료율과 성공 점수, 실패율은 유지되거나 개선됐다. 두 곳 중 한 곳은 이후 실서비스로 전환하고 베이스 모델을 걷어낼 계획이다. 사내에서는 자사 개발자들이 모델이 바뀐 것을 알아차리지 못했다고 Fireworks는 전했다.

앞으로 볼 것

걸림돌은 기술보다 구조 쪽이다. Ember-1은 2주짜리 리서치 프리뷰로 나왔고, 커뮤니티 수요가 있을 때만 상시 제공으로 넘어간다. OpenRouter에서도 제공 업체는 한 곳뿐이다. 절감 효과가 분량에 기대는 구조라, 추론이 이미 출력의 작은 부분을 차지하는 워크로드에서는 이점이 줄어든다.

그사이 K3는 제3자가 재학습해 다시 파는 베이스가 됐다. Moonshot AI의 매출 궤적에서 이미 드러난 변화다. Fireworks는 기업이 Ember-1을 더 특화할 수 있도록 이 모델에 대한 학습도 개방한다.

FAQ — 자주 묻는 질문

Ember-1은 Kimi K3보다 토큰당 값이 싼가

아니다. Ember-1의 공개 단가는 캐시되지 않은 입력 100만 토큰당 3달러, 캐시된 입력 100만 토큰당 0.30달러, 출력 100만 토큰당 15달러로 K3와 같다. 비용이 내려가는 이유는 단가 인하가 아니라 같은 과제에 추론 토큰을 덜 생성하는 데 전부 있다.

Ember-1은 오픈소스인가

Fireworks는 Ember-1의 가중치를 공개하지 않았다. 자사 서버리스 플랫폼에서 베이스 모델인 Kimi K3와 함께, 그리고 OpenRouter를 통해 호스팅 방식으로 제공되며 초기에는 리서치 프리뷰다.

40%라는 수치는 어디까지 외부에서 검증됐나

토큰 절감 수치는 Fireworks 자체 벤치마크 실행과, 이름을 밝히지 않은 고객사 두 곳의 실서비스 트래픽 A/B 테스트에서 나왔다. 독립적으로 재현한 결과를 공개한 제3자는 없다. 35~50%라는 구간은 업체가 스스로 밝힌 수치로 읽어야 한다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & Chatbots

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung18일 전
ChatGPT는 쇼핑 답변 79%에서 콕 집어 추천한다, Gemini는 7%
LLM & Chatbots

ChatGPT는 쇼핑 답변 79%에서 콕 집어 추천한다, Gemini는 7%

AI 쇼핑 답변 1,536건 감사에서 ChatGPT는 79%가 1인칭 선호를 밝힌 반면 Gemini는 7%에 그쳤다. 인용 출처도 거의 겹치지 않았다.

Seung Jung11일 전
ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다
LLM & Chatbots

ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다

OpenAI가 ChatGPT Images 2.5를 내놨다. 지연 시간을 최대 50% 줄이고 Sketch 캔버스와 템플릿, 고정 댓글, API 모델 두 종을 함께 공개했다.

Seung Jung17일 전
OpenAI의 Astra for Law는 새 모델이 아니다, 2억 3000만 URL 법률 색인이다
LLM & Chatbots

OpenAI의 Astra for Law는 새 모델이 아니다, 2억 3000만 URL 법률 색인이다

OpenAI가 GPT-6 Astra에 2억 3000만 URL 규모 법률 색인을 결합한 Astra for Law를 공개했다. 리걸 리서치 벤치 정확도는 38.7%에서 54%로 올랐다.

Seung Jung10일 전
Gemini가 윈도우에 상륙했다, Alt+Space 한 번으로 뜨는 데스크톱 비서
LLM & Chatbots

Gemini가 윈도우에 상륙했다, Alt+Space 한 번으로 뜨는 데스크톱 비서

Google의 윈도우용 Gemini 네이티브 앱이 Alt+Space로 어떤 프로그램 위에든 뜬다. Gmail·Google Drive에 연결되며 Windows 10·11에서 전 세계 이용이 가능하다.

Seung Jung17일 전
메타 뮤즈, 당신의 메일함과 일정 그리고 신용카드를 노린다
LLM & Chatbots

메타 뮤즈, 당신의 메일함과 일정 그리고 신용카드를 노린다

메타가 개인 AI 에이전트 뮤즈를 공개했다. 미국에서 iOS·안드로이드·웹·왓츠앱을 통해 여행 예약과 요금 납부, 쇼핑을 대신 처리한다.

Seung Jung17일 전