텍스트를 쓰지 않는 모델, 하루 만에 Vercel 유료 팀 13%에 닿았다

Jev의 첫날 채택률은 AI Gateway 기록상 가장 빠르다 — 다만 이 수치는 실사용량이 아니라 시험 사용의 폭을 잰다

|5분 읽기0
Racks in a server room — Jev's adoption curve is visible only in hosted gateway traffic, which is where agent builders now pick their control-path models.
Racks in a server room — Jev's adoption curve is visible only in hosted gateway traffic, which is where agent builders now pick their control-path models.

TypeSafe AI의 확률적 의사결정 모델 Jev가 출시 24시간 만에 Vercel AI Gateway 유료 팀의 13% 가까이에 도달했다. 이 플랫폼에 올라온 어떤 모델의 첫날 도달률보다도 두 배 이상 높다고 Vercel이 공개한 출시 데이터가 밝혔다. 게이트웨이가 기록한 가장 빠른 채택이다. 그런데 이 모델은 텍스트를 만들지 않는다.

핵심 요약

  • Jev는 24시간 만에 AI Gateway 유료 팀의 약 13%에 도달했다. GPT-5.6 계열 첫날 도달률의 두 배, Fable 5.1의 여섯 배가 넘는다.
  • 산문 대신 선택지·점수·참거짓 값을 확률과 함께 돌려주며, 하나의 컨텍스트에서 여러 질문을 병렬로 평가한다.
  • TypeSafe는 Jev가 언어 모델보다 최대 194배 빠르고 445배 저렴하다고 밝혔다. 자체 워크플로 평가 결과이며 독립 벤치마크는 아니다.

Jev가 실제로 돌려주는 것

9월 15일 공개된 Jev는 대화가 아니라 소프트웨어 안에서 내려지는 구조화된 판단을 겨냥해 만들어졌다. 애플리케이션이 컨텍스트와 질문 묶음을 보내면, Jev는 질문들을 병렬로 평가해 선택지나 숫자 점수, 불리언 값을 확률과 함께 돌려준다.

이 출력 형태가 제품의 전부다. 범용 모델에 같은 판단을 맡기면 텍스트가 돌아오고, 코드는 그것을 파싱하고 검증해야 한다. 구조화 출력 대신 산문이 오면 다시 호출해야 하는 일도 생긴다. Jev는 그 왕복을 건너뛴다.

Vercel이 제시한 용도는 네 가지인데, 모두 에이전트의 출력 경로가 아니라 제어 경로에 있다. 에이전트가 다음에 쓸 도구나 서브에이전트를 고르는 판단, 워크플로를 계속할지 재시도할지 사용자에게 물을지 멈출지 결정하는 판단, 행동에 나서기 전 긴급도나 위험도를 매기는 판단, 모델 출력을 검증하고 가드레일을 강제하거나 애매한 건을 사람 검토로 넘기는 판단이다.

13%가 재는 것과 재지 않는 것

Jev는 12시간 안에 비교 대상 모델을 모두 앞질렀고, 남은 하루 동안 격차를 더 벌렸다. 24시간 시점에 유료 팀의 13% 가까이를 차지했다. GPT-5.6 계열의 약 두 배, Fable 5.1의 여섯 배가 넘는 수치다.

이 숫자는 모델로 요청을 한 번이라도 흘려보낸 팀을 센다. 시험 사용의 폭이지 실사용량도 지출도 아니다. 프런티어 세대 호출보다 훨씬 싼 모델은 가볍게 써볼 수 있고, 첫날 지표가 잡아내는 것이 정확히 그 가벼운 시도다. 모집단도 감안해야 한다. Vercel 게이트웨이의 유료 팀은 이미 에이전트 기능을 출시하고 있는 개발사 쪽으로 기운 집단이지 시장 전체가 아니다.

Vercel도 같은 단서를 달았다. 최근 출시 중 첫날 채택률은 비교 대상이 없지만, 다음 시험은 그 수치가 유지되느냐라는 것이다. 대조군은 9월 프로덕션 인덱스다. 여기서 Astra는 출시 12일 만에 게이트웨이 전체 지출의 7.7%를 가져갔다. 지출은 지속적인 사용을 따라오기 때문에 훨씬 세우기 어려운 숫자다.

통증 지점은 텍스트가 아니라 판단이다

모든 에이전트 프레임워크에 같은 구멍이 있다. 루프 어딘가에서 코드는 계속할지, 재시도할지, 사람에게 넘길지, 멈출지를 정해야 한다. 지금은 그 판단을 대개 프런티어 모델에 JSON으로 답하라고 시켜 처리한다. 답은 enum 값 하나인데 과금과 지연은 생성 호출과 똑같이 매���진다. 이 호출 하나를 위해 모델 종류를 새로 만든 것은, 루프의 제어 평면과 추론 평면이 같은 가격표를 쓸 이유가 없다는 주장이다.

TypeSafe가 제시한 최대 194배·445배라는 배수는 자체 워크플로 평가에서 나왔다. 측정값이라기보다 방향으로 읽는 편이 맞다. 다만 그 방향은 게이트웨이 경제가 움직이는 쪽과 어긋나지 않는다. 8월 이 플랫폼의 토큰당 가격은 23.2% 떨어져 3개월 연속 하락했고, 오픈 웨이트 모델이 게이트웨이 토큰 대부분을 처리하면서 지출은 14%만 차지하고 있다. 처리 용량이 싸질수록 작업을 쪼개는 쪽이 합리적이 된다. 값을 하는 자리에만 비싼 추론을 두고, 나머지는 좁은 모델에 맡기는 식이다.

다음에 볼 지점

진짜 시험은 잔존율이고, 출시 블로그가 아니라 10월 인덱스에 드러난다. 첫날 도달률과 4주차 도달률은 흔히 갈라진다. 한 번 찔러보는 비용이 거의 없는 모델이라면 더욱 그렇다.

검증 용도는 따로 볼 만하다. 검사 대상 모델과 다른 아키텍처로 만든 검사기는 실패하는 방식도 다르다. 거대 언어 모델에 같은 계열의 답을 채점시키는 흔한 방식으로는 할 수 없는 말이다. 이달 초 4,000만 달러를 들고 스텔스에서 나온 TypeSafe는 제어 평면이 기능이 아니라 하나의 범주라는 데 걸고 있다.

FAQ — 자주 묻는 질문

Jev는 거대 언어 모델인가?

아니다. 컨텍스트와 질문 묶음을 받아 선택지·점수·불리언 같은 타입이 정해진 값을 확률과 함께 돌려주는 확률적 의사결정 모델이다. 산문을 생성하지 않으며, 답은 코드가 곧바로 소비하도록 설계됐다.

유료 팀 13%는 무슨 뜻인가?

Vercel AI Gateway의 유료 팀 여덟 곳 중 한 곳 꼴로 출시 24시간 안에 Jev로 요청을 한 번 이상 보냈다는 뜻이다. 한 플랫폼에서의 시험 사용 폭을 잰 값이지 토큰 사용량이나 매출, 실서비스 도입을 잰 값이 아니다.

194배·445배는 검증된 수치인가?

공개적으로 검증되지 않았다. Vercel 출시 글에 실린 TypeSafe AI의 자체 워크플로 평가 결과다. 의사결정 작업에서 Jev를 범용 모델과 비교한 제3자 벤치마크는 아직 공개되지 않았다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다
Developer Tools

LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다

arXiv 연구에서 LLM 수리 루프의 정상 코드 손상률은 0.261, 버그 코드 수리율은 0.023으로 나왔다. 연구진은 이를 몰고 가는 내부 방향까지 찾아냈다.

Seung Jung6일 전
AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다
Developer Tools

AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다

포렌식 보고서가 5월 GemStuffer 캠페인을 재구성했다. AI 에이전트가 gem 2,000개 이상을 올려 RubyGems가 나흘간 신규 가입을 동결하게 만든 사건이다.

Seung Jung8일 전
Vercel, 1년 전 고쳐진 버그 때문에 플랫폼 전역에서 AVIF를 껐다
Developer Tools

Vercel, 1년 전 고쳐진 버그 때문에 플랫폼 전역에서 AVIF를 껐다

Vercel은 신고된 Next.js RCE의 원인을 libheif에서 찾아 8월 13일 플랫폼 전역에서 AVIF를 껐고, 8월 25일까지 sharp·libvips·libheif 수정을 조율했다.

Seung Jung12시간 전
GitHub 하이드라퓨전, 모델을 고르지 않는다. 워크플로를 짠다
Developer Tools

GitHub 하이드라퓨전, 모델을 고르지 않는다. 워크플로를 짠다

GitHub의 프로젝트 하이드라퓨전은 Copilot 코딩 요청마다 다중 모델 실행 계획을 짠다. 단일 모델의 단순함을 내주고 비용을 크게 낮췄다.

Seung Jung6일 전
OpenAI, 말하면서 듣는 음성 모델을 분당 5센트에 개발자에게 개방
Developer Tools

OpenAI, 말하면서 듣는 음성 모델을 분당 5센트에 개발자에게 개방

OpenAI의 풀듀플렉스 음성 모델 GPT-Live-1이 분당 0.05달러로 API에 공개됐다. Tau3 벤치마크에서 86.2%를 기록해 이전 모델 45.7%를 크게 앞섰다.

Seung Jung8일 전
메타, WhatsApp Business 설정을 Claude·Codex에 맡긴다
Developer Tools

메타, WhatsApp Business 설정을 Claude·Codex에 맡긴다

메타가 WhatsApp Business 계정 설정을 AI 코딩 에이전트에 개방했다. 새로 공개한 WhatsApp Business Tools MCP 서버로 Claude Code와 Codex가 전화번호 등록부터 템플릿·웹훅 설정까지 처리한다.

Seung Jung3일 전