AI Newsway

一個不產出文字的模型,一天內觸及Vercel 13%的付費團隊

Jev的首日採用速度是AI Gateway有紀錄以來最快的,但這個數字衡量的是試用廣度,不是正式環境的用量

|5分鐘閱讀0
Racks in a server room — Jev's adoption curve is visible only in hosted gateway traffic, which is where agent builders now pick their control-path models.
Racks in a server room — Jev's adoption curve is visible only in hosted gateway traffic, which is where agent builders now pick their control-path models.

TypeSafe AI推出的機率式決策模型Jev,在上線24小時內觸及Vercel AI Gateway近13%的付費團隊,超過平台上任何一款模型首日觸及率的兩倍,這項數據來自Vercel自己公布的上線資料。這是該閘道有紀錄以來最快的採用速度,而這個模型並不產出文字。

重點摘要

  • Jev在24小時內觸及約13%的AI Gateway付費團隊,約為GPT-5.6系列首日觸及率的兩倍,也是Fable 5.1的六倍以上。
  • 它回傳的不是文章,而是帶有機率的選項、分數或真假值,並從單一脈絡平行評估多個問題。
  • TypeSafe表示Jev比語言模型最高快194倍、便宜445倍,但這是該公司自家的工作流程評估,並非獨立基準測試。

Jev實際回傳什麼

Jev於9月15日推出,設計目的是處理軟體內部的結構化判斷,而不是對話。應用程式送出一段脈絡與一組問題,Jev平行評估這些問題,回傳選項、數值分數或布林值,每一項都附帶機率。

這種輸出形式就是產品的全部。若改用通用模型做同樣的判斷,回來的是文字,程式還得解析、驗證,遇到回傳散文而非結構化輸出時還得重試。Jev省去了這趟來回。

Vercel列出四種用途,全都位於代理的控制路徑而非輸出路徑:決定代理下一步要用哪個工具或子代理、判斷工作流程該繼續或重試還是詢問使用者或停止、在採取行動前為急迫性與風險評分,以及驗證模型輸出、執行護欄規則、把不確定的案件轉給人工審核。

13%衡量了什麼,又沒有衡量什麼

Jev在12小時內超越所有比較對象,並在當天其餘時間拉開差距。到第24小時,它占了將近13%的付費團隊,約是GPT-5.6系列的兩倍、Fable 5.1的六倍以上。

這個數字計算的是至少送過一次請求給該模型的團隊,代表試用的廣度,而不是正式環境的用量或支出。價格遠低於前沿世代呼叫的模型試起來很便宜,而首日指標捕捉到的正是這種輕量嘗試。母體同樣值得留意:這些是Vercel閘道上的付費團隊,是已經在出貨代理功能的開發商為主的族群,而非整體市場。

Vercel自己也這麼說,指出在近期上線的模型中,Jev的首日採用無人能及,而下一道考題是這股熱度能否持續。作為對照,9月的Production Index顯示Astra在上線12天內拿下整個閘道7.7%的支出,這是更難交出的數字,因為支出跟著持續使用而來。

痛點在判斷,不在文字

每一套代理框架都有同一個缺口。在迴圈的某個位置,程式必須決定要繼續、重試、上報還是停止,而今天這個決定通常是叫一個前沿模型吐出JSON。答案只是一個列舉值,計費與延遲卻和生成呼叫一樣。圍繞這一個呼叫打造一整類模型,等於在主張迴圈的控制層與推理層不該共用同一張價目表。

TypeSafe提出的最高194倍與445倍來自自家的工作流程評估,應當視為方向而非量測。不過這個方向與閘道經濟的走勢一致。該平台8月的每token價格下跌23.2%,是連續第三個月下滑,而且開放權重模型如今承載閘道大多數token,支出占比卻只有14%。當運算容量變便宜,把工作拆開就變得合理:昂貴的推理只放在值得的位置,其餘交給更窄的模型。

接下來要觀察什麼

真正的考驗是留存率,而答案會出現在10月的指數裡,不是上線公告中。首日觸及率與第四週觸及率經常分道揚鑣,對一個幾乎不花錢就能試的模型更是如此。

驗證這項用途值得單獨留意。用不同架構打造的檢查器,失效的方式也和被檢查的模型不同,這是叫大型語言模型替同門答案打分的常見做法說不出口的一點。本月稍早帶著4,000萬美元走出隱身模式的TypeSafe,賭的是控制層是一個類別,而不是一項功能。

FAQ — 常見問題

Jev是大型語言模型嗎?

不是。它是機率式決策模型,接收一段脈絡與一組問題,回傳選項、分數或布林值等型別明確的值,並附上機率。它不產生散文,答案的設計是讓程式直接使用。

13%的付費團隊到底代表什麼?

代表Vercel AI Gateway上大約每八個付費團隊就有一個,在上線24小時內至少向Jev送過一次請求。它衡量的是單一平台上的試用廣度,不是token用量、營收或正式環境的部署。

194倍與445倍有經過獨立驗證嗎?

沒有公開驗證。這些數字出自TypeSafe AI自家的工作流程評估,經由Vercel的上線文章轉述。目前尚未有第三方在決策任務上把Jev與通用模型相比的基準測試公開。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

LLM修復程式碼時弄壞可用程式碼的次數,是真正修好次數的十倍
Developer Tools

LLM修復程式碼時弄壞可用程式碼的次數,是真正修好次數的十倍

一項arXiv研究測得LLM修復迴圈破壞正確程式的比率為0.261,修復缺陷程式的比率僅0.023,並找到了驅動這一行為的內部方向。

Seung Jung6 天前
AI智慧體向RubyGems傾瀉2000多個包,新使用者註冊被關閉四天
Developer Tools

AI智慧體向RubyGems傾瀉2000多個包,新使用者註冊被關閉四天

一份取證報告還原了5月的GemStuffer行動:AI智慧體推送兩千多個gem,迫使RubyGems凍結新使用者註冊四天。

Seung Jung8 天前
Vercel 因一年前就修好的錯誤,全平台關閉 AVIF
Developer Tools

Vercel 因一年前就修好的錯誤,全平台關閉 AVIF

Vercel 將回報的 Next.js RCE 追查到 libheif,於 8 月 13 日在全平台停用 AVIF,並在 8 月 25 日前協調完成 sharp、libvips 與 libheif 的修補。

Seung Jung12 小時前
GitHub的HydraFusion不再挑模型,而是搭一條工作流
Developer Tools

GitHub的HydraFusion不再挑模型,而是搭一條工作流

GitHub的Project HydraFusion為每個Copilot程式設計請求組裝多模型執行計劃,以單模型的簡潔為代價,換來大幅更低的成本。

Seung Jung6 天前
OpenAI向開發者開放全雙工語音模型,每分鐘5美分
Developer Tools

OpenAI向開發者開放全雙工語音模型,每分鐘5美分

OpenAI的全雙工語音模型GPT-Live-1已通過API開放,每分鐘0.05美元,在Tau3基準上取得86.2%,遠高於前代的45.7%。

Seung Jung8 天前
Meta 透過 MCP 把 WhatsApp Business 設定交給 Claude 與 Codex
Developer Tools

Meta 透過 MCP 把 WhatsApp Business 設定交給 Claude 與 Codex

Meta 將 WhatsApp Business 帳號設定開放給 AI 程式撰寫代理,新推出的 WhatsApp Business Tools MCP 伺服器讓 Claude Code 與 Codex 從註冊電話號碼一路處理到範本與 Webhook 設定。

Seung Jung3 天前