每一套建立在語言模型上的正式系統,都有同一道接縫:模型丟回一串字串,下游必須有東西去解析它、驗證它,並決定解析失敗時該怎麼辦。TypeSafe AI 在 9 月 15 日給出的答案,是把字串直接拿掉。該公司的第一款模型 Jev 回傳的是從事先宣告的結構描述中選出的型別化數值,每一個都附帶校準過的機率。
重點摘要
- TypeSafe 帶著由 DCVC 領投、約 4000 萬美元的種子輪資金結束隱身期,創辦人為前 OpenAI 研究員 Diogo Almeida,以及 Erik Gafni 與 Sasha Sheng。
- Jev 的輸入定價為每百萬權杖 0.042 美元,輸出不收費;公司表示端對端延遲介於 70 至 500 毫秒。
- 由於輸出結構在查詢執行前就已固定,公司主張型別錯誤不只是罕見,而是結構上不可能發生。
什麼是 System One 模型
TypeSafe 把這個類別稱為 System One:這類模型的設計目標是產出軟體可直接消費的快速判斷,而不是給人閱讀的文章。為此他們改了三件事——不同的架構、一套平行取樣器,以及實驗室稱為「校準判斷強化學習(RLCD)」的訓練方法。
重點在於它與 RLHF 的對照。人類回饋訓練最佳化的是評分者偏好的回應,可驗證獎勵訓練最佳化的是檢查器能確認的輸出,而 RLCD 最佳化的則是附在判斷上的機率是否誠實。Almeida 是支撐 ChatGPT 的 InstructGPT 論文共同作者,這樣的分道揚鑣顯然出於刻意。
取樣方式的差異和目標函式一樣重要。傳統模型一次生成一個權杖,每個權杖都以前一個為條件;Jev 則在單一次平行運算中一口氣輸出結構化輸出的所有欄位,關於延遲與成本的說法就是從這裡來的。
那些數字,以及它們的基礎
公司網站上打出的快 193.6 倍、便宜 444.6 倍,來自自行打造的評測,而非公開排行榜。TypeSafe 以程式碼固定工作流程,讓每個模型走過完全相同的運算圖,再對照取自 GPT-6 Astra 與 Fable 5.1 平均值的參考機率來評分。
值得肯定的是,這家實驗室把但書一併公開了。四組工作流程由自家的模型能力團隊撰寫;拿前沿競品當參考基準會讓結果偏向那些競品,公司則主張這反而低估了自己的領先幅度。至於零型別錯誤率並非實測而得,而是靠結構描述比對所保證——如同該文自己所寫,只要出現一個反例,這項主張就會瓦解。
它該放在哪裡
這項產品不是要取代聊天機器人。TypeSafe 把 Jev 定位在一般軟體裡到處散落的模糊判斷:分類、路由、評分、抽取、分支,也就是手寫邏輯容易變脆、而完整呼叫一次大型語言模型又太慢或太貴、塞不進熱路徑的那些位置。
公司建議的其他用途包括對大型資料集做 map-reduce、在 100 毫秒預算下無法呼叫前沿模型的即時介面,以及作為評審或護欄去審查其他模型的輸出。其中一個內部示範以每秒 10 次查詢運作,每小時成本約 7 美元。
這套說法為何在此刻奏效
「模型太不可預測、難以在其上建構系統」的論點越來越尖銳,而且不只出自兜售替代方案的實驗室。穩定的 API 模型名稱背後未經公告就更換權重的情況,從另一個方向指出同一件事。一個因為無法產生自由文字、所以也無法產生幻覺的模型,是對這種抱怨相當粗暴但直接的回應。
代價同樣真實。任何需要生成語言的工作——解釋、程式碼、一段書面回答——都完全不在 Jev 的能力範圍內;TypeSafe 也承認,公開的評測是在西岸用自家筆電跑出來的。Jev 目前處於需候補名單的早期存取階段,真正值得觀察的數字是:當 GPU 費用改由別人買單之後,這樣的定價還撐不撐得住。
常見問題
Jev 回傳的不是文字,那是什麼?
是開發者在查詢執行前定義好的結構描述中所選出的型別化數值,每一個都附帶校準機率與信心分數。由於可能的輸出事先固定,回應不需要任何解析或驗證步驟,模型也無法回傳結構描述不允許的欄位。
Jev 怎麼收費?
輸入權杖每百萬個 0.042 美元,輸出權杖免費,TypeSafe 形容那便宜到不值得計費。該公司預期價格會下降而非上漲,但也承認目前還無法證明這個費率沒有補貼。
Jev 已經全面開放了嗎?
還沒有。目前是針對特定開發者的早期存取,可在 typesafe.ai 加入候補名單。TypeSafe 已公開四組工作流程評測,包含完整查詢與分歧案例,供想檢視其速度與成本主張方法論的人查閱。






