TypeSafeが4000万ドルでステルス解除、テキストを書かないモデルを投入

Jevは文字列を生成せず、較正済み確率つきの型付き判断を返す — 出力トークンの料金はゼロ

|4分で読める0
A developer at work - the integration seam TypeSafe's Jev targets, where model output meets the code that has to consume it
A developer at work - the integration seam TypeSafe's Jev targets, where model output meets the code that has to consume it

言語モデルの上に構築された本番システムには、例外なく同じ継ぎ目がある。モデルが文字列を返し、その後段にある何かがそれを解析して検証し、解析に失敗したときの対処まで決めなければならない。9月15日に公開されたTypeSafe AIの答えは、文字列そのものをなくすことだ。同社の最初のモデルJevは、事前に宣言したスキーマから選ばれた型付きの値を返し、それぞれに較正済みの確率が付く。

要点

  • TypeSafeはDCVCが主導する約4000万ドルのシード資金を得てステルスを解除した。元OpenAIの研究者Diogo AlmeidaがErik Gafni、Sasha Shengとともに創業した。
  • Jevの入力料金は100万トークンあたり0.042ドルで、出力トークンは無料。同社が示すエンドツーエンドの遅延は70〜500ミリ秒だ。
  • クエリ実行前に出力スキーマが固定されるため、型エラーは稀なのではなく構造上起こり得ないと同社は説明する。

System Oneモデルとは何か

TypeSafeはこのカテゴリをSystem Oneと呼ぶ。人が読む文章ではなく、ソフトウェアが直接消費する高速な判断を出すために作られたモデルだ。そこへ至るために三つを変えた。異なるアーキテクチャ、並列サンプラー、そして同社が「較正済み判断のための強化学習(RLCD)」と名づけた学習手法である。

要点はRLHFとの対比にある。人間のフィードバックによる学習が評価者の好む応答を最適化し、検証可能な報酬による学習が検査器で確認できる出力を最適化するのに対し、RLCDは判断に付く確率が正直になるよう最適化する。AlmeidaはChatGPTの土台となったInstructGPTの共著者であり、この決別は意図的だ。

サンプリングの違いは目的関数と同じくらい重要だ。従来のモデルはトークンを1つずつ生成し、各トークンが直前のトークンに条件づけられる。Jevは構造化出力のすべてのフィールドを一度の並列パスで出力する。遅延とコストに関する主張はここから来ている。

数字と、その根拠

同社サイトに掲げられた193.6倍の速さ、444.6倍の安さという数字は、公開のリーダーボードではなく自前で設計した評価によるものだ。TypeSafeはワークフローをコードで固定し、すべてのモデルを同一の計算グラフに通したうえで、GPT-6 AstraとFable 5.1の平均から取った参照確率と照らして採点する。

もっとも、同社は留保も併せて公開している。4つのワークフローは自社のモデル能力チームが作成したものだ。フロンティアの競合を参照値に使えば結果はその競合側に偏るが、同社はそれによって自社の優位はむしろ小さく見積もられていると主張する。そして型エラー率ゼロは測定値ではなく、スキーマ一致によって保証された値だ。投稿自身が認めるとおり、反例が1つ出れば崩れる主張である。

どこに収まる想定か

売り込み先はチャットボットの置き換えではない。TypeSafeはJevを、普通のソフトウェアに散らばる曖昧な判断——分類、振り分け、スコアリング、抽出、分岐——に位置づける。手書きのロジックが壊れやすくなり、かといって大規模言語モデルの完全な呼び出しをホットパスに置くには遅すぎるか高すぎる、そんな場所だ。

ほかに挙げられている用途は、大規模データセットに対するmap-reduce処理、100ミリ秒の予算ではフロンティアモデルの呼び出しが成立しないリアルタイムのインターフェース、そして他モデルの出力を審査するジャッジやガードレールとしての利用だ。社内デモのひとつは毎秒10クエリを1時間あたり約7ドルで処理している。

この主張が今響く理由

モデルは予測不能すぎてその上に構築できない、という指摘は鋭さを増している。代替品を売る側だけの言い分ではない。安定したAPIのモデル名の裏で予告なく重みが差し替えられた件は、反対側から同じ点を突いた。自由なテキストを生成できないがゆえにハルシネーションも生成できないモデルは、その不満に対する無骨な回答だ。

ただし代償は本物である。説明文、コード、記述式の回答など、言語の生成を要する作業はそもそもJevの守備範囲外だ。TypeSafe自身、公開した評価を西海岸の自社ノートパソコンで実行したと認めている。Jevは現在ウェイトリスト制のアーリーアクセスにある。本当に見るべき数字は、GPU代を他人が払うようになってもこの価格が保つかどうかだ。

よくある質問

Jevはテキストの代わりに何を返しますか?

クエリの実行前に開発者が定義したスキーマから選ばれた型付きの値で、それぞれに較正済みの確率と信頼度スコアが付く。出力の候補が事前に固定されているため応答に解析や検証の工程は不要で、スキーマが許さないフィールドをモデルが返すこともない。

Jevの料金はいくらですか?

入力トークンは100万あたり0.042ドル、出力トークンは無料で、TypeSafeは課金するには安すぎると説明している。同社は価格が上がるより下がると見ているが、この料金が補助なしで成り立つことはまだ証明できないとも認めている。

Jevは一般提供されていますか?

いいえ。選ばれた開発者向けのアーリーアクセス段階で、typesafe.aiでウェイトリストを受け付けている。TypeSafeは速度とコストの主張の方法論を検証したい人向けに、完全なクエリや不一致例を含む4件のワークフロー評価を公開している。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

Siriの新しい常時リスニングはどうプライバシーを守るのか、Appleが説明
AI & Machine Learning

Siriの新しい常時リスニングはどうプライバシーを守るのか、Appleが説明

Appleが公開したプライバシー文書は、Siri Audio Intelligenceが周囲の音を聞きながら、生の音声をS11チップのSecure Exclave内にとどめる仕組みを説明しています。

Seung Jung7 日前
絶滅リスクを訴えAnthropicを退職した研究者、安全責任者も公に同調
AI & Machine Learning

絶滅リスクを訴えAnthropicを退職した研究者、安全責任者も公に同調

Jacob Coxon氏が絶滅リスクを理由にAnthropicを退職しました。同社のアラインメント・ストレステスト責任者は公に同意し、その確率を10%超と述べています。

Seung Jung7 日前
200GBの問い:モデルの重みのうち、本当にGPUに置くべきものはどれか
AI & Machine Learning

200GBの問い:モデルの重みのうち、本当にGPUに置くべきものはどれか

DeepSeek V4.1 Flashが763GBではなく567GBのGPUメモリで済むのは、1960億の重みがシステムRAM上で動くよう設計されているからだ。

Seung Jung6 日前
Anthropic、2億回規模の蒸留リポートでアリババ・Moonshot・DeepSeekを名指し
AI & Machine Learning

Anthropic、2億回規模の蒸留リポートでアリババ・Moonshot・DeepSeekを名指し

Anthropicは、5つの作戦が推論能力を模倣するため約2億回のClaudeとのやり取りを費やし、MoonshotとDeepSeekは実際の顧客リクエストまで中継していたと指摘しました。

Seung Jung6 日前
Anthropic、外部評価者を社内に常駐へ アモデイ氏が「フロンティアの減速」を訴え
AI & Machine Learning

Anthropic、外部評価者を社内に常駐へ アモデイ氏が「フロンティアの減速」を訴え

Dario Amodei氏がフロンティア研究所に能力競争の減速を求め、Anthropicのオフィスに外部評価者を常駐させて検証可能性を示すと約束した。

Seung Jung4 日前
攻撃者、検知されなくなるまでマルウェアを再ビルドするエージェントを稼働
AI & Machine Learning

攻撃者、検知されなくなるまでマルウェアを再ビルドするエージェントを稼働

ロシア系の集団が、検知されたインプラントをエージェントに反復修正させて検知を突破した。攻撃者が静的シグネチャの循環を閉じた、最も明確な公開事例だ。

Seung Jung5 日前