Cloudflare初の自社モデルClef、意思決定ベンチマーク10件中7件で首位——重みも公開

ClefとClef-flashはテキストではなく校正済みの確率を返し、Workers AIのエッジGPU上で動く。強化学習によるチューニングサービスも同時に始まった。

|5分で読める0
Cloudflare's San Francisco office, where the Workers AI team released Clef and Clef-flash, the company's first internally trained models, on October 1.
Cloudflare's San Francisco office, where the Workers AI team released Clef and Clef-flash, the company's first internally trained models, on October 1.

Cloudflareは10月1日、Workers AIチームが自社で学習させた初のモデル2本を公開した。どちらも文章を一文字も書かない。ClefとClef-flashは入力状態と型付き質問のスキーマを受け取り、許可された答えごとに校正済みの確率を返す。重みもApache 2.0ライセンスでHugging Faceに置かれた。

要点

  • 意思決定ベンチマーク10件のうち7件でClef系モデルが最高スコアを記録した。TypesafeのJevや他のオープン意思決定モデルを上回ったというのがCloudflare自身の測定結果である。
  • ベンチマーク43回の実行で、CloudflareはClefがJevの中央値速度の2.5倍、Clef-flashが13倍だと測定した。両モデルともエッジネットワーク全域のGPUから提供される。
  • Clefは凍結したQwen3.8-27B、Clef-flashはQwen3.5-9Bを事後学習して作られ、いずれもHugging FaceでApache 2.0公開された。

Clefに実際に何を送るのか

リクエストには状態——サポート問い合わせ、URL、ユーザー投稿——と、最大64件の質問が載る。質問は三つの型のいずれかだ。noulは「はい/いいえ」の質問で、「はい」の確率が返る。choiceは開発者が定義した選択肢から一つを選び、選ばれた答えと選択肢ごとの確率、信頼度の値を返す。scoreは順序付きの評価基準に状態を当てはめ、確率で重み付けしたスコアと各段階の確率を返す。

出力の形が固定されているため、パースするものもなく、推論トークンを待つ必要もない。エージェントがリクエスト経路にこのモデルを直接差し込み、「この操作を実行すべきか」を数十ミリ秒で確認してから、実際の処理はWorkers AI上の言語モデルに渡せばよい——それがCloudflareの売り込みである。

Jevとの違い

ClefはTypesafeのJevと同じSystem One APIに従う。既存の連携があれば、エンドポイントとモデル名を差し替えるだけで移行できるとCloudflareは述べている。機能差は二点でClefに有利だ。Clefはビジョンエンコーダを備え、状態と合わせて画像を最大4枚まで受け取れるが、Jevは現時点でテキスト専用である。コンテキストウィンドウもJevの32kに対し64kだ。

Cloudflareが示した最も鋭い数字は自社の脅威インテリジェンスチームから出た。Browser Runと組み合わせたClefは、ウェブサイトのドメインを取得・レンダリングし分類するのに2.2秒を要した。同じワークフローで自社最速の汎用モデルgpt-oss-120bは4.7秒かかり、しかも分類は二つしか返さなかった。Typesafe自身のワークフロー評価では、Clefが請求書処理・カスタマーサービス・セキュリティインシデントの三領域で勝ったとCloudflareは報告している。つまり残る一領域は依然Jevのものだ。ここに挙がる数値はすべてベンダー自身の実測であり、公開記事は第三者検証ではなくライブデモサイトを添えて数字を出している。

遅延差はどこから生まれるのか

Clefはトークンを一つずつ生成しない。凍結されたQwenバックボーンに対してプリフィルのみを一度走らせ、二段構えのアテンションルーティングで有効なスキーマ選択肢すべてを並列に採点する。中間テキストを出さず、内部表現から答えを導く。速度はモデルが小さいからではなく、この非自己回帰の意思決定ステップから来ている。

学習ではバックボーンを凍結したまま、ルーティングヘッドとrank-256のLoRAアダプタを同時に最適化した。有効な出力にはラベル平滑化クロスエントロピー、確率の校正にはBrier損失を用いている。Cloudflareは「Reinforcement Learning for Calibrated Decisions」と名付けた副目的関数も作った。隣接する順序選択肢に部分点を与え、分布のずれを抑える参照ペナルティを適用する仕組みだ。データセットは社内生成の合成データで、フィールド順やプロンプト、スキーマ構造を入れ替えて作られた。

その下にあるファインチューニング製品

今回の発表の残り半分は、Clefを顧客自身のワークロードに合わせて調整する強化学習サービスである。まずはCloudflareのフォワードデプロイド・エンジニアリングチームが伴走する形で始まり、後にセルフサーブのプラットフォームになる。すでに出荷済みの部品を縫い合わせた構成だ。AI Gatewayがリクエストトラフィックをデータセットとして取り込み、Workers AIがベースのClefに対してロールアウトを生成し、Containersが採点用サンドボックスとして働き、新設のTrainerが重みを更新する。成果物はWorkers AIの持ち込みモデル経路で再デプロイされるが、この経路はCloudflareがReplicateを買収して得たCogの成果の上に載っている。

Cloudflare自身が最初の顧客である。Trust and Safetyの投稿スコアリング、サポートのトリアージ、クローラーが良いボットか悪いボットかの判定を挙げ、15年分のラベル付きネットワークデータこそ、調整された分類器が汎用モデルに勝つための資産だと主張する。同社はこれらすべてを「エージェントのクラウド」という目標の下にまとめる。エージェントのためにウェブを作り直すという既存の賭けの延長線上だ。この分野自体はできてまだ一か月ほどしかない。Typesafeがステルスを解いたのは9月である。

FAQ よくある質問

Clefはオープンソースなのか

重みについてはそうだ。CloudflareはClefとClef-flashの両方をHugging FaceにApache 2.0ライセンスで公開しており、商用利用とローカル配備が認められている。ホスト版はWorkers AI上で@cf/cloudflare/clefと@cf/cloudflare/clef-flashとして動く。顧客がファインチューニングを選ばない限り、ホストされたリクエストを読む・保存する・学習に使うことはないと同社は述べている。リポジトリはHugging FaceのCloudflare/clefとCloudflare/clef-flashだ。

既存のJev連携をClefに切り替えられるか

可能だとCloudflareは言う。Clefが厳密に型付けされた出力を持つ同じSystem One APIを実装しているためだ。実務上はエンドポイントとモデル識別子を変えることになる。開発者はWorkers AIのバインディング、またはREST の/ai/run経路から利用でき、どちらの手前にもAI Gatewayを置ける。

Clefは何を土台にしているのか

両モデルともAlibabaのQwen系を事後学習したもので、学習中はバックボーンを凍結している。ClefはQwen3.8-27B、Clef-flashはQwen3.5-9Bだ。この領域でCloudflareが以前公開した実験は別の土台を使っていた。DiffusionGemmaを改変してlogprobを決定的な確率として露出させる方式で、vLLMプロジェクトにおけるMatt Mastracciの独立した成果の上に構築されたものである。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

Claude Opus 5.5で400を返すようになったOpus 5のリクエスト4パターン
Developer Tools

Claude Opus 5.5で400を返すようになったOpus 5のリクエスト4パターン

Claude Opus 5.5はOpus 5より20%安い一方、Opus 5が通していた4つのリクエストにHTTP 400を返す。5つ目の変更はエージェントの進捗表示を黙らせる。

Seung Jung4 日前
Docker、AIエージェント用サンドボックスをクラウドへ 秒単位課金で1時間0.07ドルから
Developer Tools

Docker、AIエージェント用サンドボックスをクラウドへ 秒単位課金で1時間0.07ドルから

Dockerがマイクロ VM によるエージェント分離をホスト型コンピュートに広げるCloud Sandboxesを発表した。1時間0.07ドルから秒単位で課金し、Kits仕様はCNCFに提出する。

Seung Jung7 日前
7 カ月でエージェントスキル 100 万件 — その半数近くはインストール 1 回きり
Developer Tools

7 カ月でエージェントスキル 100 万件 — その半数近くはインストール 1 回きり

Vercel の skills.sh が 7 カ月でエージェントスキル 100 万件を突破した。半数近くはインストール 1 回きりで、375 件が全インストールの 62% を占める。

Seung Jung6 日前
AWSがエージェント基盤「Strands Harness」をOSS公開、自社より安い競合もグラフに残した
Developer Tools

AWSがエージェント基盤「Strands Harness」をOSS公開、自社より安い競合もグラフに残した

AWSのStrands Agentsチームが9月21日、Strands HarnessをApache 2.0で公開した。PythonとTypeScriptに対応し、ノートPCでも5つのクラウドでも動かせる。

Seung Jung10 日前
ZedのDelta、プルリクエストをエージェント・スレッドで置き換える
Developer Tools

ZedのDelta、プルリクエストをエージェント・スレッドで置き換える

ZedのDeltaは、プルリクエストを、エージェントとレビュアーが同じ文脈で作業する共有スレッドに置き換える。自社リポジトリではすでにPRがオフになっている。

Seung Jung11 日前
14.5週間でRust 83万2,378行、エージェント主導の書き換えの内側
Developer Tools

14.5週間でRust 83万2,378行、エージェント主導の書き換えの内側

GitHubがコーディングエージェントを使い、43万行のTypeScriptを14.5週間で83万2,378行のRustへ移植。メモリ使用量は1,383MBから126MBに減少した。

Seung Jung13 日前