Cloudflareは10月1日、Workers AIチームが自社で学習させた初のモデル2本を公開した。どちらも文章を一文字も書かない。ClefとClef-flashは入力状態と型付き質問のスキーマを受け取り、許可された答えごとに校正済みの確率を返す。重みもApache 2.0ライセンスでHugging Faceに置かれた。
要点
- 意思決定ベンチマーク10件のうち7件でClef系モデルが最高スコアを記録した。TypesafeのJevや他のオープン意思決定モデルを上回ったというのがCloudflare自身の測定結果である。
- ベンチマーク43回の実行で、CloudflareはClefがJevの中央値速度の2.5倍、Clef-flashが13倍だと測定した。両モデルともエッジネットワーク全域のGPUから提供される。
- Clefは凍結したQwen3.8-27B、Clef-flashはQwen3.5-9Bを事後学習して作られ、いずれもHugging FaceでApache 2.0公開された。
Clefに実際に何を送るのか
リクエストには状態——サポート問い合わせ、URL、ユーザー投稿——と、最大64件の質問が載る。質問は三つの型のいずれかだ。noulは「はい/いいえ」の質問で、「はい」の確率が返る。choiceは開発者が定義した選択肢から一つを選び、選ばれた答えと選択肢ごとの確率、信頼度の値を返す。scoreは順序付きの評価基準に状態を当てはめ、確率で重み付けしたスコアと各段階の確率を返す。
出力の形が固定されているため、パースするものもなく、推論トークンを待つ必要もない。エージェントがリクエスト経路にこのモデルを直接差し込み、「この操作を実行すべきか」を数十ミリ秒で確認してから、実際の処理はWorkers AI上の言語モデルに渡せばよい——それがCloudflareの売り込みである。
Jevとの違い
ClefはTypesafeのJevと同じSystem One APIに従う。既存の連携があれば、エンドポイントとモデル名を差し替えるだけで移行できるとCloudflareは述べている。機能差は二点でClefに有利だ。Clefはビジョンエンコーダを備え、状態と合わせて画像を最大4枚まで受け取れるが、Jevは現時点でテキスト専用である。コンテキストウィンドウもJevの32kに対し64kだ。
Cloudflareが示した最も鋭い数字は自社の脅威インテリジェンスチームから出た。Browser Runと組み合わせたClefは、ウェブサイトのドメインを取得・レンダリングし分類するのに2.2秒を要した。同じワークフローで自社最速の汎用モデルgpt-oss-120bは4.7秒かかり、しかも分類は二つしか返さなかった。Typesafe自身のワークフロー評価では、Clefが請求書処理・カスタマーサービス・セキュリティインシデントの三領域で勝ったとCloudflareは報告している。つまり残る一領域は依然Jevのものだ。ここに挙がる数値はすべてベンダー自身の実測であり、公開記事は第三者検証ではなくライブデモサイトを添えて数字を出している。
遅延差はどこから生まれるのか
Clefはトークンを一つずつ生成しない。凍結されたQwenバックボーンに対してプリフィルのみを一度走らせ、二段構えのアテンションルーティングで有効なスキーマ選択肢すべてを並列に採点する。中間テキストを出さず、内部表現から答えを導く。速度はモデルが小さいからではなく、この非自己回帰の意思決定ステップから来ている。
学習ではバックボーンを凍結したまま、ルーティングヘッドとrank-256のLoRAアダプタを同時に最適化した。有効な出力にはラベル平滑化クロスエントロピー、確率の校正にはBrier損失を用いている。Cloudflareは「Reinforcement Learning for Calibrated Decisions」と名付けた副目的関数も作った。隣接する順序選択肢に部分点を与え、分布のずれを抑える参照ペナルティを適用する仕組みだ。データセットは社内生成の合成データで、フィールド順やプロンプト、スキーマ構造を入れ替えて作られた。
その下にあるファインチューニング製品
今回の発表の残り半分は、Clefを顧客自身のワークロードに合わせて調整する強化学習サービスである。まずはCloudflareのフォワードデプロイド・エンジニアリングチームが伴走する形で始まり、後にセルフサーブのプラットフォームになる。すでに出荷済みの部品を縫い合わせた構成だ。AI Gatewayがリクエストトラフィックをデータセットとして取り込み、Workers AIがベースのClefに対してロールアウトを生成し、Containersが採点用サンドボックスとして働き、新設のTrainerが重みを更新する。成果物はWorkers AIの持ち込みモデル経路で再デプロイされるが、この経路はCloudflareがReplicateを買収して得たCogの成果の上に載っている。
Cloudflare自身が最初の顧客である。Trust and Safetyの投稿スコアリング、サポートのトリアージ、クローラーが良いボットか悪いボットかの判定を挙げ、15年分のラベル付きネットワークデータこそ、調整された分類器が汎用モデルに勝つための資産だと主張する。同社はこれらすべてを「エージェントのクラウド」という目標の下にまとめる。エージェントのためにウェブを作り直すという既存の賭けの延長線上だ。この分野自体はできてまだ一か月ほどしかない。Typesafeがステルスを解いたのは9月である。
FAQ よくある質問
Clefはオープンソースなのか
重みについてはそうだ。CloudflareはClefとClef-flashの両方をHugging FaceにApache 2.0ライセンスで公開しており、商用利用とローカル配備が認められている。ホスト版はWorkers AI上で@cf/cloudflare/clefと@cf/cloudflare/clef-flashとして動く。顧客がファインチューニングを選ばない限り、ホストされたリクエストを読む・保存する・学習に使うことはないと同社は述べている。リポジトリはHugging FaceのCloudflare/clefとCloudflare/clef-flashだ。
既存のJev連携をClefに切り替えられるか
可能だとCloudflareは言う。Clefが厳密に型付けされた出力を持つ同じSystem One APIを実装しているためだ。実務上はエンドポイントとモデル識別子を変えることになる。開発者はWorkers AIのバインディング、またはREST の/ai/run経路から利用でき、どちらの手前にもAI Gatewayを置ける。
Clefは何を土台にしているのか
両モデルともAlibabaのQwen系を事後学習したもので、学習中はバックボーンを凍結している。ClefはQwen3.8-27B、Clef-flashはQwen3.5-9Bだ。この領域でCloudflareが以前公開した実験は別の土台を使っていた。DiffusionGemmaを改変してlogprobを決定的な確率として露出させる方式で、vLLMプロジェクトにおけるMatt Mastracciの独立した成果の上に構築されたものである。






