Cloudflare publicó el 1 de octubre los dos primeros modelos entrenados internamente por su equipo de Workers AI, y ninguno de los dos escribe una palabra. Clef y Clef-flash reciben un estado de entrada junto a un esquema de preguntas tipadas y devuelven una probabilidad calibrada para cada respuesta permitida, con los pesos incluidos bajo licencia Apache 2.0 en Hugging Face.
Claves del lanzamiento
- En 10 pruebas de decisión, un modelo Clef obtiene la puntuación más alta en 7, por delante de Jev, de Typesafe, y de otros modelos de decisión abiertos, según los resultados de Cloudflare.
- A lo largo de 43 ejecuciones de referencia, Cloudflare midió Clef a 2,5 veces la velocidad mediana de Jev y Clef-flash a 13 veces, con ambos modelos servidos desde GPU repartidas por su red de borde.
- Clef parte de un backbone congelado Qwen3.8-27B y Clef-flash de Qwen3.5-9B; ambos se publicaron bajo Apache 2.0 en Hugging Face.
Qué se le envía realmente a Clef
Una petición lleva un estado —un mensaje de soporte, una URL, el envío de un usuario— y hasta 64 preguntas, cada una de uno de tres tipos. Una pregunta noul es de sí o no y vuelve como la probabilidad del sí. Una pregunta choice elige una opción del conjunto que define el desarrollador y devuelve la ganadora, una probabilidad por opción y un valor de confianza. Una pregunta score califica el estado contra una rúbrica ordenada y devuelve una puntuación ponderada por probabilidad más una probabilidad por nivel.
Como la forma de la salida es fija, no hay nada que parsear ni tokens de razonamiento que esperar. El argumento de Cloudflare es que un agente puede colocar esto directamente en su ruta de petición: comprobar "¿debería ejecutar esta acción?" en decenas de milisegundos y pasar después el trabajo a un modelo de lenguaje en Workers AI.
En qué se diferencia Clef de Jev
Clef sigue la misma System One API que usa Jev, de Typesafe, de modo que Cloudflare afirma que una integración existente se traslada cambiando el endpoint y el nombre del modelo. Dos diferencias de capacidad juegan a favor de Cloudflare: Clef incorpora un codificador de visión y acepta hasta cuatro imágenes junto al estado, mientras que Jev hoy solo admite texto, y su ventana de contexto es de 64k frente a los 32k de Jev.
La cifra más afilada que ofrece Cloudflare viene de su propio equipo de inteligencia de amenazas. Combinado con Browser Run, Clef descargó, renderizó y clasificó el dominio de un sitio web en 2,2 segundos; el modelo general más rápido de la compañía en ese mismo flujo, gpt-oss-120b, tardó 4,7 segundos y devolvió solo dos clasificaciones. En las evaluaciones de flujos de trabajo de Typesafe, Cloudflare informa de que Clef gana en tres de cuatro áreas —procesamiento de facturas, atención al cliente e incidentes de seguridad—, lo que significa que la cuarta sigue siendo de Jev. Todas las cifras proceden del propio fabricante, y el anuncio de lanzamiento las publica acompañadas de un sitio de demostración en vivo en lugar de verificación independiente.
Por qué existe la brecha de latencia
Clef no genera tokens uno detrás de otro. Ejecuta una única pasada de prefill sobre el backbone Qwen congelado y después puntúa en paralelo todas las opciones válidas del esquema mediante un enrutado de atención en dos etapas, derivando las respuestas de representaciones internas en vez de emitir texto intermedio. Ese paso de decisión no autorregresivo es el origen de la velocidad, no un modelo más pequeño.
El entrenamiento mantuvo congelado el backbone y optimizó conjuntamente una cabeza de enrutado junto a adaptadores LoRA de rango 256, con entropía cruzada con suavizado de etiquetas para las salidas válidas y una pérdida de Brier para calibrar las probabilidades. Cloudflare construyó además un objetivo secundario al que llama Reinforcement Learning for Calibrated Decisions, que concede crédito parcial a opciones ordinales adyacentes y aplica una penalización de referencia para limitar el desplazamiento de la distribución. Los conjuntos de datos fueron sintéticos y generados internamente, permutando el orden de los campos, los prompts y las estructuras de esquema.
El producto de ajuste que va debajo
La otra mitad del lanzamiento es un servicio de aprendizaje por refuerzo para adaptar Clef a la carga de trabajo de cada cliente, que arranca como trabajo manual con el equipo de ingeniería desplegada de Cloudflare y más adelante pasará a ser una plataforma autoservicio. Cose piezas que la compañía ya tenía en producción: AI Gateway captura el tráfico de peticiones en un conjunto de datos, Workers AI genera despliegues contra el Clef base, Containers hace de entorno aislado de puntuación, un nuevo Trainer actualiza los pesos y la vía de modelo propio de Workers AI —construida sobre el trabajo de Cog que llegó con la compra de Replicate— vuelve a desplegar el resultado.
Cloudflare es su propio primer cliente. Menciona la puntuación de envíos en Trust and Safety, el triaje de soporte y decidir si un rastreador es un bot bueno o malo, y sostiene que 15 años de datos de red etiquetados son el activo que hace que un clasificador ajustado gane a uno genérico. La compañía enmarca todo ello en la misión de ser "la nube de los agentes", continuación de la misma apuesta que hay detrás de su empeño en reconstruir la web para los agentes. La categoría apenas tiene un mes de vida: Typesafe salió del sigilo en septiembre.
Preguntas frecuentes
¿Clef es de código abierto?
Los pesos sí. Cloudflare publicó Clef y Clef-flash en Hugging Face bajo licencia Apache 2.0, que permite uso comercial y despliegue local. Las versiones alojadas corren en Workers AI como @cf/cloudflare/clef y @cf/cloudflare/clef-flash, y la compañía afirma que no lee, almacena ni entrena con las peticiones alojadas salvo que el cliente opte por el ajuste fino. Los repositorios están en Hugging Face como Cloudflare/clef y Cloudflare/clef-flash.
¿Puede una integración con Jev pasarse a Clef?
Cloudflare dice que sí, porque Clef implementa la misma System One API con salidas estrictamente tipadas. En la práctica significa cambiar el endpoint y el identificador del modelo. Los desarrolladores llegan a él por el binding de Workers AI o por la ruta REST /ai/run, y AI Gateway puede situarse delante de cualquiera de las dos.
¿Sobre qué está construido Clef?
Ambos modelos se post-entrenaron a partir de la familia Qwen de Alibaba, con el backbone congelado durante el entrenamiento: Qwen3.8-27B para Clef y Qwen3.5-9B para Clef-flash. El experimento público anterior de Cloudflare en esta área usaba otra base, adaptando DiffusionGemma para exponer logprobs como probabilidades deterministas, sobre el trabajo independiente de Matt Mastracci en el proyecto vLLM.






