Cloudflare anunció Clef y Clef-Flash el 1 de octubre de 2026 como modelos de decisión con pesos abiertos: reciben datos y devuelven respuestas estructuradas, como una clasificación o una opción, en lugar de generar texto libre. La empresa indicó que los pesos se publicaron bajo Apache 2.0 y que los modelos estaban disponibles para inferencia alojada en Workers AI.
Qué devuelve un modelo de decisión
Un modelo de decisión responde a una pregunta definida mediante un esquema: una estructura que fija de antemano qué tipo de respuesta se acepta. Puede indicar sí o no, elegir entre varias opciones o asignar una puntuación. Así, el resultado puede incorporarse a un flujo de trabajo sin tener que interpretar primero un párrafo generado.
La API alojada admite los tipos de pregunta noul —sí o no—, choice —una opción entre varias— y score —una puntuación—, y permite incluir de 1 a 64 preguntas en una solicitud. Cloudflare describe el paso de decisión de Clef como no autorregresivo: el modelo puntúa en paralelo las opciones válidas del esquema, en vez de producir texto intermedio palabra por palabra.
Clef y Clef-Flash, frente a frente
Cloudflare presentó Clef como un modelo multimodal de 27.000 millones de parámetros basado en Qwen3.8-27B, y Clef-Flash como una variante de 9.000 millones basada en Qwen3.5-9B. Ambos aceptan texto, JSON, imágenes y vídeo.
| Variante | Parámetros | Backbone | Entradas | Licencia |
| Clef | 27.000 millones | Qwen3.8-27B | Texto, JSON, imágenes y vídeo | Apache 2.0 |
| Clef-Flash | 9.000 millones | Qwen3.5-9B | Texto, JSON, imágenes y vídeo | Apache 2.0 |
Para Clef, Cloudflare publica una ventana de contexto de 65.536 tokens. La documentación describe las respuestas de ambos modelos como decisiones y puntuaciones acotadas por las opciones del esquema.
Las evaluaciones de Cloudflare y el fine-tuning
Los resultados de Cloudflare varían según la tarea. En BANKING77, Clef obtuvo una puntuación macro-F1 de 94,20 y Clef-Flash de 90,93, frente a 79,74 de Jev. En When2Call, Jev alcanzó una tasa de acierto de 80,97; Clef obtuvo 72,37 y Clef-Flash, 65,58. Cloudflare comunicó estas evaluaciones; no son una replicación independiente.
En un flujo interno de clasificación de sitios web, Cloudflare indicó que Clef tardó 2,2 segundos en recuperar, renderizar y clasificar un sitio. En el mismo flujo, gpt-oss-120b tardó 4,7 segundos y devolvió dos clasificaciones. Para el ejemplo de Clef, la empresa comunicó probabilidades del 95 % para moda, el 85 % para comercio electrónico y menos del 1 % para phishing.
Cloudflare ofreció un servicio de ajuste fino acompañado por su equipo de ingenieros de despliegue avanzado (FDE). La plataforma de autoservicio para ajustar y volver a desplegar modelos se presentó como una etapa posterior, no como parte de ese servicio práctico anunciado.