A Cloudflare anunciou Clef e Clef-Flash em 1º de outubro de 2026 como modelos de decisão com pesos abertos sob a licença Apache 2.0. Em vez de produzir respostas em texto livre, eles recebem uma entrada e devolvem um resultado estruturado, como uma resposta de sim ou não, uma opção escolhida ou uma pontuação. A empresa também informou que os modelos estavam hospedados no Workers AI.
O que um modelo de decisão retorna
Um modelo de decisão responde a uma pergunta dentro de um formato definido, chamado esquema. Esse formato pode limitar a saída a sim ou não, a uma escolha entre opções predefinidas ou a uma pontuação. A resposta fica pronta para integrar a uma etapa de um fluxo de trabalho, como classificar uma entrada ou encaminhar uma tarefa, sem depender de um parágrafo gerado para cada caso.
Na API hospedada, a Cloudflare lista os tipos de pergunta noul (sim ou não), choice (escolha) e score (pontuação). Uma solicitação pode conter de uma a 64 perguntas. Os modelos aceitam entradas de texto, JSON, imagens e vídeo.
Clef e Clef-Flash em comparação
Clef tem 27 bilhões de parâmetros e usa Qwen3.8-27B como base; Clef-Flash tem 9 bilhões e usa Qwen3.5-9B. A documentação do Clef informa uma janela de contexto de 65.536 tokens.
| Variante | Parâmetros | Modelo-base | Entradas | Licença dos pesos |
| Clef | 27 bilhões | Qwen3.8-27B | Texto, JSON, imagens e vídeo | Apache 2.0 |
| Clef-Flash | 9 bilhões | Qwen3.5-9B | Texto, JSON, imagens e vídeo | Apache 2.0 |
O que mostram as avaliações da Cloudflare
Os benchmarks publicados pela Cloudflare apresentam resultados diferentes de acordo com a tarefa. No BANKING77, Clef marcou 94,20 de macro-F1, contra 79,74 do Jev; Clef-Flash marcou 90,93. Já no When2Call, o Jev alcançou 80,97 de acurácia, acima de Clef, com 72,37, e Clef-Flash, com 65,58. No BRIGHT, o Jev também ficou à frente: 47,52 de nDCG@10, contra 45,91 de Clef e 39,26 de Clef-Flash.
Em um fluxo interno de classificação de sites, a Cloudflare informou que Clef levou 2,2 segundos para buscar, renderizar e classificar um site; o gpt-oss-120b levou 4,7 segundos na mesma tarefa. No exemplo, Clef atribuiu 95% de probabilidade à categoria moda, 85% a comércio eletrônico e menos de 1% a phishing. Esses números descrevem os testes e o exemplo relatados pela empresa.
O ajuste fino: serviço assistido e etapa posterior
No anúncio, a Cloudflare informou oferecer ajuste fino com acompanhamento de sua equipe FDE. A empresa apresentou uma plataforma self-service para ajuste fino e reimplantação como uma etapa posterior, distinta do serviço assistido.