Su agente no debería consultar a un LLM de frontera cada decisión menor. Clef apuesta por modelos de decisión
Cloudflare ha lanzado Clef y Clef-flash, modelos abiertos que devuelven probabilidades sobre respuestas permitidas en lugar de texto. Apuntan a agentes con una capa de decisión aparte y más barata.
Escuche este artículo · 6 min
Narración completa del artículo, generada con IA.

Dentro de un bucle de agente típico, un modelo grande recibe muchas preguntas pequeñas: ¿es urgente este mensaje?, ¿qué equipo se encarga?, ¿está permitida esta petición?, ¿debe revisarlo una persona? Cada respuesta vuelve como texto que la aplicación tiene que interpretar. Funciona, pero es lento, caro y difícil de medir.
El 1 de octubre, Cloudflare lanzó otro tipo de modelo precisamente para esas preguntas.
Qué ha lanzado Cloudflare
Clef y Clef-flash son lo que Cloudflare llama modelos de decisión. Reciben un estado de entrada y un conjunto de preguntas tipadas y devuelven una probabilidad para cada respuesta permitida, en lugar de generar texto libre. Hay tres tipos de pregunta: sí o no, elegir una opción de una lista y puntuar según una rúbrica.
- Clef tiene 27.000 millones de parámetros; Clef-flash, 9.000 millones. Ambos admiten 64.000 tokens de contexto, texto y hasta cuatro imágenes, y se publican con licencia Apache 2.0 y pesos en Hugging Face.
- Ambos están en disponibilidad general en Workers AI.
- Cloudflare menciona como usos el triaje de soporte, la inteligencia de amenazas y la clasificación de sitios web, la puntuación de confianza y seguridad, los guardrails de agentes y la clasificación visual.
- El fine-tuning con aprendizaje por refuerzo arranca como programa con socios de diseño; la versión de autoservicio llegará después.
Cloudflare informa de que Clef-flash obtuvo una latencia mediana de 38,8 milisegundos en su comparación con otro modelo de decisión, unas 13 veces más rápido, y de que Clef lideró 7 de 10 benchmarks de decisión. Son mediciones de la propia Cloudflare; el material de lanzamiento no cita un evaluador independiente, y conviene probarlo con datos propios antes de contar con esas cifras. La empresa reconoce además el trade-off evidente: Clef-flash sacrifica algo de precisión a cambio de velocidad. Ni el changelog ni el artículo de lanzamiento que revisamos publican precios; consulte la página de precios de Workers AI.
Por qué importa una capa de decisión
Lo interesante no es la cifra de velocidad. Es la forma de la salida.
Una probabilidad puede llevar una política. Si el modelo devuelve “escalar: 0,83”, usted puede fijar que todo lo que quede por debajo de 0,9 pase a una persona y lo que supere 0,97 siga adelante. Ese umbral es una decisión de negocio escrita en configuración, no la esperanza de que el prompt se respete.
Las respuestas tipadas se pueden medir. Con respuestas permitidas, evaluar se convierte en un problema de clasificación, con precisión, exhaustividad y matrices de confusión que los equipos de riesgos y auditoría ya conocen. El enrutamiento en texto libre necesita un juez para evaluarse.
Los modelos pequeños y rápidos caben en la ruta crítica. El enrutamiento y el filtrado ocurren en cada petición. Sacarlos del modelo de frontera deja ese modelo para los pasos que requieren razonamiento, la misma lógica de costes que analizamos en nuestro artículo sobre el enrutamiento por tarea en la guía de GPT-6.
Los pesos abiertos mantienen las opciones abiertas. Con Apache 2.0, el mismo modelo de decisión puede ejecutarse fuera de Cloudflare si la custodia de los datos o la latencia lo exigen.
- Recuperar contexto
- Razonar y planificar (modelo grande)
- Decidir: enrutar, bloquear, aprobar, escalar
- Comprobación de política determinista
- Ejecutar herramienta o pasar a una persona
- Generativo: Recuperar contexto · Razonar y planificar (modelo grande)
- Probabilístico y tipado: Decidir: enrutar, bloquear, aprobar, escalar
- Determinista: Comprobación de política determinista · Ejecutar herramienta o pasar a una persona
Razonamiento abiertoProbabilidades sobre respuestas permitidas
Qué no sustituye un modelo de decisión
Una probabilidad no es un permiso. Si el modelo de decisión dice “aprobar” con alta confianza, una capa de política determinista sigue comprobando si ese usuario, ese agente y esa acción están autorizados. El modelo reduce las opciones; las reglas deciden. Lo señalamos al analizar lo que debe seguir siendo determinista en el sistema de cuentas a pagar de Snowflake.
La calibración también necesita pruebas. Un modelo que dice 0,9 debería acertar unas nueve de cada diez veces con su tráfico real. Mídalo antes de fijar umbrales, y otra vez después de cada fine-tuning o actualización.
Y algunas decisiones tienen peso jurídico. En España y en el resto de la UE, el artículo 22 del RGPD limita las decisiones basadas únicamente en tratamiento automatizado que produzcan efectos jurídicos o significativos, y exige garantías como la intervención humana y la posibilidad de impugnar la decisión. En Chile, la nueva ley de datos personales, que entra en vigor en diciembre de 2026, también reconoce el derecho a oponerse a decisiones automatizadas. Una probabilidad no es una explicación por sí sola: el sistema tiene que registrar por qué se produjo el resultado y quién puede revisarlo.
Qué hacer ahora
- Enumere las pequeñas decisiones de sus agentes: enrutamiento, escalado, moderación, elección de herramienta, clasificación del siguiente paso.
- Estime qué parte de las llamadas y del coste suponen. En muchos agentes son la mayoría de las llamadas.
- Pruebe un modelo de decisión en una de ellas con un conjunto etiquetado de su propio histórico, y compárelo con su prompt actual en precisión, latencia y coste.
- Fije los umbrales como configuración, con una franja explícita que pase a una persona.
- Mantenga separada la comprobación de política y registre tanto la probabilidad como la regla que permitió o bloqueó la acción.
- Vigile la calibración en el tiempo, como con cualquier clasificador en producción.
En resumen
Clef es un producto, pero el patrón es más amplio: los agentes se están convirtiendo en sistemas compuestos en los que distintos modelos responden distintos tipos de preguntas. Deje las decisiones acotadas y frecuentes a un modelo hecho para decidir, el razonamiento al modelo de razonamiento y la última palabra a la política determinista.