Un modelo de decisión IA es un modelo que responde un conjunto fijo de preguntas tipadas con probabilidades que tu código puede ejecutar. A diferencia de un LLM al que pides que "actúe como clasificador", no escribe texto libre que luego tengas que parsear. Clef (27B) y Clef-flash (9B) de Cloudflare, anunciados el 1 de octubre de 2026, son el ejemplo concreto: pesos Apache 2.0, alojados en Workers AI, pensados para decisiones en la ruta caliente como enrutado de tickets, urgencia y elección de herramienta.
Última verificación: 5 de octubre de 2026. Las especificaciones de abajo (tamaños, pesos Apache 2.0, hosting en Workers AI, forma de API System One / compatible con Jev, ruta de fine-tune RL con design partners) salen del blog de lanzamiento de Cloudflare y del changelog de Workers AI. La latencia y los scores frente a otros modelos de decisión son cifras publicadas por Cloudflare esa semana de lanzamiento. No reejecutamos sus benches. Omitimos precios de producto y claims de terceros sobre Jev más allá de la nota de compatibilidad de API de Cloudflare. Si una comparación tiene más de unos 90 días después de este lanzamiento, desconfía de la tabla del vendor.
Qué tipos de modelos entran en el bucle de un agente
| Categoría | Qué devuelve | Mejor para |
|---|---|---|
| LLM de chat / razonamiento | Texto libre, planes, prosa de tool calls | Trabajo abierto: escribir, explicar, inventar pasos |
| Clasificador clásico | Etiquetas que entrenaste | Taxonomías estables que reentrenas cuando cambian las etiquetas |
| Modelo de decisión IA | Respuestas tipadas con probabilidades sobre opciones que tú defines | Decide/actúa en ruta caliente: enrutar, escalar, elegir herramienta, puntuar severidad |
La mayoría de demos de agentes meten un LLM en cada hueco. Sirve para demos. Se vuelve caro e inestable cuando el trabajo es "¿es urgente y qué equipo lo atiende?" en cada ticket.
Modelo de decisión vs LLM como clasificador
Un modelo de decisión IA recibe un estado (texto, JSON, a veces imágenes) más un esquema de preguntas. Cada pregunta está tipada. La forma System One que sigue Clef usa tres tipos: sí/no (noul), elige una (choice) y score ordenado (score). El modelo devuelve una probabilidad por cada respuesta permitida. Tu código ramifica con esos números. No hay prosa que rascar ni "tokens de razonamiento" que esperar para la decisión en sí.
Un LLM forzado a actuar como clasificador es otra cosa. Le pides JSON de etiquetas. Por debajo sigue generando texto libre. El formato se desvía. La confianza suele ser teatro salvo que la calibres tú. Latencia y coste escalan con cuánto texto inventa antes de la etiqueta.
Reglas de decisión:
| Elige esto | Cuando |
|---|---|
| Modelo de decisión | Las respuestas son un conjunto cerrado que ya conoces; necesitas probabilidades para umbrales; la llamada va en la ruta caliente (enrutado, urgencia, elección de herramienta, guardrails) |
| LLM | El siguiente paso necesita texto nuevo, razonamiento multi paso o un plan de herramientas que no puedes definir en un schema de antemano |
| Ninguno solo | Necesitas ambos: decide con un modelo de decisión y luego pasa a un LLM para escribir la respuesta o llamar herramientas |
Esa división es el punto de esta página. Clef solo es el ejemplo trabajado.
Cómo corre un modelo de decisión una unidad de trabajo
Recorre un mensaje de soporte con el bucle que documenta Cloudflare:
- Estado de entrada. "El checkout falla para todos los clientes desde hace una hora."
- Preguntas de entrada. ¿Es urgente? (
noul) ¿Qué equipo? (choice: billing / technical / sales) ¿Qué tan grave? (scoresobre una rúbrica ordenada) - Respuestas de salida. Probabilidades por opción, con los mismos ids de pregunta. Tu agente lee
urgent,teamyseveritycomo campos estructurados. - Actuar o escalar. Enruta el ticket, bloquea la petición, llama una herramienta o pasa a un humano si la confianza es baja.
Deberías ver por qué esto no es "chat con un system prompt". El contrato es estado + schema de entrada, probabilidades tipadas de salida.
Para el resto del stack del agente alrededor de ese paso de decisión (herramientas y memoria), ver cómo funciona la memoria de agentes de IA. Más explicadores están en el hub de herramientas de IA.
Cloudflare Clef como ejemplo concreto
El 1 de octubre de 2026 Cloudflare lanzó Clef y Clef-flash, los primeros modelos entrenados por el equipo de Workers AI y alojados en Workers AI como @cf/cloudflare/clef y @cf/cloudflare/clef-flash. Los pesos son abiertos bajo Apache 2.0 en Hugging Face. Cloudflare los describe como compatibles con la API de Jev (System One API): puedes apuntar una integración con forma Jev a Clef cambiando endpoint y modelo.
| Modelo | Tamaño | Cloudflare dice que es mejor para | Ventana de contexto |
|---|---|---|---|
| Clef | 27B | Decisiones de máxima precisión | 64K tokens (docs: 65.536) |
| Clef-flash | 9B | Decisiones de latencia crítica en ruta caliente | 64K tokens (docs: 65.536) |
Extras verificados solo desde fuentes primarias de Cloudflare:
- Visión: imágenes opcionales (hasta cuatro) junto al estado; Cloudflare lo presenta como extensión de Clef frente a modelos de decisión solo texto.
- Batch: hasta 64 preguntas por request.
- Fine-tune RL: Cloudflare abre una ruta de reinforcement learning empezando con design partners / FDEs, no un producto self-serve de un clic según los posts de lanzamiento.
- Latencia (cifras de Cloudflare): en sus 43 runs de benchmark reportan mediana de 209,3 ms para Clef y 38,8 ms para Clef-flash. Trátalo como publicado por el vendor, no rechequeado aquí de forma independiente.
Lo que no se suele decir. Clef no es un modelo de chat general. No te escribe el email al cliente. No inventa un flujo nuevo. Si tu schema está mal, las probabilidades siguen siendo "correctas" frente a una mala pregunta. Y el fine-tune RL en el lanzamiento es un motion de design partner: no planifiques el roadmap como si mañana hubiera pesos Clef custom self-serve.
Veredicto: usa Clef (o Clef-flash) cuando ya conoces las opciones de decisión y necesitas probabilidades tipadas y rápidas en Workers AI o con pesos Apache 2.0 locales. Evítalo cuando el agente todavía necesita generar el plan, no solo elegir entre planes.
Cuándo meter un modelo de decisión en la ruta caliente
| Situación | ¿Usar modelo de decisión? | Por qué |
|---|---|---|
| Enrutado de tickets y urgencia | Sí | Equipos y flags de urgencia cerrados; umbrales ganan al teatro del prompt |
| Elección de herramienta / skill antes de que actúe el LLM | Sí | Check de guardrail en decenas de milisegundos (framing de Cloudflare) |
| Score de trust and safety contra tu rúbrica | Sí | Las preguntas score ordenadas encajan limpio |
| Redactar la respuesta o escribir código | No | Eso es trabajo de LLM después del paso decide |
| Taxonomía nueva que aún no puedes listar | Todavía no | Primero schema las opciones, o quédate con un LLM hasta que el set se estabilice |
| Pregunta de research de una sola vez | No | Abierta; el modelo de decisión desperdicia la restricción |
El ejemplo interno de Cloudflare es clasificación de dominios estilo threat intel con Browser Run: reportan que Clef fetch, render y clasifica un dominio en 2,2 segundos en ese flujo frente a 4,7 segundos de su LLM general gpt-oss-120b en el mismo setup. Es una anécdota de Cloudflare del blog de lanzamiento, no una ley universal de velocidad.
¿Cuál debería elegir?
| Tu situación | Elige | Por qué |
|---|---|---|
| Necesitas enrutar / escalar / puntuar estructurado en cada request | Modelo de decisión (p. ej. Clef o Clef-flash) | Probabilidades tipadas; sin paso de parse |
| Quieres la latencia más baja que Cloudflare lista en esta familia | Clef-flash (9B) | Cloudflare lo posiciona para latencia en ruta caliente |
| Quieres máxima precisión en esa misma familia | Clef (27B) | Cloudflare lo posiciona para máxima precisión |
| Necesitas razonamiento abierto o texto generado | LLM | Los modelos de decisión no escriben |
| Necesitas decidir y actuar | Modelo de decisión y luego LLM | Decide en la ruta caliente; genera después |
| Todavía estás aprendiendo arquitectura de agentes | Aprende primero el split decide/actúa | Herramientas y memoria importan tanto como la marca del modelo |
Si estás comparando rutas de aprendizaje para lanzar agentes (no eligiendo un SKU de Cloudflare), un advisor puede ayudarte a ver qué programa encaja (formulario abajo): AI Engineering para career changers y profesionales semi técnicos que quieren construir agentes de producción, no solo promptar chatbots.
