7 min read

Modelo de decisión IA: qué es y cuándo usarlo en un agente

Un modelo de decisión IA devuelve probabilidades tipadas para enrutado y urgencia, no texto libre. Cuándo usarlo frente a un LLM, con Clef de ejemplo.

Un modelo de decisión IA es un modelo que responde un conjunto fijo de preguntas tipadas con probabilidades que tu código puede ejecutar. A diferencia de un LLM al que pides que "actúe como clasificador", no escribe texto libre que luego tengas que parsear. Clef (27B) y Clef-flash (9B) de Cloudflare, anunciados el 1 de octubre de 2026, son el ejemplo concreto: pesos Apache 2.0, alojados en Workers AI, pensados para decisiones en la ruta caliente como enrutado de tickets, urgencia y elección de herramienta.

Última verificación: 5 de octubre de 2026. Las especificaciones de abajo (tamaños, pesos Apache 2.0, hosting en Workers AI, forma de API System One / compatible con Jev, ruta de fine-tune RL con design partners) salen del blog de lanzamiento de Cloudflare y del changelog de Workers AI. La latencia y los scores frente a otros modelos de decisión son cifras publicadas por Cloudflare esa semana de lanzamiento. No reejecutamos sus benches. Omitimos precios de producto y claims de terceros sobre Jev más allá de la nota de compatibilidad de API de Cloudflare. Si una comparación tiene más de unos 90 días después de este lanzamiento, desconfía de la tabla del vendor.


Qué tipos de modelos entran en el bucle de un agente

CategoríaQué devuelveMejor para
LLM de chat / razonamientoTexto libre, planes, prosa de tool callsTrabajo abierto: escribir, explicar, inventar pasos
Clasificador clásicoEtiquetas que entrenasteTaxonomías estables que reentrenas cuando cambian las etiquetas
Modelo de decisión IARespuestas tipadas con probabilidades sobre opciones que tú definesDecide/actúa en ruta caliente: enrutar, escalar, elegir herramienta, puntuar severidad

La mayoría de demos de agentes meten un LLM en cada hueco. Sirve para demos. Se vuelve caro e inestable cuando el trabajo es "¿es urgente y qué equipo lo atiende?" en cada ticket.


Modelo de decisión vs LLM como clasificador

Un modelo de decisión IA recibe un estado (texto, JSON, a veces imágenes) más un esquema de preguntas. Cada pregunta está tipada. La forma System One que sigue Clef usa tres tipos: sí/no (noul), elige una (choice) y score ordenado (score). El modelo devuelve una probabilidad por cada respuesta permitida. Tu código ramifica con esos números. No hay prosa que rascar ni "tokens de razonamiento" que esperar para la decisión en sí.

Un LLM forzado a actuar como clasificador es otra cosa. Le pides JSON de etiquetas. Por debajo sigue generando texto libre. El formato se desvía. La confianza suele ser teatro salvo que la calibres tú. Latencia y coste escalan con cuánto texto inventa antes de la etiqueta.

Reglas de decisión:

Elige estoCuando
Modelo de decisiónLas respuestas son un conjunto cerrado que ya conoces; necesitas probabilidades para umbrales; la llamada va en la ruta caliente (enrutado, urgencia, elección de herramienta, guardrails)
LLMEl siguiente paso necesita texto nuevo, razonamiento multi paso o un plan de herramientas que no puedes definir en un schema de antemano
Ninguno soloNecesitas ambos: decide con un modelo de decisión y luego pasa a un LLM para escribir la respuesta o llamar herramientas

Esa división es el punto de esta página. Clef solo es el ejemplo trabajado.


Cómo corre un modelo de decisión una unidad de trabajo

Recorre un mensaje de soporte con el bucle que documenta Cloudflare:

  1. Estado de entrada. "El checkout falla para todos los clientes desde hace una hora."
  2. Preguntas de entrada. ¿Es urgente? (noul) ¿Qué equipo? (choice: billing / technical / sales) ¿Qué tan grave? (score sobre una rúbrica ordenada)
  3. Respuestas de salida. Probabilidades por opción, con los mismos ids de pregunta. Tu agente lee urgent, team y severity como campos estructurados.
  4. Actuar o escalar. Enruta el ticket, bloquea la petición, llama una herramienta o pasa a un humano si la confianza es baja.

Deberías ver por qué esto no es "chat con un system prompt". El contrato es estado + schema de entrada, probabilidades tipadas de salida.

Para el resto del stack del agente alrededor de ese paso de decisión (herramientas y memoria), ver cómo funciona la memoria de agentes de IA. Más explicadores están en el hub de herramientas de IA.


Cloudflare Clef como ejemplo concreto

El 1 de octubre de 2026 Cloudflare lanzó Clef y Clef-flash, los primeros modelos entrenados por el equipo de Workers AI y alojados en Workers AI como @cf/cloudflare/clef y @cf/cloudflare/clef-flash. Los pesos son abiertos bajo Apache 2.0 en Hugging Face. Cloudflare los describe como compatibles con la API de Jev (System One API): puedes apuntar una integración con forma Jev a Clef cambiando endpoint y modelo.

ModeloTamañoCloudflare dice que es mejor paraVentana de contexto
Clef27BDecisiones de máxima precisión64K tokens (docs: 65.536)
Clef-flash9BDecisiones de latencia crítica en ruta caliente64K tokens (docs: 65.536)

Extras verificados solo desde fuentes primarias de Cloudflare:

  • Visión: imágenes opcionales (hasta cuatro) junto al estado; Cloudflare lo presenta como extensión de Clef frente a modelos de decisión solo texto.
  • Batch: hasta 64 preguntas por request.
  • Fine-tune RL: Cloudflare abre una ruta de reinforcement learning empezando con design partners / FDEs, no un producto self-serve de un clic según los posts de lanzamiento.
  • Latencia (cifras de Cloudflare): en sus 43 runs de benchmark reportan mediana de 209,3 ms para Clef y 38,8 ms para Clef-flash. Trátalo como publicado por el vendor, no rechequeado aquí de forma independiente.

Lo que no se suele decir. Clef no es un modelo de chat general. No te escribe el email al cliente. No inventa un flujo nuevo. Si tu schema está mal, las probabilidades siguen siendo "correctas" frente a una mala pregunta. Y el fine-tune RL en el lanzamiento es un motion de design partner: no planifiques el roadmap como si mañana hubiera pesos Clef custom self-serve.

Veredicto: usa Clef (o Clef-flash) cuando ya conoces las opciones de decisión y necesitas probabilidades tipadas y rápidas en Workers AI o con pesos Apache 2.0 locales. Evítalo cuando el agente todavía necesita generar el plan, no solo elegir entre planes.


Cuándo meter un modelo de decisión en la ruta caliente

Situación¿Usar modelo de decisión?Por qué
Enrutado de tickets y urgenciaSíEquipos y flags de urgencia cerrados; umbrales ganan al teatro del prompt
Elección de herramienta / skill antes de que actúe el LLMSíCheck de guardrail en decenas de milisegundos (framing de Cloudflare)
Score de trust and safety contra tu rúbricaSíLas preguntas score ordenadas encajan limpio
Redactar la respuesta o escribir códigoNoEso es trabajo de LLM después del paso decide
Taxonomía nueva que aún no puedes listarTodavía noPrimero schema las opciones, o quédate con un LLM hasta que el set se estabilice
Pregunta de research de una sola vezNoAbierta; el modelo de decisión desperdicia la restricción

El ejemplo interno de Cloudflare es clasificación de dominios estilo threat intel con Browser Run: reportan que Clef fetch, render y clasifica un dominio en 2,2 segundos en ese flujo frente a 4,7 segundos de su LLM general gpt-oss-120b en el mismo setup. Es una anécdota de Cloudflare del blog de lanzamiento, no una ley universal de velocidad.


¿Cuál debería elegir?

Tu situaciónEligePor qué
Necesitas enrutar / escalar / puntuar estructurado en cada requestModelo de decisión (p. ej. Clef o Clef-flash)Probabilidades tipadas; sin paso de parse
Quieres la latencia más baja que Cloudflare lista en esta familiaClef-flash (9B)Cloudflare lo posiciona para latencia en ruta caliente
Quieres máxima precisión en esa misma familiaClef (27B)Cloudflare lo posiciona para máxima precisión
Necesitas razonamiento abierto o texto generadoLLMLos modelos de decisión no escriben
Necesitas decidir y actuarModelo de decisión y luego LLMDecide en la ruta caliente; genera después
Todavía estás aprendiendo arquitectura de agentesAprende primero el split decide/actúaHerramientas y memoria importan tanto como la marca del modelo

Si estás comparando rutas de aprendizaje para lanzar agentes (no eligiendo un SKU de Cloudflare), un advisor puede ayudarte a ver qué programa encaja (formulario abajo): AI Engineering para career changers y profesionales semi técnicos que quieren construir agentes de producción, no solo promptar chatbots.

¿Construyes agentes o solo prompts a chatbots?

Cuéntanos dónde estás hoy y un advisor te ayuda a ver qué programa encaja: AI Engineering para lanzar agentes, RAG y apps de IA en producción.

Preguntas Frecuentes