Agentes

¿Generar o discriminar? Cómo recortar latencia agéntica sin quemar tokens

La física de la decisión agéntica frente a la factura de tokens. Cómo desplegar modelos discriminativos de Sistema Uno sin caer en sobreingeniería.

Retrato ilustrado de Mariemily Silva
Mariemily Silva · 14 min de lectura
Ilustración editorial flat risograph: un pequeño autómata en verde bosque acciona una palanca terracota para desviar tokens por un canal de baja latencia mientras un motor masivo reposa entre enredaderas.

Durante los últimos tres años he visto repetirse una anomalía en decenas de arquitecturas agénticas: encender turbinas de cientos de miles de millones de parámetros para resolver una bifurcación booleana. Ponemos a un modelo de lenguaje autorregresivo a deliberar sobre un estado completo, le exigimos generar un objeto estructurado en formato JSON, esperamos entre seiscientos y mil quinientos milisegundos de decodificación secuencial token por token, y cruzamos los dedos para que la sintaxis no se rompa en producción solo para saber si un ticket es urgente o si el agente debe invocar una base de datos.

Es un desperdicio grosero de latencia y presupuesto.

El reciente anuncio de TypeSafe AI con su modelo Jev, seguido en cuestión de días por los lanzamientos de código abierto de Amazon Web Services con Strands Decider 2B y Cloudflare con Clef en Workers AI, marca el fin de esa negligencia operativa. Esta transición técnica representa una rectificación de ingeniería largamente demorada: separar formalmente la discriminación rápida del razonamiento generativo dentro del ciclo de vida de los agentes autónomos. Esta nota resume el criterio técnico para evaluar estos modelos de decisión, el cálculo económico real de su infraestructura y el patrón para gobernar bucles agénticos sin quemar tokens en vano.

La trampa del token conversacional: por qué forzar a un LLM a elegir un booleano penaliza el bucle agéntico

En una arquitectura agéntica de ciclo cerrado, la mayor parte del tiempo de ejecución no se consume sintetizando respuestas brillantes para humanos. Se consume en decisiones intermedias de control de flujo. En un bucle ReAct estándar, hasta el setenta por ciento de las llamadas al modelo no agregan conocimiento nuevo al contexto; simplemente evalúan si una precondición se cumple, si una llamada a herramienta arrojó datos suficientes o si el flujo debe derivarse a una rama secundaria.

Cuando utilizas un modelo generativo convencional para gobernar ese flujo, cada bifurcación paga un peaje severo. El modelo debe calcular la atención sobre todo el historial previo, procesar la máscara causal y comenzar a emitir tokens de manera estrictamente secuencial. Cada nuevo token exige actualizar la memoria caché de claves y valores (KV cache) y esperar un ciclo completo de inferencia. Si tu esquema de respuesta exige un JSON estructurado con tres campos tipados, estás obligado a esperar al menos treinta o cuarenta pasos autorregresivos.

A una velocidad promedio de cincuenta tokens por segundo en modelos de tamaño intermedio, esa evaluación rutinaria consume entre setecientos y ochocientos milisegundos de latencia neta. Si tu agente encadena cuatro pasos de decisión antes de interactuar con el usuario, la persona ya acumula más de tres segundos de silencio frente a la interfaz. El usuario asume que el sistema se colgó.

El problema no termina en el tiempo de espera. Los modelos generativos sufren deriva estocástica. Aun con temperaturas fijadas en cero y esquemas JSON estrictos forzados por el proveedor, la generación de texto libre introduce fallos sintácticos aleatorios, delimitadores truncados o explicaciones no solicitadas que rompen el analizador del orquestador. Para contener ese fallo, los equipos terminan implementando capas de reintento y validadores deterministas que multiplican la latencia por dos o por tres. Es una solución parcheada sobre una herramienta equivocada.

Anatomía de un modelo de Sistema Uno: discriminación en una sola pasada frente a generación autorregresiva

El término comercial que la industria adoptó para esta categoría proviene de la psicología del comportamiento: modelos de Sistema Uno. El concepto evoca juicios rápidos, automáticos e intuitivos, frente al razonamiento deliberativo y pausado del Sistema Dos. Más allá de la metáfora divulgativa, la realidad de ingeniería es mucho más concreta y conocida.

El modelo de decisión de Sistema Uno (System 1 decision model o discriminative model) es una arquitectura de transformador especializada que evalúa un estado contextual en un único paso hacia adelante (single forward pass) y proyecta su representación interna hacia cabezas de clasificación tipadas, devolviendo distribuciones de probabilidad calibradas sobre un catálogo acotado de opciones sin decodificar texto token por token.

La diferencia estructural frente a un modelo generativo es radical. En un modelo autorregresivo tradicional, la capa final es una cabeza de modelado de lenguaje (LM head) que calcula probabilidades sobre un vocabulario masivo de decenas o cientos de miles de tokens para seleccionar la siguiente palabra. En un modelo de decisión, esa cabeza de generación se extirpa por completo. En su lugar, el modelo conecta una cabeza de puntero (pointer head) o un clasificador lineal compacto de aproximadamente un millón de parámetros.

Al eliminar la decodificación secuencial, desaparece la necesidad de proyectar matrices masivas paso a paso. El modelo ingiere el contexto, procesa la atención bidireccional sobre la entrada y resuelve las puntuaciones de las opciones en paralelo. La salida consiste en un vector numérico con puntuaciones de log-probabilidad (logprobs) asociadas a valores booleanos, opciones categóricas o escalas continuas, listo para consumo directo de máquina sin intermediación sintáctica.

Esta inferencia prescinde de tokens alucinados y de fallos de sintaxis en delimitadores JSON, operando como una función determinista con latencias predecibles en el rango de los treinta a cien milisegundos. Es la recuperación técnica de los clasificadores discriminativos clásicos, potenciados por el espacio semántico de los transformadores modernos.

Jev, Strands Decider 2B y Clef bajo la lupa: benchmarks de 39 ms, pesos abiertos y paridad de API

La irrupción de esta tecnología se aceleró de forma drástica entre septiembre y octubre de 2026. Lo que comenzó como una propuesta pionera de una empresa emergente se transformó en una batalla abierta de plataformas en menos de dos semanas.

TypeSafe AI, fundada por Diogo Almeida tras su paso por la investigación de OpenAI y la co-invención de RLHF, abrió la categoría presentando Jev. A diferencia del entrenamiento tradicional de texto, Jev fue optimizado mediante RLCD (Reinforcement Learning for Calibrated Decisions) para generar distribuciones probabilísticas calibradas en lugar de palabras, a través de una interfaz de programación cerrada y a un costo de 0.042 dólares por millón de tokens de entrada (con salida gratuita). La empresa captó cuarenta millones de dólares en capital semilla liderado por DCVC y comenzó a levantar interés con valoraciones de diez mil millones de dólares sin haber abierto la arquitectura interna del modelo.

La respuesta de los gigantes de infraestructura fue fulminante. El equipo de Strands Agents de Amazon Web Services liberó Strands Decider 2B bajo licencia Apache 2.0. Construido sobre el torso de Qwen3.5-2B con un pointer head dedicado de un millón de parámetros, el modelo fue optimizado para ejecutarse en entornos locales sin depender de conexiones remotas. En mediciones de laboratorio reporta latencias medianas de ciento quince milisegundos en una tarjeta gráfica NVIDIA RTX 3090 y cerca de ciento cincuenta milisegundos en procesadores Apple Silicon M3 utilizando aceleración por CPU y memoria unificada.

Casi en simultáneo, Cloudflare presentó Clef (veintisiete mil millones de parámetros sobre Qwen3.8-27B) y Clef-flash (nueve mil millones sobre Qwen3.5-9B), alojados en su red perimetral de Workers AI. Cloudflare adoptó una decisión estratégica clave: diseñar sus modelos con compatibilidad directa con la interfaz de Jev, ofreciendo tres modos canónicos de consulta:

Modo de consultaTipo de dato retornadoParámetros emitidosCaso de aplicación típico
noul (o bool)Booleano probabilísticoProbabilidad calibrada de certeza (0 a 1)Guardrails de seguridad y corte de acción
choiceSelección categóricaDistribución sobre lista finita de clavesEnrutamiento de herramientas e intención
scoreEscala continuaPuntuación ponderada por confianzaPriorización de colas y evaluación de avance

En las mediciones independientes en el borde, Clef-flash alcanza una latencia mediana de treinta y nueve milisegundos en Workers AI con una ventana de contexto de sesenta y cuatro mil tokens. Aunque Cloudflare cobra 0.24 dólares por millón de tokens en su infraestructura administrada (aproximadamente seis veces la tarifa de Jev), liberó los pesos completos bajo licencia Apache 2.0 en repositorios públicos.

OpenAI respondió con un lanzamiento limitado de su Decisions API construida sobre el modelo Luna, intentando retener a los equipos de desarrollo dentro de su plataforma mediante restricciones de catálogo que aceleran la respuesta sin sacrificar comprensión multimodal ni salvaguardas de seguridad. La carrera pasó de ser una curiosidad de laboratorio a una disputa directa por el control del plano de decisión agéntico.

El peaje de la inferencia: arbitraje de cuatro centavos frente a la commoditización por subsidio

La viabilidad de una arquitectura agéntica se comprueba en la factura mensual de cómputo, no en la demostración de preventa. Evaluar un modelo de decisión exige entender el balance entre costos de llamada y volumen transaccional.

Si mantienes un agente empresarial en producción procesando diez millones de bifurcaciones mensuales con un contexto promedio de cien tokens por evaluación (mil millones de tokens de entrada), la factura en modelos generativos ligeros como GPT-5.6 Luna oscila cerca de los cuatrocientos cuarenta dólares mensuales: doscientos dólares por la entrada y doscientos cuarenta dólares adicionales en los tokens de salida del JSON estructurado. En Claude Haiku 4.5, esa misma carga alcanza los dos mil dólares netos. No parece una cifra prohibitiva para una corporación, hasta que mides el costo oculto de la latencia: diez millones de llamadas a ochocientos milisegundos representan más de dos mil doscientas horas acumuladas de espera en la tubería operativa.

Costo estimado para 10 millones de decisiones (1,000M tokens de entrada):
─────────────────────────────────────────────────────────────────────────────
Claude Haiku 4.5 (con JSON estructurado): ████████████████ $2,000.00 USD
GPT-5.6 Luna (con JSON estructurado):     ████ $440.00 USD
Cloudflare Workers AI (Clef-flash):       ██ $240.00 USD (salida sin costo)
TypeSafe Jev (API propietaria):           ▏ $42.00 USD (salida sin costo)
AWS Strands Decider 2B (Local/VPC):       ▏ $0.00 USD marginal en silicio propio

Dado que Jev no emite texto autorregresivo y solo factura la entrada a 0.042 dólares por millón de tokens, esa misma carga se reduce a cuarenta y dos dólares netos. Es un arbitraje agresivo. La estrategia de TypeSafe AI choca de frente contra una dinámica implacable de infraestructura: la commoditización por subsidio.

Cuando vendes acceso a una interfaz de programación propietaria para una tarea que no requiere inventar lenguaje, compites contra los dos mayores operadores de infraestructura de red del planeta. Para AWS y Cloudflare, la inferencia de un modelo de dos o nueve mil millones de parámetros no es un centro de utilidades aislado; es un lubricante para vender cómputo, almacenamiento y ancho de banda.

AWS no necesita cobrarte por cada decisión de Strands Decider 2B. Prefiere entregarte el modelo abierto para que levantes instancias EC2, utilices sus procesadores dedicados o ancles tus agentes a su marco de trabajo Strands Agents. Cloudflare tampoco necesita competir en márgenes mínimos de tokens; ofrece Clef en Workers AI para consolidar su plataforma perimetral y asegurar que la lógica de tus aplicaciones nunca abandone su red de borde.

Vender tokens de decisión en una API cerrada cuando los gigantes de infraestructura regalan modelos de pesos abiertos bajo licencias permisivas es una posición insostenible a mediano plazo.

En el silicio de producción, la infraestructura siempre devora al intermediario que cobra por decisiones triviales.

Topología agéntica híbrida: el patrón de compuerta discriminativa y el contrato tipado de decisión

El valor operativo de estos clasificadores radica en ubicarlos como compuerta frontal de latencia, reservando los modelos de razonamiento pesado para las tareas que justifican su consumo de cómputo.

El patrón de compuerta discriminativa (discriminative gatekeeper pattern) es una arquitectura agéntica de dos niveles donde las transiciones de estado, las validaciones de políticas y las selecciones de herramientas son resueltas en primera instancia por un modelo discriminativo de Sistema Uno en menos de cincuenta milisegundos, derivando la ejecución a modelos generativos de Sistema Dos únicamente cuando se detecta ambigüedad contextual o se requiere síntesis compleja.

Más allá de la clasificación elemental de intenciones en bandejas de entrada, la aplicación con mayor retorno operativo en arquitecturas agénticas complejas se concentra en la detección de oscilación y estancamiento de bucles (loop stalling gating) en agentes autónomos de ejecución prolongada.

En automatizaciones complejas, como agentes de ingeniería de software o reconciliación de datos financieros, los modelos de razonamiento pesado tienden a ciclarse. El agente ejecuta una acción, el sistema devuelve un error, el modelo intenta un ajuste menor, vuelve a fallar y entra en un bucle repetitivo de diez o quince pasos. Cada iteración quema tokens costosos y desperdicia minutos de procesamiento.

Con una compuerta discriminativa, el orquestador somete el diferencial de estado (trace diff) al modelo de decisión tras cada iteración en modo score. El modelo no genera explicaciones en texto. Emite un contrato numérico tipado evaluando la convergencia del agente:

{
  "checkpoint_id": "chk_8941a_trace_step_04",
  "evaluation_type": "loop_convergence",
  "verdict": "abort_and_rollback",
  "confidence": 0.941,
  "metrics": {
    "convergence_score": 0.18,
    "stalling_probability": 0.924,
    "action_redundancy": 0.89
  },
  "logprobs": {
    "proceed_execution": -4.82,
    "request_human_intervention": -1.95,
    "abort_and_rollback": -0.061
  },
  "execution_latency_ms": 37.8
}

La regla de despacho en el orquestador es determinista. Si el puntaje de convergencia cae por debajo de 0.30 y la probabilidad de estancamiento supera el 0.90 durante dos ciclos consecutivos, la compuerta corta el bucle en seco. El sistema congela la memoria del agente, revierte los cambios en el entorno y solicita intervención humana antes de que la rutina agote la cuota de inferencia.

Un segundo caso de alto impacto es la poda especulativa de herramientas (pre-flight tool pruning), un mecanismo de intercepción temprana donde un modelo discriminativo evalúa los argumentos de una llamada antes de que el orquestador toque servicios externos o despierte al modelo generativo. Clef o Strands Decider verifican en treinta y cinco milisegundos si los parámetros violan invariantes del sistema o si la consulta duplica un estado ya resuelto en la memoria intermedia. Si el modelo detecta redundancia con certeza superior a 0.95, la llamada se intercepta localmente. Tu modelo pesado ni siquiera se entera de la fricción.

Fronteras de control y calibración: umbrales de confianza para evitar falsos positivos en producción

Desplegar modelos discriminativos en flujos transaccionales exige una disciplina estricta de gobernanza. A treinta milisegundos por inferencia, un clasificador acelera el flujo si sus predicciones son precisas, pero propaga fallos en cascada si sus probabilidades están descalibradas.

En sistemas discriminativos, el fallo operativo crítico se traslada de la alucinación de texto al exceso de confianza mal calibrado. Un modelo que asigna una probabilidad de 0.99 a una clasificación incorrecta fuerza al orquestador a abortar una tarea legítima o a ejecutar una rama de código inapropiada sin dejar rastro de advertencia en los registros.

Para mitigar esa vulnerabilidad en producción, la arquitectura debe establecer umbrales de adopción divididos en tres zonas de control operativo:

Zonas de gobernanza por umbral de confianza:
─────────────────────────────────────────────────────────────────────────────
Confianza >= 0.92:    Ejecución autónoma inmediata (Vía rápida sin LLM)
Confianza 0.65 - 0.91: Enrutamiento a modelo de razonamiento (Sistema Dos)
Confianza < 0.65:     Pausa obligatoria y escalado a supervisión humana
  1. Zona de pase directo (Confianza mayor o igual a 0.92): El orquestador ejecuta la decisión sin intervención de otros modelos. La inferencia toma menos de cuarenta milisegundos y el bucle continúa su marcha.
  2. Zona de arbitraje deliberativo (Confianza entre 0.65 y 0.91): Cuando la distribución de probabilidades entre dos opciones muestra entropía elevada, el sistema retiene la acción y delega el análisis a un modelo generativo con capacidades de razonamiento. El modelo pesado solo se activa cuando el clasificador registra dispersión estadística en sus opciones.
  3. Zona de contención operativa (Confianza inferior a 0.65): Si ninguna opción alcanza significancia estadística, el sistema bloquea la transacción, preserva el estado en base de datos y genera una alerta para un operador humano.

La elección del modelo depende de tu perímetro de datos. Si operas bajo regulaciones estrictas de privacidad financiera o sanitaria donde los datos no pueden abandonar tu red interna, Strands Decider 2B desplegado en silicio local dentro de tu propia nube privada virtual representa la opción más segura y económica. Si tu prioridad es coordinar agentes distribuidos geográficamente con latencias mínimas sin gestionar servidores, Clef-flash en Workers AI ofrece una ventaja operativa indiscutible.

Los modelos generativos resuelven la síntesis de contexto y la interacción con personas. En el control de flujo interno, la prevención de bucles ciegos y la validación de herramientas, la estabilidad de producción depende de componentes que discriminen en milisegundos, devuelvan tipado estricto y no consuman ancho de banda innecesario.

#Modelos de Decisión#AWS Strands#Cloudflare Workers AI#Latencia Agéntica#Costos de Inferencia
Retrato ilustrado de Mariemily Silva
Quién escribe Mariemily Silva

Intelligent Automation Engineer en Santiago de Chile. Construye agentes autónomos con Hermes Agent, n8n, OpenClaw, Antigravity y Claude Code, y automatizaciones híbridas que unen RPA con modelos de lenguaje. UiPath Certified Advanced RPA Developer (UiARD).