← Volver a Noticias

Agentes de IA · evaluación · análisis DÍA UNO

STOCKTAKE: medir la brecha entre percepción y acción en agentes LLM con un oráculo justo

Cuatro modelos detectaron entre el 84% y el 88% de los fallos ocultos. Aun así, dos rindieron peor que una regla que ignoraba todos los síntomas. El cuello de botella no siempre está en entender: también está en decidir.

Operario revisa existencias en las estanterías de un almacén
Imagen editorial contextual Reconocer un problema de inventario no garantiza elegir la acción correcta. Fotografía: Kseniia Ilinykh · Unsplash ↗
Prepublicación · fuente primariaDeb y Krishnan · QpiAI · 15.07.2026Abrir publicación ↗

Un agente puede explicar correctamente qué está fallando y, aun así, tomar una decisión cara, tardía o insuficiente. Ese es el problema que intenta aislar STOCKTAKE: separar el fallo de percepción —no entender el mundo— del fallo de control —entenderlo y actuar mal—.

VerificadoDiseño, resultados y trazas publicados
InterpretaciónAplicación a procesos empresariales reales
AbiertoReplicación fuera del simulador y revisión por pares

Qué ha pasado exactamente

Los investigadores Sagar Deb y Ashwanth Krishnan publicaron en arXiv STOCKTAKE, un benchmark que coloca al agente al frente del reaprovisionamiento de un importador durante 26 semanas. Cada semana recibe señales ruidosas sobre demanda, proveedores, fletes, puerto, calidad y estado del canal, pero nunca ve directamente los seis factores ocultos que generan esos síntomas.

La prueba se ejecutó con Claude Sonnet 5, GPT-5.4, DeepSeek-V4-Pro y Grok 4.5 sobre 50 escenarios cada uno: 200 episodios completos. Los cuatro detectaron entre el 84% y el 88% de los episodios de estrés y normalmente los nombraron en la misma semana o en la siguiente. Hasta ahí, la percepción fue parecida.

La diferencia apareció al actuar. El benchmark sitúa el coste de cada agente entre una regla base que ignora los síntomas —puntuación 0— y una política bayesiana que recibe exactamente las mismas observaciones —puntuación 1—. GPT-5.4 obtuvo 0,62 y Claude Sonnet 5, 0,49. DeepSeek-V4-Pro quedó en −0,23 y Grok 4.5 en −0,13: en conjunto, una regla ciega habría costado menos que sus decisiones.

FIG. 01 · Saber no es hacer

Los agentes vieron casi los mismos problemas. La diferencia apareció en la política de acción.

Resultados: STOCKTAKE, arXiv:2607.13618v1 · 200 episodios · 15.07.2026

Observar

El agente recibe síntomas, contexto y costes, no el estado real del mundo.

Control: datos y señales trazables

Diagnosticar

Los modelos nombraron la mayoría de los fallos y lo hicieron pronto.

Control: evidencia y nivel de confianza

Decidir

Una creencia correcta puede acabar en falta de acción o en una respuesta demasiado cara.

Control: política, coste y umbrales

Verificar

La acción solo cuenta si cumple el resultado esperado sin romper los límites.

Control: test, aprobación y reversión
La escala compara cada agente con una regla base que no lee síntomas (0) y un oráculo bayesiano con el mismo flujo de observaciones (1). No es una clasificación general de modelos.

Por qué importa fuera de un almacén simulado

Muchas empresas evalúan un agente preguntando si «entiende» el proceso o si su razonamiento suena convincente. STOCKTAKE muestra por qué esa revisión es insuficiente: el texto puede describir bien el problema mientras la acción elegida destruye margen, llega tarde o protege tanto el sistema que termina costando más que el riesgo.

En los escenarios de estrés persistente, entre el 34% y el 43% de las semanas correctamente diagnosticadas acabaron igualmente en rotura de stock. Los autores advierten que una parte se explica porque las semanas más graves son también más fáciles de detectar. Además, el fallo no fue solo «hacer poco»: algunas trazas muestran respuestas excesivas cuyo coste superó el daño que evitaban.

Hecho del estudio

Hecho del estudio

La detección fue uniforme, pero dos modelos acabaron por debajo de una política base que ignoraba todas las señales ocultas.

Lectura DÍA UNO

Lectura DÍA UNO

Antes de dar autonomía, hay que evaluar por separado lo que el agente percibe, lo que decide, lo que ejecuta y cuánto cuesta corregirlo.

Qué haríamos antes de dejar un proceso en manos de un agente

  1. Escribe la política, no solo el objetivo.

    Define qué acciones están permitidas, qué coste máximo pueden asumir y qué condiciones obligan a pedir aprobación.

  2. Evalúa diagnóstico y acción por separado.

    Puntúa si detectó correctamente el estado y, después, si eligió la intervención adecuada. Una explicación acertada no debe ocultar un mal resultado.

  3. Incluye una regla base.

    Compara el agente con el proceso actual o con una heurística sencilla. Si no supera la alternativa más barata, todavía no hay caso para automatizar.

  4. Mide el coste de proteger.

    Registra tokens, llamadas, retrasos, retrabajo y consecuencias. Evitar un error de 100 euros gastando 500 no es una victoria.

  5. Ensaya estrés y reversión.

    Prueba escenarios persistentes y combinados, documenta la señal de parada y verifica que una persona pueda recuperar el control.

Para convertir esa evaluación en un sistema real, esta edición ofrece dos piezas complementarias: un patrón de experimento limitado y reversible inspirado en el Sandbox financiero y un registro mínimo para saber qué activos de IA existen y quién puede detenerlos.

Qué sabemos y qué sigue abierto

EstadoQué podemos afirmar
ConfirmadoEl manuscrito describe 200 episodios completos, cuatro modelos, 50 semillas y un horizonte de 26 semanas.
ResultadoLos cuatro modelos detectaron entre el 84% y el 88% de los episodios ocultos, pero sus puntuaciones de decisión divergieron.
LimitadoEs un preprint, el entorno es sintético y el oráculo conoce los parámetros generativos exactos, aunque no el estado oculto.
No demostradoQue la misma brecha tenga igual magnitud en una empresa real, con otras herramientas, modelos y costes.

Fuentes y método

Empieza gratis

Recibe tu informe operativo al terminar.

Responde el test y la IA te devuelve al instante el mismo informe que ves aquí a la derecha: nota por áreas, el cuello de botella exacto y tus tres siguientes pasos.

  1. 1
    Tu nota de madurez, área por áreaRumbo, Equipo, Procesos, Ejecución e Información evaluados por separado.
  2. 2
    El cuello de botella que te cuesta dinero hoyPunto exacto donde se atasca la operación, no un diagnóstico genérico.
  3. 3
    Tres pasos concretos para los próximos 90 díasPrioridad, orden y qué desbloquea cada movimiento antes de sumar IA.
Hacer el test SIN TARJETA · INFORME AL INSTANTE

Mañana, otra noticia. Con contexto.

Recibe el resumen diario y las piezas que merezcan una explicación visual completa.