Un agente puede explicar correctamente qué está fallando y, aun así, tomar una decisión cara, tardía o insuficiente. Ese es el problema que intenta aislar STOCKTAKE: separar el fallo de percepción —no entender el mundo— del fallo de control —entenderlo y actuar mal—.
Qué ha pasado exactamente
Los investigadores Sagar Deb y Ashwanth Krishnan publicaron en arXiv STOCKTAKE, un benchmark que coloca al agente al frente del reaprovisionamiento de un importador durante 26 semanas. Cada semana recibe señales ruidosas sobre demanda, proveedores, fletes, puerto, calidad y estado del canal, pero nunca ve directamente los seis factores ocultos que generan esos síntomas.
La prueba se ejecutó con Claude Sonnet 5, GPT-5.4, DeepSeek-V4-Pro y Grok 4.5 sobre 50 escenarios cada uno: 200 episodios completos. Los cuatro detectaron entre el 84% y el 88% de los episodios de estrés y normalmente los nombraron en la misma semana o en la siguiente. Hasta ahí, la percepción fue parecida.
La diferencia apareció al actuar. El benchmark sitúa el coste de cada agente entre una regla base que ignora los síntomas —puntuación 0— y una política bayesiana que recibe exactamente las mismas observaciones —puntuación 1—. GPT-5.4 obtuvo 0,62 y Claude Sonnet 5, 0,49. DeepSeek-V4-Pro quedó en −0,23 y Grok 4.5 en −0,13: en conjunto, una regla ciega habría costado menos que sus decisiones.
Los agentes vieron casi los mismos problemas. La diferencia apareció en la política de acción.
Resultados: STOCKTAKE, arXiv:2607.13618v1 · 200 episodios · 15.07.2026
≠ misma acción
Observar
El agente recibe síntomas, contexto y costes, no el estado real del mundo.
Control: datos y señales trazablesDiagnosticar
Los modelos nombraron la mayoría de los fallos y lo hicieron pronto.
Control: evidencia y nivel de confianzaDecidir
Una creencia correcta puede acabar en falta de acción o en una respuesta demasiado cara.
Control: política, coste y umbralesVerificar
La acción solo cuenta si cumple el resultado esperado sin romper los límites.
Control: test, aprobación y reversiónPor qué importa fuera de un almacén simulado
Muchas empresas evalúan un agente preguntando si «entiende» el proceso o si su razonamiento suena convincente. STOCKTAKE muestra por qué esa revisión es insuficiente: el texto puede describir bien el problema mientras la acción elegida destruye margen, llega tarde o protege tanto el sistema que termina costando más que el riesgo.
En los escenarios de estrés persistente, entre el 34% y el 43% de las semanas correctamente diagnosticadas acabaron igualmente en rotura de stock. Los autores advierten que una parte se explica porque las semanas más graves son también más fáciles de detectar. Además, el fallo no fue solo «hacer poco»: algunas trazas muestran respuestas excesivas cuyo coste superó el daño que evitaban.
Hecho del estudio
Hecho del estudioLa detección fue uniforme, pero dos modelos acabaron por debajo de una política base que ignoraba todas las señales ocultas.
Lectura DÍA UNO
Lectura DÍA UNOAntes de dar autonomía, hay que evaluar por separado lo que el agente percibe, lo que decide, lo que ejecuta y cuánto cuesta corregirlo.
Qué haríamos antes de dejar un proceso en manos de un agente
- Escribe la política, no solo el objetivo.
Define qué acciones están permitidas, qué coste máximo pueden asumir y qué condiciones obligan a pedir aprobación.
- Evalúa diagnóstico y acción por separado.
Puntúa si detectó correctamente el estado y, después, si eligió la intervención adecuada. Una explicación acertada no debe ocultar un mal resultado.
- Incluye una regla base.
Compara el agente con el proceso actual o con una heurística sencilla. Si no supera la alternativa más barata, todavía no hay caso para automatizar.
- Mide el coste de proteger.
Registra tokens, llamadas, retrasos, retrabajo y consecuencias. Evitar un error de 100 euros gastando 500 no es una victoria.
- Ensaya estrés y reversión.
Prueba escenarios persistentes y combinados, documenta la señal de parada y verifica que una persona pueda recuperar el control.
Para convertir esa evaluación en un sistema real, esta edición ofrece dos piezas complementarias: un patrón de experimento limitado y reversible inspirado en el Sandbox financiero y un registro mínimo para saber qué activos de IA existen y quién puede detenerlos.
Qué sabemos y qué sigue abierto
| Estado | Qué podemos afirmar |
|---|---|
| Confirmado | El manuscrito describe 200 episodios completos, cuatro modelos, 50 semillas y un horizonte de 26 semanas. |
| Resultado | Los cuatro modelos detectaron entre el 84% y el 88% de los episodios ocultos, pero sus puntuaciones de decisión divergieron. |
| Limitado | Es un preprint, el entorno es sintético y el oráculo conoce los parámetros generativos exactos, aunque no el estado oculto. |
| No demostrado | Que la misma brecha tenga igual magnitud en una empresa real, con otras herramientas, modelos y costes. |
Fuentes y método
- Fuente primariaSTOCKTAKE: ficha, autores, fecha y resumen en arXiv
- Documento completoSTOCKTAKE: metodología, tablas de resultados, limitaciones y trazas
- Licencia del documentoCreative Commons Attribution 4.0
- Imagen editorialKseniia Ilinykh · operario en un almacén · Unsplash