← Academy

Medición de agentes

Cómo medir el ROI de un agente de IA sin inflar el resultado

Equipo DÍA UNO·11 de julio de 2026·6 min de lectura

El ROI de un agente no se demuestra contando ejecuciones, tokens ni horas teóricas. Se demuestra comparando un proceso real antes y después, incluyendo el coste completo, la calidad del resultado, el retrabajo y la revisión humana que todavía hace falta.

No existe un porcentaje de ROI que sirva para todas las pymes. Un agente puede parecer barato por ejecución y, aun así, salir caro si falla, obliga a rehacer trabajo o introduce un riesgo que nadie estaba midiendo. La unidad útil no es «una llamada al modelo»: es un resultado de negocio correcto y verificable.

Trabajo entrada real Agente ejecuta Verificación persona o regla ✓ resultado correcto esto es lo que se cuenta ↺ retrabajo esto también cuesta
FIG. 01 — La unidad que importa: el resultado que supera la verificación. El retrabajo forma parte del coste.

Primero: define qué resultado cuenta como correcto

Elige una unidad que el negocio pueda comprobar sin debatirla cada semana. Debe tener un dueño, una fuente de evidencia y una condición de aceptación. No empieces por «ahorrar tiempo»: empieza por el trabajo que debe terminar bien.

  • Una incidencia resuelta sin reapertura dentro del periodo que defina el equipo.
  • Una factura preparada correctamente y aprobada con las reglas vigentes.
  • Una reunión realmente agendada a partir de un lead que cumplía los criterios acordados.
  • Un informe entregado que pasa una revisión definida, no solo un texto generado.

OpenAI recomienda convertir el objetivo del negocio en un flujo completo, definir qué significa éxito en cada decisión y medir el sistema en condiciones parecidas a las reales. La evaluación no es una demo: es la forma de encontrar cuándo y por qué falla el proceso.

Construye una línea base antes de celebrar el piloto

La línea base describe el proceso sin el agente. No hace falta medir todo; hace falta medir lo que permite decidir. Recoge varios ciclos normales, excepciones incluidas, para que el cambio no se atribuya a una semana especialmente fácil.

Qué medirCómo registrarloQué evita confundir
Volumen útilResultados que entran y salen del procesoUn piloto con poca carga frente al trabajo normal
Tiempo de cicloDesde la entrada hasta la aceptaciónVelocidad de una tarea frente a tiempo total
CalidadAceptado, corregido, reabierto o rechazadoUn resultado rápido pero incorrecto
Intervención humanaRevisión, escalado, edición y aprobaciónTrabajo humano que desaparece de la cuenta
Resultado de negocioLa evidencia que define el caso: cobro, resolución, reunión o entregaActividad técnica presentada como valor

Cuenta el coste total, no solo el modelo

Los tokens son una parte del coste, no el coste completo. Para decidir si un agente merece escalarse, suma el tiempo de diseño, integración y mantenimiento, las herramientas, el consumo de modelo, las revisiones, los errores, el retrabajo y las incidencias. Si interviene una persona para comprobar la salida, ese tiempo sigue formando parte del proceso.

lo que se suele mirar Tokens / modelo Diseño e integración Revisión humana y aprobaciones Errores, retrabajo e incidencias El coste real vive debajo de la línea: coste por resultado correcto, no por token.
FIG. 02 — Coste total: lo que va debajo de la línea es lo que decide si el agente compensa.

Google Cloud propone usar el coste por tarea exitosa, porque el coste por token puede hacer parecer eficiente a un agente que ejecuta barato pero falla con frecuencia. NIST también plantea documentar beneficios y costes frente a referencias apropiadas, incluidos los costes no monetarios que aparecen por errores o falta de fiabilidad.

Mide la calidad y la fricción de revisión

Un agente útil no solo llega a una respuesta: reduce el trabajo que hace falta para llevar esa respuesta a un estado aceptable. Registra al menos estas cuatro señales:

  • Tasa de resultado correcto: resultados aceptados sin corrección sustantiva / resultados evaluados.
  • Coste por resultado correcto: coste total del periodo / resultados correctos.
  • Fricción de revisión: tiempo humano de revisar, editar, revertir o escalar.
  • Fallos por tipo: datos equivocados, uso incorrecto de una herramienta, aprobación incompleta, retraso o excepción no resuelta.

La revisión humana no debe convertirse en una excusa para un diseño deficiente. OpenAI aconseja mantener a especialistas de dominio revisando muestras y logs; la AEPD también destaca la necesidad de criterios claros, trazabilidad y evaluación continua basada en evidencias cuando se usan sistemas de IA agéntica.

Una fórmula conservadora para no contar dos veces el valor

Separa tres cosas que suelen mezclarse:

Tipo de valorCuándo cuentaCuándo no debes convertirlo en ahorro
Ahorro de cajaExiste una reducción demostrable de gasto o coste evitableEl equipo sigue teniendo el mismo coste y no se elimina ni evita ningún gasto
Capacidad liberadaQueda tiempo disponible para una prioridad concreta y se registra su usoLas horas «ahorradas» no se reasignan ni cambian un resultado de negocio
Margen o ingreso incrementalHay una relación demostrable con ventas, cobros, retención o producción adicionalLa mejora coincide con otros cambios y no se puede atribuir de forma razonable

Con esa separación, usa esta fórmula como disciplina de cálculo: ROI (%) = (valor atribuible bruto − coste total del agente) / coste total del agente × 100. La capacidad liberada no entra en el numerador hasta que produzca un valor económico observado. Si no puedes demostrar todavía el valor atribuible bruto, no fuerces un porcentaje: presenta el piloto como capacidad, fiabilidad y aprendizaje, y decide qué evidencia falta.

El coste de infraestructura tampoco es una constante universal. La moratoria de Nueva York sobre determinados centros de datos hiperescalables muestra que energía, agua, permisos y dependencia regional pueden cambiar el coste y el riesgo de una decisión técnica.

Decide: escalar, corregir o pausar

Estas reglas no sustituyen el criterio del negocio; obligan a que ese criterio sea visible.

  • Escalar: el resultado correcto se mantiene en casos representativos, la revisión humana es asumible, el coste por resultado mejora o queda dentro del límite acordado y los riesgos están controlados.
  • Corregir: el valor potencial existe, pero puedes nombrar un fallo concreto: datos incompletos, herramienta equivocada, criterio de aceptación ambiguo o escalado humano demasiado tarde.
  • Pausar: no puedes verificar el resultado, la calidad no alcanza el mínimo, el coste total no compensa o el proceso expone un riesgo que aún no sabes gobernar.

Antes de añadir más agentes, revisa si el flujo necesita una automatización determinista, un único agente mejor definido o una arquitectura más compleja. Esta guía explica esa decisión; la guía de orquestación cubre roles, permisos, traspasos y verificación.

Plantilla mínima para revisar cada semana

CampoEjemplo de pregunta
Resultado verificable¿Qué entrega debe quedar bien y dónde se comprueba?
Línea base¿Cómo medíamos tiempo, coste, errores y revisión antes?
Coste total¿Qué ha costado construir, operar, supervisar y corregir?
Calidad¿Qué porcentaje se acepta sin cambios sustantivos?
Riesgo y control¿Qué puede hacer el agente, quién lo aprueba y cómo se revoca?
Decisión siguiente¿Qué evidencia justifica escalar, corregir o pausar?

Fuentes y límites

Esta guía no ofrece un benchmark universal ni asesoramiento financiero o legal. Es un marco para medir un proceso concreto. El caso de uso, las fuentes de datos, la revisión humana y el riesgo determinan qué métricas importan.

Empieza gratis

Recibe tu informe operativo en 8 minutos.

Responde el test y la IA te devuelve al instante el mismo informe que ves aquí al lado: nota por áreas, el cuello de botella exacto y tus tres siguientes pasos.

  1. 1
    Tu nota de madurez, área por áreaRumbo, Equipo, Procesos, Ejecución e Información evaluados por separado.
  2. 2
    El cuello de botella que te cuesta dinero hoyPunto exacto donde se atasca la operación, no un diagnóstico genérico.
  3. 3
    Tres pasos concretos para los próximos 90 díasPrioridad, orden y qué desbloquea cada movimiento antes de sumar IA.
Hacer el test 8 MIN · SIN TARJETA · INFORME AL INSTANTE