El ROI de un agente no se demuestra contando ejecuciones, tokens ni horas teóricas. Se demuestra comparando un proceso real antes y después, incluyendo el coste completo, la calidad del resultado, el retrabajo y la revisión humana que todavía hace falta.
No existe un porcentaje de ROI que sirva para todas las pymes. Un agente puede parecer barato por ejecución y, aun así, salir caro si falla, obliga a rehacer trabajo o introduce un riesgo que nadie estaba midiendo. La unidad útil no es «una llamada al modelo»: es un resultado de negocio correcto y verificable.
Primero: define qué resultado cuenta como correcto
Elige una unidad que el negocio pueda comprobar sin debatirla cada semana. Debe tener un dueño, una fuente de evidencia y una condición de aceptación. No empieces por «ahorrar tiempo»: empieza por el trabajo que debe terminar bien.
- Una incidencia resuelta sin reapertura dentro del periodo que defina el equipo.
- Una factura preparada correctamente y aprobada con las reglas vigentes.
- Una reunión realmente agendada a partir de un lead que cumplía los criterios acordados.
- Un informe entregado que pasa una revisión definida, no solo un texto generado.
OpenAI recomienda convertir el objetivo del negocio en un flujo completo, definir qué significa éxito en cada decisión y medir el sistema en condiciones parecidas a las reales. La evaluación no es una demo: es la forma de encontrar cuándo y por qué falla el proceso.
Construye una línea base antes de celebrar el piloto
La línea base describe el proceso sin el agente. No hace falta medir todo; hace falta medir lo que permite decidir. Recoge varios ciclos normales, excepciones incluidas, para que el cambio no se atribuya a una semana especialmente fácil.
| Qué medir | Cómo registrarlo | Qué evita confundir |
|---|---|---|
| Volumen útil | Resultados que entran y salen del proceso | Un piloto con poca carga frente al trabajo normal |
| Tiempo de ciclo | Desde la entrada hasta la aceptación | Velocidad de una tarea frente a tiempo total |
| Calidad | Aceptado, corregido, reabierto o rechazado | Un resultado rápido pero incorrecto |
| Intervención humana | Revisión, escalado, edición y aprobación | Trabajo humano que desaparece de la cuenta |
| Resultado de negocio | La evidencia que define el caso: cobro, resolución, reunión o entrega | Actividad técnica presentada como valor |
Cuenta el coste total, no solo el modelo
Los tokens son una parte del coste, no el coste completo. Para decidir si un agente merece escalarse, suma el tiempo de diseño, integración y mantenimiento, las herramientas, el consumo de modelo, las revisiones, los errores, el retrabajo y las incidencias. Si interviene una persona para comprobar la salida, ese tiempo sigue formando parte del proceso.
Google Cloud propone usar el coste por tarea exitosa, porque el coste por token puede hacer parecer eficiente a un agente que ejecuta barato pero falla con frecuencia. NIST también plantea documentar beneficios y costes frente a referencias apropiadas, incluidos los costes no monetarios que aparecen por errores o falta de fiabilidad.
Mide la calidad y la fricción de revisión
Un agente útil no solo llega a una respuesta: reduce el trabajo que hace falta para llevar esa respuesta a un estado aceptable. Registra al menos estas cuatro señales:
- Tasa de resultado correcto: resultados aceptados sin corrección sustantiva / resultados evaluados.
- Coste por resultado correcto: coste total del periodo / resultados correctos.
- Fricción de revisión: tiempo humano de revisar, editar, revertir o escalar.
- Fallos por tipo: datos equivocados, uso incorrecto de una herramienta, aprobación incompleta, retraso o excepción no resuelta.
La revisión humana no debe convertirse en una excusa para un diseño deficiente. OpenAI aconseja mantener a especialistas de dominio revisando muestras y logs; la AEPD también destaca la necesidad de criterios claros, trazabilidad y evaluación continua basada en evidencias cuando se usan sistemas de IA agéntica.
Una fórmula conservadora para no contar dos veces el valor
Separa tres cosas que suelen mezclarse:
| Tipo de valor | Cuándo cuenta | Cuándo no debes convertirlo en ahorro |
|---|---|---|
| Ahorro de caja | Existe una reducción demostrable de gasto o coste evitable | El equipo sigue teniendo el mismo coste y no se elimina ni evita ningún gasto |
| Capacidad liberada | Queda tiempo disponible para una prioridad concreta y se registra su uso | Las horas «ahorradas» no se reasignan ni cambian un resultado de negocio |
| Margen o ingreso incremental | Hay una relación demostrable con ventas, cobros, retención o producción adicional | La mejora coincide con otros cambios y no se puede atribuir de forma razonable |
Con esa separación, usa esta fórmula como disciplina de cálculo: ROI (%) = (valor atribuible bruto − coste total del agente) / coste total del agente × 100. La capacidad liberada no entra en el numerador hasta que produzca un valor económico observado. Si no puedes demostrar todavía el valor atribuible bruto, no fuerces un porcentaje: presenta el piloto como capacidad, fiabilidad y aprendizaje, y decide qué evidencia falta.
El coste de infraestructura tampoco es una constante universal. La moratoria de Nueva York sobre determinados centros de datos hiperescalables muestra que energía, agua, permisos y dependencia regional pueden cambiar el coste y el riesgo de una decisión técnica.
Decide: escalar, corregir o pausar
Estas reglas no sustituyen el criterio del negocio; obligan a que ese criterio sea visible.
- Escalar: el resultado correcto se mantiene en casos representativos, la revisión humana es asumible, el coste por resultado mejora o queda dentro del límite acordado y los riesgos están controlados.
- Corregir: el valor potencial existe, pero puedes nombrar un fallo concreto: datos incompletos, herramienta equivocada, criterio de aceptación ambiguo o escalado humano demasiado tarde.
- Pausar: no puedes verificar el resultado, la calidad no alcanza el mínimo, el coste total no compensa o el proceso expone un riesgo que aún no sabes gobernar.
Antes de añadir más agentes, revisa si el flujo necesita una automatización determinista, un único agente mejor definido o una arquitectura más compleja. Esta guía explica esa decisión; la guía de orquestación cubre roles, permisos, traspasos y verificación.
Plantilla mínima para revisar cada semana
| Campo | Ejemplo de pregunta |
|---|---|
| Resultado verificable | ¿Qué entrega debe quedar bien y dónde se comprueba? |
| Línea base | ¿Cómo medíamos tiempo, coste, errores y revisión antes? |
| Coste total | ¿Qué ha costado construir, operar, supervisar y corregir? |
| Calidad | ¿Qué porcentaje se acepta sin cambios sustantivos? |
| Riesgo y control | ¿Qué puede hacer el agente, quién lo aprueba y cómo se revoca? |
| Decisión siguiente | ¿Qué evidencia justifica escalar, corregir o pausar? |
Fuentes y límites
Esta guía no ofrece un benchmark universal ni asesoramiento financiero o legal. Es un marco para medir un proceso concreto. El caso de uso, las fuentes de datos, la revisión humana y el riesgo determinan qué métricas importan.