El gobierno operativo de agentes de IA es el sistema de decisiones que define quién es responsable, qué datos y herramientas puede usar un agente, qué acciones requieren aprobación, cuándo debe parar y qué evidencia demuestra si el trabajo fue correcto. No es una certificación legal ni un dashboard: es la forma de hacer que la autonomía tenga límites y dueño.
La pregunta no es «¿qué modelo usamos?». Es «¿quién responde si el agente se equivoca, qué puede tocar y cómo lo detenemos antes de que el error salga del sistema?».
Esta guía convierte gobierno, seguridad y observabilidad en decisiones operativas que una empresa puede revisar antes de ampliar autonomía.
Qué significa gobernar un agente en el trabajo real
Una política general no basta si nadie puede aplicarla a un flujo concreto. Empieza por una acción observable: preparar una respuesta, cambiar un registro, publicar un documento, enviar un correo o ejecutar una operación. Para cada acción, deja estas decisiones por escrito:
| Decisión | Pregunta operativa | Evidencia mínima |
|---|---|---|
| Propiedad | ¿Quién responde por el resultado, el permiso y la pausa? | Responsable, sustituto y ruta de escalado. |
| Identidad y acceso | ¿Con qué identidad actúa y qué puede leer, escribir o enviar? | Inventario de herramientas, alcance y acceso mínimo. |
| Autonomía | ¿Qué prepara, qué ejecuta con límites y qué debe detener? | Niveles de autonomía y condiciones explícitas. |
| Aprobación | ¿Qué persona decide antes de una acción difícil de deshacer? | Vista previa, payload, responsable, caducidad y decisión. |
| Observabilidad | ¿Qué ocurrió, con qué datos, herramientas y versión? | Traza suficiente para reconstruir la ejecución sin guardar PII innecesaria. |
| Resultado | ¿Cómo sabemos que el trabajo es correcto y útil? | Criterio de aceptación, muestra, errores y retrabajo. |
| Ciclo de vida | ¿Quién revisa cambios, incidentes y retirada del agente? | Revisión periódica, historial de versiones y condición de apagado. |
No es lo mismo que seguridad, compliance u observabilidad
Estas disciplinas se complementan, pero no responden a la misma pregunta. Mezclarlas hace que una empresa compre herramientas sin decidir cómo debe funcionar el trabajo.
| Disciplina | Pregunta que responde | Qué añade el gobierno operativo |
|---|---|---|
| Seguridad | ¿Puede una identidad acceder a un sistema o dato? | Qué acción concreta puede ejecutar el agente y cuándo debe bloquearse. |
| Compliance / legal | ¿Qué obligaciones y riesgos normativos aplican? | Cómo preparar evidencia y cuándo escalar a un especialista jurídico. |
| Observabilidad | ¿Qué hizo el sistema y dónde falló? | Quién decide, qué permiso tenía y qué cambio se permite después. |
| Orquestación | ¿Cómo se coordinan agentes, personas y handoffs? | Qué reglas, propietarios y controles hacen esa coordinación responsable. |
Microsoft separa precisamente propiedad, identidad, ciclo de vida y observabilidad de las capas de datos, seguridad y desarrollo. NIST, por su parte, propone gobernar, mapear, medir y gestionar como funciones conectadas. Son marcos útiles para orientar la conversación, no una receta automática para cada empresa.
La diferencia se ve mejor en casos reales: las nuevas medidas europeas de seguridad y transparencia de la IA abren obligaciones y preguntas de gobierno; los incidentes de agentes que ejecutan comandos destructivos obligan además a diseñar permisos, parada y recuperación. Incluso una predicción como la de Demis Hassabis sobre la AGI debe separarse de una norma vigente o de una capacidad ya demostrada.
La ficha mínima de gobierno de un flujo
Antes de instalar otra plataforma, crea una ficha de una página para el flujo que quieres mejorar:
- Resultado: qué significa que el trabajo esté bien hecho y para quién.
- Entradas: qué datos puede usar, qué fuentes son válidas y qué información no debe entrar.
- Acciones: qué herramientas puede llamar y qué cambios puede realizar.
- Propietario: quién responde, puede corregir instrucciones y puede apagar el flujo.
- Autonomía: qué casos prepara, cuáles ejecuta con límites y cuáles escalan.
- Aprobación: qué debe ver la persona, qué decide y qué ocurre si rechaza.
- Traza y medida: qué queda registrado y qué métrica conecta actividad con resultado correcto.
Si no puedes rellenar esta ficha, todavía no tienes un problema de «elegir el mejor agente». Tienes un problema de definición del trabajo, permisos o responsabilidad.
Tres carriles de autonomía para empezar sin engañarte
| Carril | Qué hace el agente | Control necesario |
|---|---|---|
| Preparar | Reúne contexto y propone una acción. | La persona ejecuta; se mide calidad y tiempo de revisión. |
| Ejecutar con límites | Resuelve casos de bajo riesgo dentro de una regla estable. | Alcance cerrado, registro, muestra de calidad y salida ante excepción. |
| Escalar o parar | Se detiene antes de una escritura externa, acción irreversible o incertidumbre crítica. | Vista previa, aprobación informada, ruta de escalado y condición de reanudación. |
No todo necesita una aprobación humana. Si se revisa cada paso, la persona acaba aceptando sin leer. Si no se revisa nada, el equipo no puede explicar acciones relevantes. La decisión correcta depende de reversibilidad, impacto, datos, permisos y evidencia del resultado.
Qué debe ocurrir cuando una persona dice “no”
Un rechazo no es un error que el agente deba esquivar. Debe quedar asociado a una operación, mostrar qué iba a cambiar y definir qué ocurre después: corregir datos, pedir una aclaración, devolver el caso al responsable o cerrar la ejecución.
También hay que limitar reintentos, tiempo y coste. Si el agente vuelve a proponer la misma acción con otras palabras, la aprobación se convierte en una ficción. El sistema debe detectar ese patrón y parar.
Cómo medir si el gobierno está funcionando
El objetivo no es acumular logs ni demostrar que el agente ha trabajado mucho. Es saber si el flujo produce mejores resultados con un riesgo y un coste que la empresa acepta.
| Medida | Qué responde | Qué no demuestra por sí sola |
|---|---|---|
| Resultado correcto | ¿Cumple el criterio de aceptación? | Que el proceso sea rentable o seguro en todos los casos. |
| Revisión y retrabajo | ¿Cuánto trabajo humano queda? | Que menos revisión siempre sea mejor. |
| Excepciones y paradas | ¿Dónde se sale del alcance? | Que el agente deba ganar más autonomía. |
| Tiempo de ciclo | ¿Se termina antes sin degradar calidad? | Que la velocidad compense el coste total. |
| Coste por resultado correcto | ¿Cuánto cuesta producir algo útil? | Que el número de ejecuciones sea valor. |
La guía de observabilidad de agentes entra en trazas y reconstrucción de ejecuciones; la de ROI de agentes ayuda a conectar coste, revisión, retrabajo y resultado.
Qué puede aportar DÍA UNO
DÍA UNO no instala una capa de compliance universal ni certifica una empresa. Un diagnóstico operativo puede ayudar a convertir un flujo confuso en una decisión acotada:
- Mapa del trabajo actual, responsables, datos, herramientas y handoffs.
- Inventario de autonomía y permisos con acciones que deben parar.
- Diseño de aprobación, escalado, reversión y traza.
- Métrica de resultado correcto, revisión, excepciones y coste.
- Primer experimento con responsable, ventana y condición de parada.
Si el problema es principalmente jurídico, de seguridad de infraestructura o de protección de datos, hay que involucrar al especialista correspondiente. Si es un problema de coordinación de personas, agentes y procesos, consulta la guía de orquestación. Si necesitas revisar un sistema existente, la auditoría operativa entra en objetivos, permisos, aprobaciones y evidencia.
Cuándo no conviene crear otro agente
- El proceso no tiene dueño ni una definición común de «terminado».
- Una automatización determinista resolvería el caso con menos riesgo y coste.
- Los datos de entrada son incompletos y nadie ha definido cómo se corrigen.
- La empresa no puede revisar ni detener la acción en producción.
- El éxito se mide por tareas, tokens o demos y no por un resultado correcto.
Ordenar primero no retrasa la IA: evita escalar una confusión más deprisa.
Fuentes y límites
Esta guía traduce marcos públicos y problemas observados en preguntas de diseño operativo. No es asesoramiento legal, certificación, auditoría financiera ni garantía de seguridad o rendimiento. La aplicación depende del proceso, los datos, los permisos y las obligaciones de cada empresa.