← Todos los insights

Guía de arquitecturaEnfoque: España y Latinoamérica5 min de lectura

Los guardrails de agentes no son una capa. Son seis autoridades, y nadie debería tenerlas todas

Identidad, acceso a modelos, contención, secuencia, aprobación y gasto responden a preguntas distintas. Los lanzamientos de la semana muestran su separación y cómo decidir quién posee cada una.

Escuche este artículo · 6 min

Narración completa del artículo, generada con IA.

Una fila de interruptores automáticos en un panel eléctrico, en duotono de La Madre, junto a las palabras Autoridades separadas
Foto: Michal Jarmoluk (StockSnap, CC0)

Pregunte a un equipo empresarial cómo se gobiernan sus agentes de IA y la respuesta suele ser una palabra: guardrails. Pregunte qué es un guardrail y las respuestas divergen. Para una persona es un filtro en la salida del modelo. Para otra es una línea en el prompt del sistema. Para una tercera es la pantalla de permisos de la plataforma.

Mientras tanto, en una sola semana, los proveedores lanzaron controles para agentes desde al menos seis direcciones diferentes, y casi ninguno es un guardrail en ninguno de esos sentidos. Leídos en conjunto, sugieren que la gobernanza de agentes no es una capa. Es un conjunto de autoridades separadas, cada una respondiendo a una pregunta diferente, y la decisión de diseño más importante es quién posee cada una.

Una semana, seis autoridades

Identidad: ¿quién es este agente y quién responde por él? RSA anunció Agent ID el 7 de octubre para descubrir agentes, registrarlos con propietarios nombrados, niveles de riesgo y estados de ciclo de vida, aplicar políticas en gateways de IA y MCP con aprobación fuera de banda, certificar su acceso de forma continua y revocarlo al desmantelarlo. El módulo de descubrimiento y seguridad está previsto para disponibilidad general el 16 de noviembre; el módulo de gobernanza en la primera mitad de 2027. RSA indica que Agent ID mantiene los datos de los tenants en regiones de EE. UU. o la UE: la opción de la UE encaja con las empresas en España; las empresas en Latinoamérica tendrían que elegir entre dos regiones extranjeras.

Acceso a modelos: ¿qué capacidades puede usar esta organización y para qué? El 6 de octubre, Anthropic dividió su Cyber Verification Program en niveles Defense, Red Team y Specialized. El acceso Red Team es solo para organizaciones y tarda semanas en revisarse; el acceso Specialized se revisa con el gobierno de EE. UU. El acceso a una capacidad ahora depende de un propósito verificado, no solo de tener una clave de API, una idea que Anthropic aplicó por primera vez a las ciencias de la vida.

Contención: ¿qué puede tocar este agente alguna vez? Microsoft puso Execution Containers en disponibilidad general, de modo que Windows aplica a qué archivos, redes y procesos accede un agente.

Secuencia: ¿puede hacer esto ahora, dado lo que acaba de hacer? Strands Box de AWS hace temporal la autorización: las políticas de Dogwood leen el historial del agente antes de permitir la siguiente acción.

Aprobación de cambios: ¿debería esto llegar a producción? Los agentes de bases de datos de Cornerstone OnDemand diagnostican por su cuenta pero esperan a una persona antes de cualquier operación destructiva, con una ventana de cinco minutos que por defecto deniega.

Gasto: ¿cuánto puede consumir antes de que alguien decida? GitLab añadió límites de uso de IA a nivel de suscripción, grupo y usuario, junto a informes de costes por equipo, tarea y modelo.

Seis autoridades sobre un agente de IA
La pregunta que respondeTitular naturalSi el constructor del agente la posee
Identidad¿Quién es y quién responde por él?Gestión de identidades y accesosNadie puede revocarlo limpiamente
Acceso a modelos¿Qué capacidades, con qué propósito?Liderazgo de riesgos o seguridad, con el proveedorLa capacidad sigue a quien tenga una clave
Contención¿Qué puede tocar alguna vez?Seguridad de endpoint o plataformaUn agente persuadido alcanza lo que alcanza su host
Secuencia¿Puede actuar ahora, dado lo que acaba de hacer?Ingeniería de seguridadLos pasos permitidos suman un resultado prohibido
Aprobación de cambios¿Debería llegar a producción?El propietario que ya aprueba cambiosEl autor aprueba su propio trabajo
Gasto¿Cuánto antes de que alguien decida?Finanzas con el propietario del productoLa factura se convierte en el informe del incidente
Las filas marcadas deben aplicarse fuera del agente, porque un agente manipulado no las aplicará sobre sí mismo.

Por qué tienen que permanecer separadas

Fallan de forma independiente, o fallan juntas. Una inyección de prompt derrota cualquier cosa que el agente lea e interprete. Si las reglas de contención y secuencia viven en el prompt, un solo documento malicioso desactiva ambas. Las autoridades aplicadas fuera del agente, por el sistema operativo, un gateway o una persona, sobreviven a que el agente se equivoque. Ese es el argumento detrás de nuestro caso de que los guardrails de prompt no son una frontera de seguridad, extendido a cada autoridad.

Funcionan con relojes diferentes. La identidad cambia cuando alguien se va o un equipo se reorganiza. El acceso a modelos cambia cuando un proveedor reclasifica una capacidad. La contención cambia con cada versión del agente. La aprobación ocurre por cambio, el gasto por mes. Un equipo no puede mantener seis cadencias bien, y una configuración de plataforma no puede representarlas.

Los auditores ya piensan así. La segregación de funciones es uno de los controles más antiguos en finanzas y TI: quien inicia un pago no lo aprueba. La gobernanza de agentes es el mismo principio aplicado a un nuevo tipo de actor. Un agente cuyo constructor también define su identidad, su contención, sus aprobaciones y su presupuesto es un hallazgo de segregación de funciones esperando a ser escrito.

Usarlo en una revisión

Para cada agente en producción, haga cuatro preguntas.

  1. ¿Quién posee cada una de las seis autoridades? Escriba un nombre o un equipo, no un producto.
  2. ¿Alguna de las dos autoridades críticas recae en el equipo que construye el agente? Contención y aprobación de cambios son las dos que más a menudo lo hacen.
  3. ¿Puede cada autoridad actuar sin las otras? Revoque la identidad sin volver a desplegar el agente. Deniegue una acción sin editar el prompt. Detenga el gasto sin borrar nada.
  4. ¿Qué pasa cuando una autoridad está en silencio? Una aprobación que expira, un gateway que no puede alcanzar su servicio de políticas, un servicio de presupuesto que está caído. La denegación por defecto debería ser una decisión, no un accidente.

Esto refina una visión que hemos sostenido desde nuestro argumento de que los agentes necesitan un ID, un gestor, un presupuesto y un archivo. El archivo registra el agente. Las autoridades lo aplican, y no deberían responder todas a la misma persona. También da forma a la autonomía que se gana: la promoción en la escalera es una decisión que estas autoridades toman juntas, no una configuración que una de ellas cambia sola.

Nuestra expectativa, y es una visión más que un hecho, es que los compradores empezarán a hacer a los proveedores una pregunta sencilla: ¿cuáles de las seis posee su producto y cuáles nos deja a nosotros? Los productos vendidos como “los guardrails” tendrán que responderla.

¿Tiene un caso de uso de IA detenido entre el prototipo y la producción?

Cuéntenos qué quiere poner en marcha. Le respondemos con próximos pasos honestos.

Conversemos sobre un caso de uso