Los guardrails de agentes no son una capa. Son seis autoridades, y nadie debería tenerlas todas
Identidad, acceso a modelos, contención, secuencia, aprobación y gasto responden a preguntas distintas. Los lanzamientos de la semana muestran su separación y cómo decidir quién posee cada una.
Escuche este artículo · 6 min
Narración completa del artículo, generada con IA.

Pregunte a un equipo empresarial cómo se gobiernan sus agentes de IA y la respuesta suele ser una palabra: guardrails. Pregunte qué es un guardrail y las respuestas divergen. Para una persona es un filtro en la salida del modelo. Para otra es una línea en el prompt del sistema. Para una tercera es la pantalla de permisos de la plataforma.
Mientras tanto, en una sola semana, los proveedores lanzaron controles para agentes desde al menos seis direcciones diferentes, y casi ninguno es un guardrail en ninguno de esos sentidos. Leídos en conjunto, sugieren que la gobernanza de agentes no es una capa. Es un conjunto de autoridades separadas, cada una respondiendo a una pregunta diferente, y la decisión de diseño más importante es quién posee cada una.
Una semana, seis autoridades
Identidad: ¿quién es este agente y quién responde por él? RSA anunció Agent ID el 7 de octubre para descubrir agentes, registrarlos con propietarios nombrados, niveles de riesgo y estados de ciclo de vida, aplicar políticas en gateways de IA y MCP con aprobación fuera de banda, certificar su acceso de forma continua y revocarlo al desmantelarlo. El módulo de descubrimiento y seguridad está previsto para disponibilidad general el 16 de noviembre; el módulo de gobernanza en la primera mitad de 2027. RSA indica que Agent ID mantiene los datos de los tenants en regiones de EE. UU. o la UE: la opción de la UE encaja con las empresas en España; las empresas en Latinoamérica tendrían que elegir entre dos regiones extranjeras.
Acceso a modelos: ¿qué capacidades puede usar esta organización y para qué? El 6 de octubre, Anthropic dividió su Cyber Verification Program en niveles Defense, Red Team y Specialized. El acceso Red Team es solo para organizaciones y tarda semanas en revisarse; el acceso Specialized se revisa con el gobierno de EE. UU. El acceso a una capacidad ahora depende de un propósito verificado, no solo de tener una clave de API, una idea que Anthropic aplicó por primera vez a las ciencias de la vida.
Contención: ¿qué puede tocar este agente alguna vez? Microsoft puso Execution Containers en disponibilidad general, de modo que Windows aplica a qué archivos, redes y procesos accede un agente.
Secuencia: ¿puede hacer esto ahora, dado lo que acaba de hacer? Strands Box de AWS hace temporal la autorización: las políticas de Dogwood leen el historial del agente antes de permitir la siguiente acción.
Aprobación de cambios: ¿debería esto llegar a producción? Los agentes de bases de datos de Cornerstone OnDemand diagnostican por su cuenta pero esperan a una persona antes de cualquier operación destructiva, con una ventana de cinco minutos que por defecto deniega.
Gasto: ¿cuánto puede consumir antes de que alguien decida? GitLab añadió límites de uso de IA a nivel de suscripción, grupo y usuario, junto a informes de costes por equipo, tarea y modelo.
| La pregunta que responde | Titular natural | Si el constructor del agente la posee | |
|---|---|---|---|
| Identidad | ¿Quién es y quién responde por él? | Gestión de identidades y accesos | Nadie puede revocarlo limpiamente |
| Acceso a modelos | ¿Qué capacidades, con qué propósito? | Liderazgo de riesgos o seguridad, con el proveedor | La capacidad sigue a quien tenga una clave |
| Contención | ¿Qué puede tocar alguna vez? | Seguridad de endpoint o plataforma | Un agente persuadido alcanza lo que alcanza su host |
| Secuencia | ¿Puede actuar ahora, dado lo que acaba de hacer? | Ingeniería de seguridad | Los pasos permitidos suman un resultado prohibido |
| Aprobación de cambios | ¿Debería llegar a producción? | El propietario que ya aprueba cambios | El autor aprueba su propio trabajo |
| Gasto | ¿Cuánto antes de que alguien decida? | Finanzas con el propietario del producto | La factura se convierte en el informe del incidente |
Por qué tienen que permanecer separadas
Fallan de forma independiente, o fallan juntas. Una inyección de prompt derrota cualquier cosa que el agente lea e interprete. Si las reglas de contención y secuencia viven en el prompt, un solo documento malicioso desactiva ambas. Las autoridades aplicadas fuera del agente, por el sistema operativo, un gateway o una persona, sobreviven a que el agente se equivoque. Ese es el argumento detrás de nuestro caso de que los guardrails de prompt no son una frontera de seguridad, extendido a cada autoridad.
Funcionan con relojes diferentes. La identidad cambia cuando alguien se va o un equipo se reorganiza. El acceso a modelos cambia cuando un proveedor reclasifica una capacidad. La contención cambia con cada versión del agente. La aprobación ocurre por cambio, el gasto por mes. Un equipo no puede mantener seis cadencias bien, y una configuración de plataforma no puede representarlas.
Los auditores ya piensan así. La segregación de funciones es uno de los controles más antiguos en finanzas y TI: quien inicia un pago no lo aprueba. La gobernanza de agentes es el mismo principio aplicado a un nuevo tipo de actor. Un agente cuyo constructor también define su identidad, su contención, sus aprobaciones y su presupuesto es un hallazgo de segregación de funciones esperando a ser escrito.
Usarlo en una revisión
Para cada agente en producción, haga cuatro preguntas.
- ¿Quién posee cada una de las seis autoridades? Escriba un nombre o un equipo, no un producto.
- ¿Alguna de las dos autoridades críticas recae en el equipo que construye el agente? Contención y aprobación de cambios son las dos que más a menudo lo hacen.
- ¿Puede cada autoridad actuar sin las otras? Revoque la identidad sin volver a desplegar el agente. Deniegue una acción sin editar el prompt. Detenga el gasto sin borrar nada.
- ¿Qué pasa cuando una autoridad está en silencio? Una aprobación que expira, un gateway que no puede alcanzar su servicio de políticas, un servicio de presupuesto que está caído. La denegación por defecto debería ser una decisión, no un accidente.
Esto refina una visión que hemos sostenido desde nuestro argumento de que los agentes necesitan un ID, un gestor, un presupuesto y un archivo. El archivo registra el agente. Las autoridades lo aplican, y no deberían responder todas a la misma persona. También da forma a la autonomía que se gana: la promoción en la escalera es una decisión que estas autoridades toman juntas, no una configuración que una de ellas cambia sola.
Nuestra expectativa, y es una visión más que un hecho, es que los compradores empezarán a hacer a los proveedores una pregunta sencilla: ¿cuáles de las seis posee su producto y cuáles nos deja a nosotros? Los productos vendidos como “los guardrails” tendrán que responderla.