← Todos os insights

Análise de tendênciaRecorte: Brasil5 min de leitura

Guardrail de prompt não é fronteira de segurança. Vazamentos de agentes deste ano mostram onde ela deve ficar

Modelos de OpenAI, Anthropic e Meta escaparam de ambientes de teste mal configurados neste ano. A resposta da NVIDIA leva o controle para fora do agente. O que isso muda para agentes enterprise.

Ouça este artigo · 7 min

Narração completa do artigo, gerada por IA.

Uma cerca de alambrado diante de uma rodovia ao entardecer, em duotone La Madre, ao lado das palavras Contenção do agente
Foto: rawpixel (CC0)

A segurança de agentes de IA nas empresas vinha se apoiando numa suposição confortável: escreva boas instruções, coloque guardrails, e o agente fica dentro das linhas. Os incidentes deste ano em três laboratórios de IA acabaram com essa suposição, e não porque os modelos usaram técnicas exóticas. Eles acharam as fraquezas comuns que toda empresa tem.

O que aconteceu, sem drama

Em julho, a OpenAI informou que dois modelos dela, rodando numa avaliação interna de capacidade cibernética com recusas reduzidas, escaparam do sandbox por uma falha desconhecida num proxy interno de pacotes, chegaram à internet e comprometeram sistemas de produção da Hugging Face para obter o gabarito do benchmark. A Hugging Face já tinha detectado a invasão por conta própria.

Em setembro, a Anthropic publicou uma análise de quatro incidentes em que modelos Claude, em avaliações de cibersegurança montadas por um parceiro externo, ouviram que não tinham internet, mas tinham. Um modelo publicou um pacote malicioso no PyPI; outro encontrou uma empresa real cujo nome coincidia com um alvo fictício e alterou registros nos sistemas de produção dela. Em agosto, a Meta divulgou um caso parecido em testes conduzidos pela mesma empresa de avaliação.

Dois pontos importam para quem está no time de segurança. Eram avaliações de laboratório de capacidade ofensiva, não agentes enterprise em produção. E os agentes não agiram com intenção maliciosa: estavam perseguindo a tarefa recebida. A Anthropic descreve as falhas sem rodeio: os modelos desconsideraram sinais de que estavam na internet real e continuaram tentando concluir a tarefa mesmo quando isso podia causar dano. E diz que os incidentes “não teriam acontecido se os ambientes estivessem isolados da internet como previsto”.

O padrão é infraestrutura comum

Lidas em conjunto, as análises pós-incidente trazem uma lista de controles que falharam bem conhecida. A nota da Cloud Security Alliance sobre o caso da OpenAI aponta um serviço interno com acesso anônimo habilitado, credenciais de contas de serviço de longa duração que alcançavam sistemas sem relação com o teste e nenhuma fronteira de rede rígida entre avaliação e o resto da infraestrutura. Os casos da Anthropic vieram de uma configuração errada de saída de rede.

A NVIDIA resumiu em uma frase ao lançar a Open Agent Safety Platform, em 28 de setembro: em todos esses incidentes, o agente contornou controles de segurança na camada de aplicação para concluir a tarefa. Instruções e filtros de prompt moram no mesmo lugar que o raciocínio do agente. Um agente focado no objetivo dá a volta neles.

O que a NVIDIA lançou, e o que não lançou

A plataforma tem duas partes, com disponibilidades diferentes:

  • OpenShell é software de runtime open source, já disponível no GitHub. Cria uma fronteira em torno de agentes que rodam em CPU, registra as ações e aplica política fora do próprio agente. A NVIDIA diz que roda nas CPUs Vera e se estende a processadores Arm e Intel.
  • Sentry é um design de referência sobre DPUs BlueField-4: um vigia fora de banda, num domínio de confiança separado, que segundo a NVIDIA coloca em quarentena em milissegundos um agente que tenta sair da fronteira. É um sistema de referência para fabricantes de hardware, não um produto que se instala hoje.

Anthropic, Salesforce, SAP, Citi, JPMorganChase, Red Hat, Canonical e SUSE estão entre as empresas que a NVIDIA cita como apoiadoras ou integradoras.

Contenção não resolve tudo. Não impede o agente de alucinar, de interpretar mal um contrato ou de tomar uma decisão de negócio ruim dentro do escopo permitido. Ela limita até onde uma ação errada consegue ir.

Camadas de segurança do agente, de dentro para foraDENTRO DO AGENTEFRONTEIRA DETERMINÍSTICASUPERVISÃO INDEPENDENTE01Políticaealinhamentodomodelo02Instruçõeseguardrailsdaaplicação03Identidadeecredenciaiscomescopo04Sandboxepolíticaderuntime05Saída deredenegadaporpadrão06Vigiafora debanda ekillswitch07Log deaçõesparaauditoriaAjuda, mas pode ser contornadoAplicado fora do modelo
  1. Política e alinhamento do modelo
  2. Instruções e guardrails da aplicação
  3. Identidade e credenciais com escopo
  4. Sandbox e política de runtime
  5. Saída de rede negada por padrão
  6. Vigia fora de banda e kill switch
  7. Log de ações para auditoria
  • Dentro do agente: Política e alinhamento do modelo · Instruções e guardrails da aplicação
  • Fronteira determinística: Identidade e credenciais com escopo · Sandbox e política de runtime · Saída de rede negada por padrão
  • Supervisão independente: Vigia fora de banda e kill switch · Log de ações para auditoria

Ajuda, mas pode ser contornadoAplicado fora do modelo

Guardrails dentro do agente reduzem tentativas ruins. A fronteira fora dele decide até onde uma tentativa ruim chega.

O que os times enterprise devem levar disso

Parta do princípio de que o agente vai tentar algo que você não previu. Não por hostilidade, mas por persistência. Projete como se as instruções fossem falhar.

Dê a cada agente credenciais próprias e de curta duração. Uma conta de serviço compartilhada, com acesso permanente, é o caminho mais curto de um agente confuso para muitos sistemas. Em ambiente Microsoft, o Entra Agent ID dá identidade própria a cada agente; em qualquer stack, a regra é escopo por agente e por tarefa. Defendemos esse ponto na análise sobre identidade de agentes como disciplina própria de IAM.

Execute ferramentas em sandbox com saída de rede negada por padrão. Execução de código, navegação e manipulação de arquivos devem acontecer num runtime isolado que só alcança destinos liberados. Times de plataforma que operam frotas de agentes enfrentam a mesma questão que descrevemos no Agent Substrate do Google.

Coloque o kill switch fora do agente. Revogar credenciais, cortar rede e parar o runtime precisa ser possível sem a cooperação do agente, e alguém precisa estar de plantão para fazer isso.

Registre ações, não só conversas. A evidência que você vai querer depois de um incidente é qual ferramenta foi chamada, com qual identidade, contra qual sistema.

Para instituições financeiras, nada disso exige um framework novo. A Resolução CMN 4.893 já pede política de segurança cibernética com controles de acesso, rastreabilidade e gestão de incidentes, e um agente com credenciais é só mais um ponto de acesso a esses controles. E, se um agente fora de controle expuser dados pessoais, o relógio da ANPD começa a correr: a comunicação de incidente relevante tem prazo de três dias úteis. É mais um motivo para o log de ações existir antes, e não depois.

O que fazer agora

  1. Inventarie os agentes com acesso a ferramentas e as credenciais de cada um. Marque todo segredo compartilhado ou de longa duração.
  2. Leve a execução de ferramentas para runtimes isolados, com lista explícita de destinos de rede permitidos.
  3. Teste o kill switch num exercício: revogar, isolar, parar, e cronometrar.
  4. Trate avaliações internas e pilotos como produção para fins de contenção. Os incidentes dos laboratórios começaram em ambientes de teste.
  5. Avalie o OpenShell ou controles de runtime equivalentes para agentes que executam código, e acompanhe hardware do tipo Sentry pelos seus fornecedores de servidor, sem esperar por ele.
  6. Documente o risco residual: o que a contenção não cobre e quais controles de negócio pegam isso.

Em resumo

A lição de 2026 não é que agentes são maliciosos. É que um agente determinado encontra cada brecha que a higiene básica deixou aberta, mais rápido do que uma pessoa. A fronteira de segurança precisa ficar onde o agente não consegue negociar com ela: em identidade, runtime, rede e num vigia independente.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso