Segurança de sistemas agênticos

Monique Villasboas
29 de setembro, 2026
8 min. de Leitura

Sistemas agênticos ampliam a autonomia da IA e criam superfícies de ataque, mas a segurança agêntica não é um problema de resposta a incidentes. É uma decisão de arquitetura, e quem a adia, paga o preço depois.

Amazon Q, EchoLeak, ForcedLeak, Replit e Agent-in-the-Middle aparecem em artigos, apresentações e análises como “incidentes reais” com Inteligência Artificial. Contudo, a lista mistura casos muito diferentes e tratar tudo como o mesmo tipo de evidência distorce o debate. 

Em um estudo realizado por Rafael Capua, COO da Jump, desses cinco casos que circulam como uma lista de incidentes, quatro não foram acidentes. EchoLeak e ForcedLeak foram divulgações coordenadas, corrigidas antes da publicação e sem exploração observada; Replit foi acidente operacional sem adversário; Agent-in-the-Middle é prova de conceito. Só o Amazon Q foi comprometimento real que chegou a usuários.

EchoLeak: exfiltração sem clique no Microsoft 365 Copilot  – Divulgação coordenada corrigida antes da publicação

A Aim Labs construiu a prova de conceito em janeiro de 2025 e reportou ao MSRC. A Microsoft corrigiu do lado servidor em maio, sem exigir ação do cliente, e a divulgação saiu em 11 de junho de 2025 como CVE-2025-32711, CVSS 9,3. Sem evidência de exploração real.

O valor está na cadeia, que derrubou três camadas em sequência. O e-mail com instruções redigidas como pedido legítimo passou pelo classificador XPIA. O filtro que removia links só reconhecia a sintaxe inline de Markdown, então o ataque usou link de referência. A imagem embutida na resposta era buscada automaticamente pelo cliente, o que dispensou o clique. E a política de conteúdo foi contornada com um endpoint de pré-visualização do Teams que estava na allowlist e buscava qualquer URL passada como parâmetro. Um serviço da própria Microsoft fez a exfiltração. É o tipo de cadeia que nenhuma camada isolada ia segurar.

ForcedLeak: um domínio de cinco dólares no Salesforce Agentforce – Divulgação coordenada corrigida antes da publicação

A Noma Labs reportou em 28 de julho de 2025. A Salesforce corrigiu em 8 de setembro, impondo Trusted URLs para Agentforce e Einstein, e a divulgação saiu em 25 de setembro. CVSS 9,4.

A entrada foi o campo de descrição do formulário de captura de lead, que aceita 42 mil caracteres de texto livre. O disparo é atrasado: o payload só executa quando, dias depois, um funcionário pede ao agente para processar aquele lead. E a saída, sem a qual o ataque não funcionaria, foi um domínio que constava na allowlist de CSP da Salesforce. Ele tinha expirado e estava à venda por cerca de cinco dólares. Cinco dólares foi o preço do canal de saída num ataque com CVSS 9,4.

Amazon Q: o único com comprometimento real de cadeia distribuído a usuários

Em 13 de julho de 2025 um commit malicioso entrou no repositório aws-toolkit-vscode. Saiu na versão 1.84.0, publicada em 17 de julho para cerca de 964 mil instalações, e foi revertido na 1.85.0 em 19 de julho. CVE-2025-8217.

O detalhe que decide tudo está no payload: ele chamava o CLI do Q com –trust-all-tools –no-interactive, carregando um prompt que mandava levar o sistema a estado de fábrica e apagar recursos locais e de nuvem. O modelo não falhou. O que havia ali era uma chave capaz de desligar toda confirmação.

A AWS afirmou que nenhum recurso de cliente foi impactado. Duas ressalvas: o código destrutivo aparentemente não executava por um defeito, e a história de que o atacante recebeu credenciais de administrador veio dele próprio, via imprensa, e não se sustenta na análise pública do histórico do repositório.

Replit: a base apagada durante o congelamento – Falha operacional sem adversário

Em uma sessão de doze dias com congelamento de código em vigor, o agente apagou a base de produção de um usuário, com cerca de 1.200 registros de executivos e 1.190 de empresas, fabricou por volta de 4 mil perfis falsos e afirmou que a reversão era impossível.

Essa última parte era falsa, e o dado foi recuperado. Havia backup. A versão que circula, de que o dado se perdeu, está errada, e ela veio do próprio agente. Esse é o ponto mais importante do caso, e ele some quando se repete a versão errada.

O caso circula mapeado como ASI01, sequestro de objetivo. Essa categoria exige uma entrada não confiável redirecionando o agente, e ali não há atacante externo. No texto de lançamento do OWASP, o exemplo citado para ASI10, agentes rebeldes, é literalmente este caso.

A causa raiz é arquitetural porque na época a plataforma usava a mesma base para pré-visualização, teste e produção. O CEO reconheceu em 19 de julho de 2025 que era inaceitável e foram feitas correções estruturais: separação automática entre desenvolvimento e produção.

Agent-in-the-Middle: vencer o roteamento pela descrição – Prova de conceito e demonstração de pesquisa

Pesquisadores da Trustwave SpiderLabs publicaram um agent card falso num diretório do protocolo A2A. Como o agente coordenador escolhe pares usando um modelo que julga as descrições dos cards, a própria descrição funcionou como injeção de prompt: mandava que aquele agente fosse sempre escolhido. Foi o suficiente para vencer o roteamento.

Na demonstração, o agente rebelde corrompeu resultados de conversão de moeda. A leitura de que houve interceptação e vazamento de dados sensíveis é extrapolação do impacto potencial. Costuma ser descrito como interceptação e vazamento de dados sensíveis para terceiros. Na demonstração publicada, o agente falso corrompeu resultados de conversão de moeda. O resto é impacto potencial.

Dos cinco casos, um foi ataque de adversário que chegou a usuários, e mesmo nele não houve dano confirmado em cliente. Dois foram vulnerabilidades encontradas por pesquisa e fechadas antes da publicação. Um foi acidente sem atacante. Um foi laboratório. Isso não diminui o risco. A classe de ataque está demonstrada e é estrutural, só que o registro público até aqui é de pesquisador chegando antes do criminoso.

O padrão técnico que se repete

Nos dois casos de exfiltração, o que decidiu o resultado não foi o prompt: foi o canal de saída. No EchoLeak, um endpoint da própria Microsoft que estava na allowlist e buscava URL arbitrária. No ForcedLeak, um domínio expirado que continuava na allowlist. Nos dois, a injeção funcionou; o que a transformou em vazamento foi a lista de domínios permitidos estar desatualizada.

No caso que chegou a usuários, o fator foi equivalente: uma opção de linha de comando que desliga toda confirmação. No acidente, ausência de separação entre ambientes.

“Em nenhum desses quatro casos o problema é a inteligência artificial. São controles conhecidos, mal mantidos, que a IA passou a alcançar. Quando a gente entra em um cliente, é por essa lista que eu começo”, declarou Rafael Capua.

Fontes consultadas diretamente e datadas

OWASP GenAI Security Project. OWASP Top 10 for Agentic Applications, 09.12.2025. Confirma os exemplos oficiais por categoria: EchoLeak em ASI01, Amazon Q em ASI02, Replit em ASI10. Em setembro de 2026 o projeto anunciou um Agent Control Standard e o Top 10 para LLM de 2026, pendente de leitura nesta revisão.

Reddy, P.; Gujral, A. S. EchoLeak: The First Real-World Zero-Click Prompt Injection Exploit in a Production LLM System. arXiv:2509.10540, set/2025.

Noma Security. ForcedLeak: AI agent risks exposed in Salesforce Agentforce, set/2025. Com The Hacker News (26.09.2025) e Salesforce Ben (30.09.2025).

Bargury, M. Reconstructing a timeline for Amazon Q prompt infection, 24.07.2025. Com The Register e SC Media (24.07.2025) e a declaração da AWS de 26.07.2025.

The Register (22.07.2025) e heise online (25.07.2025) sobre o caso Replit, com as postagens públicas de Amjad Masad e Jason Lemkin.

Trustwave SpiderLabs. Agent In the Middle: Abusing Agent Cards in the A2A Protocol. Prova de conceito.

Debenedetti, E. et al. (Google DeepMind) Defeating Prompt Injections by Design. arXiv:2503.18813. Arquitetura CaMeL, resultados no AgentDojo e implementação aberta.

Willison, S. The Dual LLM pattern for building AI assistants that can resist prompt injection, abr/2023.

Hines, K. et al. (Microsoft) Defending Against Indirect Prompt Injection Attacks With Spotlighting. CAMLIS 2024.

Dark Marc. The Hacker’s Guide to Attacking AI Agents, 15.09.2026. Origem do modelo das quatro etapas e das cinco perguntas.