ContextLeak: ferramenta maliciosa treinada por RL induz agentes de IA a vazar seu próprio contexto
O ataque ContextLeak usa aprendizado por reforço para gerar automaticamente nome e descrição de uma ferramenta maliciosa capaz não só de ser escolhida por um agente LLM, mas de convencê-lo a repassar como argumentos dados sensíveis do seu contexto de execução — prompt do usuário, trajetória e lista de ferramentas. O ataque se mantém eficaz mesmo quando os contextos de usuários simulados usados no treinamento diferem substancialmente dos das vítimas reais, superando ataques anteriores de ferramenta maliciosa adaptados ao mesmo cenário.
Agentes de LLM que usam ferramentas expõem, no momento em que decidem qual ferramenta chamar e com quais argumentos, informações potencialmente sensíveis: o prompt original do usuário, o histórico de execução até aquele ponto e até a lista de outras ferramentas disponíveis. Um ataque de exfiltração de contexto via ferramenta maliciosa depende de três condições: o agente precisa escolher a ferramenta do atacante, precisa repassar seu contexto de execução como argumento de entrada dela, e a implementação da ferramenta precisa transmitir esses dados a um servidor controlado pelo atacante. Trabalhos anteriores tratavam principalmente das condições 1 e 3, deixando a condição 2 — convencer o agente a efetivamente colocar dados sensíveis nos argumentos — pouco explorada.
O ContextLeak fecha essa lacuna criando o nome e a descrição da ferramenta com um LLM de ataque dedicado, ajustado via aprendizado por reforço sobre um conjunto de 'usuários sombra' com contextos de agente simulados e diversos. A contribuição técnica central é o desenho de funções de recompensa específicas para o objetivo de exfiltração de contexto, o que permite que o treinamento por RL otimize diretamente a probabilidade de o agente-alvo revelar dados nos argumentos da chamada, e não apenas a probabilidade de a ferramenta ser escolhida.
O resultado mais relevante operacionalmente é a robustez do ataque à diferença entre os contextos de treinamento (usuários sombra simulados) e os contextos reais das vítimas: mesmo com divergência substancial, a eficácia se manteve alta, superando ataques de ferramenta maliciosa anteriores adaptados ao mesmo cenário.
Na prática, isso é relevante para qualquer ecossistema de marketplaces de ferramentas/plugins para agentes de IA (nos moldes de app stores), onde nome e descrição de uma ferramenta são metadados de baixo custo para o autor e de baixa fricção de revisão — exatamente a superfície que o ContextLeak demonstra ser suficiente para induzir vazamento de dados sensíveis de execução, sem exigir qualquer exploração de código ou vulnerabilidade tradicional.