Pesquisa demonstra ataques de inferencia de contexto contra agentes de IA sem precisar de jailbreak
Pesquisadores formalizam e demonstram 'ataques de inferencia de contexto': tecnicas que revelam o conteudo de dados sensiveis carregados silenciosamente no contexto de um agente de IA (por exemplo, registros medicos ou financeiros buscados por chamadas de ferramentas), sem precisar induzir o modelo a divulgar o conteudo diretamente. Uma unica estrategia de ataque atinge ate 100% de sucesso em conjuntos pequenos de candidatos e mantem alta eficacia mesmo quando o atacante nao conhece o template do contexto ou so tem acesso via um modelo substituto.
Grande parte da pesquisa anterior sobre vazamento de privacidade em modelos de linguagem se concentrou em jailbreaks: prompts que tentam convencer o modelo a repetir literalmente informacao sensivel que ele deveria manter em sigilo. Este trabalho aponta um angulo diferente e mais dificil de mitigar com os controles usuais: mesmo quando o agente nunca revela o conteudo do contexto, respostas aparentemente benignas a perguntas do usuario carregam sinais estatisticos suficientes para que um atacante infira, por inferencia estatistica, qual registro especifico foi carregado silenciosamente naquele contexto.
Os autores formalizam o problema como um jogo de seguranca e testam tres cenarios com nivel decrescente de conhecimento do atacante: contexto conhecido (o atacante sabe exatamente quais registros existem), contexto desconhecido (nem o template nem os registros vizinhos sao conhecidos) e contexto obtido via retrieval, em que o proprio agente busca os dados atraves de chamadas de ferramentas, como em um agente de navegacao web. Em todos os casos a mesma estrategia de ataque funciona sem modificacao, distinguindo ainda um cenario grey-box, em que o atacante consegue usar o proprio modelo alvo para pontuar hipoteses, de um cenario black-box, em que ele so tem um modelo substituto sob seu controle.
Os resultados numericos sao expressivos: 100% de taxa de sucesso em conjuntos pequenos de candidatos e 63% mesmo com 1024 candidatos possiveis quando o contexto e conhecido; 78,9 de AUROC quando o template e os registros sao desconhecidos; e 92,5 de AUROC quando um modelo substituto de 14 bilhoes de parametros e usado para atacar um alvo de 32 bilhoes. Criticamente, os autores testaram tres controles defensivos comuns -- instrucao explicita ao modelo para nao divulgar o contexto, supressao de logits e diluicao do contexto com dados de preenchimento -- e nenhum deles impediu de forma consistente o vazamento.
O achado tem implicacoes praticas diretas para qualquer sistema agentic que monte contexto dinamicamente a partir de fontes sensiveis, um padrao cada vez mais comum em assistentes corporativos que consultam prontuarios, documentos financeiros ou bases de CRM antes de responder. Ele sugere que defesas baseadas apenas em filtrar o texto de saida do modelo sao insuficientes, e que a mitigacao real provavelmente exige limitar quais consultas podem ser feitas contra um contexto sensivel ou introduzir ruido estatistico deliberado nas respostas, nao apenas instrucoes de nao divulgacao.