Ataque implicito manipula selecao de skills em agentes de IA sem deixar sinais reconheciveis de manipulacao
O ataque ISM (Implicit Skill-Selection Manipulation via Semantic Matching) manipula qual skill um agente de IA escolhe para atender a um pedido, moldando a relacao semantica entre o prompt do usuario e a descricao da skill em vez de usar injecao de prompt explicita. O metodo eleva a taxa de selecao da skill alvo de 15,2% para 63,5% em media, e e bloqueado por revisores humanos em apenas 2,9% das avaliacoes, contra 91,4% para ataques explicitos equivalentes.
Em fluxos de agentes de IA que possuem multiplas 'skills' instaladas -- capacidades especializadas que o agente pode invocar para atender diferentes tipos de pedido -- a etapa de selecao de skill decide qual delas vai processar cada solicitacao do usuario. Ataques conhecidos contra essa etapa costumam depender de injecao de prompt explicita ou de instrucoes diretas de direcionamento, o que deixa sinais textuais reconheciveis que ferramentas de deteccao e revisores humanos conseguem identificar com relativa facilidade.
O artigo identifica uma superficie de ataque diferente: mesmo quando o prompt do usuario e a descricao da skill parecem benignos isoladamente, a relacao semantica entre os dois pode ser deliberadamente moldada para favorecer, de forma sistematica, uma skill escolhida pelo atacante. O metodo proposto, ISM, executa uma estrategia em tres estagios que amplia a cobertura semantica da skill alvo, fortalece sua distintividade em relacao as demais opcoes disponiveis, e preserva a naturalidade do texto dos prompts reutilizaveis envolvidos -- sem jamais incluir instrucao explicita de selecao.
Os resultados experimentais, obtidos em quatro dominios de tarefa e oito modelos seletores diferentes, mostram que o ISM eleva a taxa media de selecao da skill alvo de 15,2% (linha de base) para 63,5%. Em uma comparacao direta, o ISM atinge 73,5% de taxa de selecao, apenas 9,8 pontos percentuais abaixo de um ataque de direcionamento explicito -- mas com uma diferenca crucial de deteccao: revisores humanos bloqueiam o ISM em apenas 2,9% dos julgamentos, contra 91,4% para o ataque explicito, e cinco inspetores baseados em LLM aprovam o ISM em 82,9% dos casos, contra 37,4% para a versao explicita. O ataque tambem se mostrou eficaz contra defesas especificas de deteccao de manipulacao, como PPL-W, Llama Prompt Guard 2 e PIGuard.
O resultado importa porque expoe uma lacuna estrutural nas defesas atuais contra manipulacao de agentes: elas foram desenhadas para reconhecer padroes textuais de instrucao explicita, nao para detectar manipulacao puramente semantica e distribuida entre metadados de skill e prompts reutilizaveis. Isso e particularmente preocupante para marketplaces e ecossistemas onde terceiros publicam skills livremente, ja que um ator malicioso pode elevar artificialmente a chance de sua skill ser escolhida em detrimento de alternativas legitimas, sem deixar rastro textual obvio para auditoria.