UMPeek: ataque infere o "modelo do usuário" oculto guardado por agentes de IA personalizados
Pesquisadores mostraram que agentes de LLM personalizados que armazenam apenas um "modelo do usuário" compactado (em vez do texto original) não são tão privados quanto se supunha. O ataque UMPeek, por sondagem adaptativa guiada por hipóteses, consegue reconstruir informações privadas do usuário observando apenas o comportamento visível do agente, sem acesso a registros brutos ou ao estado interno. O método foi validado tanto em benchmarks quanto em sistemas reais em produção, superando ataques existentes e resistindo a defesas aplicadas no nível da resposta.
Fonte ↗