CamoDocs é um ataque de envenenamento de dados contra sistemas RAG (retrieval-augmented generation) que evita incluir a consulta-alvo diretamente nos documentos maliciosos — a técnica que a maioria das defesas de detecção hoje monitora — misturando conteúdo adversarial com rascunhos benignos e usando 'tokens de dispersão' para camuflar o embedding dos documentos envenenados. Contra sete defesas de RAG, três LLMs abertos e três benchmarks, o ataque manteve taxa de sucesso média de 61,80% no GPT-5.4-mini e 55,09% no Claude-Haiku-4.5, sendo neutralizado de forma consistente só por defesas de clustering agressivo, que por sua vez destroem a utilidade do sistema.
Pesquisadores descrevem uma classe inédita de ataque contra sistemas de aprendizado contínuo (continual learning), em que dados manipulados não apenas apagam conhecimento prévio do modelo — como já fazia o esquecimento catastrófico induzido — mas também bloqueiam sua capacidade de aprender iterações futuras. O estudo formaliza seis estratégias de ataque e testa contra três algoritmos de defesa (DER, ER-ACE, iCaRL) em mais de 4.480 simulações, encontrando vulnerabilidade consistente em todos eles.
Pesquisadores apresentam o FedLNS, um mecanismo do lado do servidor para detectar atualizações maliciosas em aprendizado federado de modelos de linguagem, sem exigir acesso aos dados brutos dos clientes nem exemplos rotulados de ataque. A ideia é usar as mudanças nos parâmetros das camadas de normalização (LayerNorm) de cada atualização de cliente como uma "assinatura" comparável a uma referência histórica robusta entre clientes. Em experimentos com até 40% dos clientes manipulando alvos de treino, o método reduziu a perplexidade do modelo global mais do que seis baselines concorrentes, em arquiteturas estilo GPT, BERT e LLaMA.
O paper propõe o STAR-FL, um framework de defesa para federated learning que combina clustering espaço-temporal para identificar atualizações maliciosas de clientes com um ajuste adaptativo da taxa de aprendizado na agregação, reduzindo o impacto de envenenamentos que escapam da primeira camada. Os autores reportam desempenho superior a defesas do estado da arte contra ataques de poisoning direcionados em múltiplos benchmarks de visão computacional.