Empilhar defesas de LLM não soma proteção como se pensava, mostra estudo sobre correlação de falhas
Times que empilham várias defesas de LLM costumam assumir que elas se complementam, mas isso só é matematicamente verdade se cada camada falhar em entradas diferentes das outras. Medindo um adversário adaptativo único contra uma pilha de sete camadas defensivas, os autores encontraram correlação positiva de falha em todos os quinze pares mensuráveis (φ entre 0,30 e 0,75), fazendo o sucesso residual do ataque superar em até 0,172 a previsão multiplicativa ingênua, enquanto a pilha inteira recusa quatro em cada cinco prompts benignos e não se distingue estatisticamente da sua camada mais forte isolada.
Fonte ↗