MechAudit detecta ataques a LLMs analisando so as ativacoes internas, sem precisar saber qual ataque procurar
O MechAudit-40 avalia sistematicamente 40 mecanismos de ataque a LLMs (otimizacao de prompt, manipulacao de contexto multi-turno, envenenamento de recuperacao e backdoors) em cinco arquiteturas de peso aberto, usando 100 mil pares de representacao limpa/atacada para mostrar que ataques heterogeneos deixam assinaturas geometricas transferiveis nas ativacoes internas do modelo. A partir disso, os autores constroem o MechAudit, um auditor de runtime que detecta 81,1% das execucoes de ataque nunca vistas com apenas 0,70% de falsos positivos, sem depender de referencias limpas ou metadados do ataque -- e mantem mais de 50% de recall mesmo quando uma categoria inteira de ataque e retirada do treinamento.
Fonte ↗