Pesquisadores propoem uma defesa em nivel de pesos contra ataques de representation engineering, em que um atacante com acesso total ao modelo (peso aberto) estima a direcao interna de recusa e edita a matriz de projecao para desativar o alinhamento de seguranca em minutos, sem treinamento por gradiente. O metodo, chamado Bait-and-Recover, coloca um adaptador "isca" exatamente onde o atacante mede as ativacoes e um adaptador de "recuperacao" na camada seguinte, treinados via gradient routing para desacoplar o que o atacante observa do que o modelo de fato faz. Em quatro modelos abertos testados, a taxa minima de recusa sob esse tipo de ataque subiu de 16,25% para 71,75%, com impacto minimo na capacidade geral.
Fonte ↗O MechAudit-40 avalia sistematicamente 40 mecanismos de ataque a LLMs (otimizacao de prompt, manipulacao de contexto multi-turno, envenenamento de recuperacao e backdoors) em cinco arquiteturas de peso aberto, usando 100 mil pares de representacao limpa/atacada para mostrar que ataques heterogeneos deixam assinaturas geometricas transferiveis nas ativacoes internas do modelo. A partir disso, os autores constroem o MechAudit, um auditor de runtime que detecta 81,1% das execucoes de ataque nunca vistas com apenas 0,70% de falsos positivos, sem depender de referencias limpas ou metadados do ataque -- e mantem mais de 50% de recall mesmo quando uma categoria inteira de ataque e retirada do treinamento.
Fonte ↗Um novo estudo descreve uma classe de ataques que, ao invés de tentar contornar as defesas de um LLM por fora (jailbreaks clássicos), localiza e desativa diretamente os neurônios ou 'rotas' internas responsáveis pelo comportamento de recusa. Como resposta, os autores propõem o DRAA, um mecanismo que identifica essas rotas de segurança e constrói caminhos de recusa alternativos e dinâmicos que continuam funcionando mesmo quando a rota original é comprometida.
Fonte ↗