olimposec.com
Radar / Notícias / OS-2026-378
panoramaPROMPT2026-09-09 · 2 min de leitura
0

Bait-and-Recover: defesa envenena os sinais internos que ataques white-box usam para editar pesos de LLMs

Resumo executivo

Pesquisadores propoem uma defesa em nivel de pesos contra ataques de representation engineering, em que um atacante com acesso total ao modelo (peso aberto) estima a direcao interna de recusa e edita a matriz de projecao para desativar o alinhamento de seguranca em minutos, sem treinamento por gradiente. O metodo, chamado Bait-and-Recover, coloca um adaptador "isca" exatamente onde o atacante mede as ativacoes e um adaptador de "recuperacao" na camada seguinte, treinados via gradient routing para desacoplar o que o atacante observa do que o modelo de fato faz. Em quatro modelos abertos testados, a taxa minima de recusa sob esse tipo de ataque subiu de 16,25% para 71,75%, com impacto minimo na capacidade geral.

Modelos de peso aberto tem um problema de seguranca estrutural: qualquer pessoa com acesso aos pesos pode inspecionar as ativacoes internas, estimar a direcao vetorial associada a recusa de pedidos perigosos e aplicar uma edicao cirurgica na matriz de projecao para apagar esse comportamento -- um ataque de representation engineering que roda em minutos, numa unica GPU, sem precisar de treinamento por gradiente nem de muitos exemplos. E um tipo de jailbreak muito mais barato e direto do que tentar convencer o modelo via prompt.

A defesa proposta, Bait-and-Recover, ataca a premissa de medicao do atacante em vez de tentar blindar o comportamento final. Ela insere um "adaptador isca" exatamente na camada onde o atacante costuma ler as ativacoes para estimar a direcao de recusa, e um "adaptador de recuperacao" pareado na camada seguinte. Um mecanismo de treinamento chamado gradient routing ensina esses dois adaptadores a se comportarem de forma coordenada: o sinal residual que o atacante observaria fica poluido de proposito (nao reflete mais a real logica de recusa do modelo), mas a camada de recuperacao reconstroi o computo correto na sequencia, entao o modelo continua respondendo normalmente para o usuario legitimo.

Essencialmente isso quebra a suposicao central do ataque: que o que se mede nas ativacoes corresponde ao que o modelo realmente vai fazer. Ao desacoplar caminho de observacao e caminho de comportamento, a busca do atacante por uma edicao de peso eficaz passa a ser guiada por um sinal falso, entao a edicao encontrada nao produz o efeito esperado.

Os numeros sao expressivos dentro do orcamento de preservacao de comportamento definido (divergencia KL <= 0,10 em relacao ao modelo original): a taxa minima de recusa sob busca adversarial subiu de 16,25% para 71,75% nos quatro modelos testados, com impacto quase nulo em benchmarks gerais de capacidade. Para times que distribuem ou hospedam modelos de peso aberto, isso e relevante porque ataques de edicao de pesos sao dificeis de mitigar so com treinamento de alinhamento tradicional -- a defesa aqui atua numa camada estrutural diferente, complementando (nao substituindo) o safety training de comportamento.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.