olimposec.com
tema

#prompt-level

1 publicação marcada com esta tag.

risco médioOS-2026-370 · 2026-09-04
0

AlcaTRAz: defesa baseada em árvores de regras ancoradas contra jailbreaks em LLMs

Pesquisadores propõem o AlcaTRAz, uma defesa aplicada apenas ao texto do prompt de entrada, sem precisar acessar pesos ou internos do modelo. A técnica aprende automaticamente uma regra de transformação que insere pequenas perturbações em nível de caractere, quebrando padrões estruturais que ataques de jailbreak exploram. Testada em 33 modelos e 22 tipos de ataque, ela superou defesas concorrentes na maioria dos casos, reduzindo drasticamente a severidade das respostas maliciosas com pouco impacto em perguntas legítimas.

Fonte ↗