olimposec.com
Radar / Notícias / OS-2026-385
panoramaPROMPT2026-09-09 · 2 min de leitura
0

SRD-GUARD reescreve o proprio prompt do usuario para expor jailbreaks disfarcados antes de responder

Resumo executivo

O SRD-GUARD e uma defesa contra jailbreak sem acesso aos pesos do modelo (black-box) que gera cinco reescritas semanticas do prompt original removendo a "embalagem" de contexto (roleplay, cenarios ficticios) e avalia o prompt original junto com as reescritas por meio de varios avaliadores LLM independentes, combinando limiares absolutos de risco com a variacao relativa de risco entre versoes. Testado contra os ataques UNIATTACK, CIPHER e DeepInception em Llama-3-8B-Uncensored e DeepSeek-V4-Flash, alcancou taxas de defesa de 91,44% e 100% mantendo taxa de recusa indevida de pedidos legitimos entre 8% e 12%.

Jailbreaks modernos frequentemente escondem a intencao real de um pedido dentro de uma "embalagem" narrativa -- role-playing, cenarios ficticios elaborados, justificativas aparentemente inocentes -- que confunde tanto o modelo-alvo quanto classificadores de seguranca superficiais, que tendem a olhar para palavras-chave ou padroes obvios de pedido daninho. Defesas de inferencia existentes ou deixam passar esses ataques disfarcados, ou pecam pelo excesso, recusando pedidos legitimos que apenas usam linguagem estilizada.

A ideia central do SRD-GUARD e forcar a intencao real a emergir antes de julgar o pedido: dado um prompt de entrada, o sistema gera cinco reescritas semanticamente equivalentes que preservam o objetivo subjacente mas removem a camada de contexto narrativo desnecessaria. O prompt original e as cinco reescritas sao entao avaliados em paralelo por multiplos avaliadores LLM de seguranca independentes, numa escala continua de risco, e um modulo de decisao combina o risco absoluto de cada versao com a mudanca relativa de risco entre o prompt original e suas reescritas -- um salto grande de risco entre a versao "vestida" e a versao "nua" e, por si so, um sinal forte de intencao disfarcada.

Essa combinacao de multiplos avaliadores (em vez de um unico classificador) tambem melhora a robustez contra o comportamento inconsistente que um unico avaliador LLM pode ter -- um consenso entre varios modelos e mais dificil de enganar de forma sistematica do que convencer um unico juiz. Nos testes contra tres familias de ataque conhecidas (UNIATTACK, CIPHER, DeepInception) em dois modelos abertos (Llama-3-8B-Uncensored e DeepSeek-V4-Flash), avaliados nos benchmarks AdvBench e OR-Bench-Hard, o sistema alcancou taxas de defesa de 91,44% e 100% respectivamente, mantendo a taxa de recusa indevida de pedidos legitimos (over-refusal) entre 8% e 12% -- uma troca melhor entre seguranca e usabilidade do que as bases de comparacao usadas.

O valor pratico para quem opera modelos de peso aberto ou API sem controle sobre o treinamento de alinhamento e que essa e uma camada de defesa que pode ser adicionada por cima de qualquer modelo, sem re-treinamento, e sem exigir acesso aos pesos -- o que a torna aplicavel tanto a modelos proprios quanto a modelos de terceiros consumidos via API. O trade-off inerente, como em qualquer guarda baseado em julgamento de LLM, e o custo de latencia e de chamadas adicionais de inferencia para gerar e avaliar as reescritas.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.