olimposec.com
Radar / Notícias / OS-2026-335
risco médioADVERSARIAL2026-09-01 · 2 min de leitura
0

OASIS otimiza a combinação de ataques adversariais contra classificadores de texto em cenário black-box hard-label

Resumo executivo

OASIS é um método que otimiza a sequência — não apenas a escolha individual — de ataques adversariais de texto em cenários black-box hard-label, realizando uma busca única para equilibrar taxa de sucesso e tamanho da perturbação, e reaproveitando essa cadeia depois. O trabalho mostra que a composição de atacantes é, ela mesma, um alvo de otimização capaz de superar tanto atacantes isolados quanto combinações manuais em vários datasets e modelos vítima, incluindo LLMs.

Ataques adversariais contra classificadores de texto no cenário mais restritivo — black-box hard-label, em que o atacante só observa o rótulo final previsto pelo modelo vítima, sem acesso a probabilidades ou gradientes — normalmente são estudados isoladamente: cada "atacante" (algoritmo de busca de perturbação) é otimizado e avaliado sozinho, ou combinado manualmente com outros de forma ad hoc.

O OASIS, de Chen, Xiao e Liang, parte da observação de que atacantes diferentes seguem trajetórias de busca diferentes, e cada um tem sucesso em um subconjunto distinto de exemplos — ou seja, nenhum atacante individual domina todos os casos. A proposta é tratar a composição de uma sequência de atacantes como o próprio alvo de otimização: o método realiza uma busca bi-objetivo (equilibrando taxa de sucesso do ataque e tamanho da perturbação) sobre sequências candidatas de atacantes, escolhe uma cadeia global fixa, e reutiliza essa cadeia em execução, em vez de recalcular a combinação a cada novo exemplo.

Em experimentos com múltiplos datasets, modelos vítima e LLMs, os autores mostram que essa composição otimizada de atacantes supera consistentemente tanto atacantes individuais fortes quanto cadeias combinadas manualmente. O resultado é relevante para segurança ofensiva de IA porque desloca o foco de "criar um atacante melhor" para "orquestrar atacantes existentes de forma mais inteligente" — uma direção que pode se generalizar para outros domínios de ataque adversarial além de texto, e que times de red team em NLP devem considerar ao avaliar a robustez real de classificadores implantados.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.