olimposec.com
tema

#ataque-black-box

3 publicações marcadas com esta tag.

risco médioOS-2026-371 · 2026-09-04
0

UMPeek: ataque infere o "modelo do usuário" oculto guardado por agentes de IA personalizados

Pesquisadores mostraram que agentes de LLM personalizados que armazenam apenas um "modelo do usuário" compactado (em vez do texto original) não são tão privados quanto se supunha. O ataque UMPeek, por sondagem adaptativa guiada por hipóteses, consegue reconstruir informações privadas do usuário observando apenas o comportamento visível do agente, sem acesso a registros brutos ou ao estado interno. O método foi validado tanto em benchmarks quanto em sistemas reais em produção, superando ataques existentes e resistindo a defesas aplicadas no nível da resposta.

Fonte ↗
risco médioOS-2026-335 · 2026-09-01
0

OASIS otimiza a combinação de ataques adversariais contra classificadores de texto em cenário black-box hard-label

OASIS é um método que otimiza a sequência — não apenas a escolha individual — de ataques adversariais de texto em cenários black-box hard-label, realizando uma busca única para equilibrar taxa de sucesso e tamanho da perturbação, e reaproveitando essa cadeia depois. O trabalho mostra que a composição de atacantes é, ela mesma, um alvo de otimização capaz de superar tanto atacantes isolados quanto combinações manuais em vários datasets e modelos vítima, incluindo LLMs.

Fonte ↗
risco médioOS-2026-194 · 2026-08-11
0

Primeiro ataque adversarial black-box contra modelo de OCR generativo expõe falhas de decodificação

Pesquisadores apresentam o que descrevem como o primeiro ataque adversarial totalmente black-box contra um modelo de OCR generativo (baseado no Deep-OCR/DeepSeek-OCR), atuando apenas a partir da string de saída, sem acesso a gradientes ou logits. Perturbações imperceptíveis na imagem, otimizadas via estimativa de gradiente por diferenças finitas, foram suficientes para causar repetição, truncamento e vazamento de instruções internas do decodificador.

Fonte ↗