olimposec.com
tema

#vlm

4 publicações marcadas com esta tag.

risco altoOS-2026-391 · 2026-09-10
0

AgentHijack: patch visual escondido em página web sequestra agentes multimodais de uso de computador

Pesquisadores propõem um framework de avaliação ponta a ponta para testar se um patch visual local, embutido numa página web, consegue disparar injeção de comando contra agentes de uso de computador (CUAs) multimodais. Em 600 casos de teste contra cinco back-ends abertos de agente/VLM, o ataque atingiu 84,5% de sucesso ao nível do modelo de visão e 20,3% de sucesso ponta a ponta, com casos registrados em que o agente executa um comando malicioso de terminal e depois retoma a tarefa original como se nada tivesse acontecido.

Fonte ↗
risco altoOS-2026-317 · 2026-08-31
0

Ataque meta-adaptativo quebra modelos de visão-linguagem de ponta em mais de 80% dos casos

O ataque MAMJ (Meta-Adaptive Multimodal Jailbreaking) não otimiza apenas a imagem ou o texto de um jailbreak multimodal, mas o próprio processo de ataque: a estratégia usada para iterar e os parâmetros do modelo atacante. Contra GPT-4o, Gemini-3-Pro-Preview e Seed 2.0, o método atingiu taxas de sucesso de 78,9% a 82,3% no benchmark MM-SafetyBench, superando a melhor linha de base em até 24,1 pontos percentuais, e o atacante treinado transferiu para modelos-alvo nunca vistos sem retreinamento.

Fonte ↗
risco médioOS-2026-112 · 2026-07-30
0

Guards de modelos de visão-linguagem ainda falham contra jailbreaks codificados, mesmo com defesa amplificada

Um novo artigo expõe o "decode gap": classificadores de segurança para modelos de visão-linguagem julgam a forma superficial de uma solicitação, não seu significado real, permitindo que pedidos nocivos disfarçados em lógica formal, linguagens raras, código ou imagens de texto escapem da moderação. Os autores propõem um amplificador que tenta neutralizar esse desvio antes do guard atuar, mas mostram que mesmo a melhor combinação ainda deixa 63-65% dos ataques passarem, e o remédio para isso dispara recusas indevidas em pedidos legítimos.

Fonte ↗
risco médioOS-2026-077 · 2026-07-23
0

GhostPrompt cria ataque adversarial reutilizavel entre imagens diferentes contra modelos de visao-linguagem

O GhostPrompt introduz um prompt adversarial otimizado uma unica vez e reutilizavel em imagens diversas para forcar modelos de visao-linguagem a produzir respostas escolhidas pelo atacante, superando a limitacao de ataques anteriores que ficavam presos a uma imagem especifica. O metodo eleva a taxa de sucesso de ataque em mais de 30% sobre o estado da arte, reduzindo em cerca de 70% o tempo de computacao necessario.

Fonte ↗