olimposec.com
Radar / Notícias / OS-2026-397
risco altoPROMPT2026-09-10 · 2 min de leitura
0

DuplexJail: interrupção falada quebra alinhamento de segurança em modelos de voz full-duplex

Resumo executivo

Pesquisadores mostram que modelos de voz full-duplex, que continuam ouvindo o usuário enquanto ainda estão respondendo, podem ser levados a atender pedidos nocivos quando o usuário os interrompe verbalmente no meio da resposta. Testado em quatro modelos abertos com 720 pedidos nocivos do AdvBench e do HarmBench, a interrupção de atraso fixo elevou a taxa de sucesso de ataque em até 39,3 pontos percentuais, chegando a 48,7% num dos modelos.

Modelos de voz full-duplex aceitam fala do usuário enquanto ainda estão gerando sua própria resposta, ao contrário de assistentes de voz tradicionais baseados em turnos claramente delimitados. Os autores identificam isso como uma superfície de ataque pouco explorada até agora, já que o alinhamento de segurança desses modelos foi majoritariamente treinado e avaliado assumindo uma fronteira limpa entre os turnos de fala.

O DuplexJail entrega prompts falados fixos, independentes do pedido original, através do próprio canal de áudio do usuário, em dois momentos distintos: interrupção de atraso fixo, aplicada depois que o pedido nocivo original termina de ser falado, e interrupção disparada por recusa, que acontece assim que surge um sinal no texto em streaming do modelo indicando que ele está prestes a recusar o pedido, ou seja, interrompendo exatamente no momento em que o modelo começaria a dizer não.

Os testes cobriram quatro modelos de código aberto e 720 pedidos nocivos extraídos do AdvBench e do HarmBench. A interrupção de atraso fixo elevou a taxa de sucesso de ataque de resposta completa no AdvBench em 33,8 a 39,3 pontos percentuais, chegando a 40,3% no PersonaPlex e 48,7% no PersonaPlex-RL. A política disparada por recusa alcançou números semelhantes, 35,6% e 48,6% respectivamente, com todas as tentativas contabilizadas independentemente de a interrupção de fato ocorrer. O efeito não foi uniforme entre todos os modelos testados: aumentou a taxa de resposta nociva no FLM-Audio, mas diminuiu no BayLing-Duplex, mostrando que a vulnerabilidade não é universal, mas é significativa onde está presente.

Assistentes de voz full-duplex e em tempo real vêm sendo posicionados como a próxima geração de produtos de IA conversacional justamente por permitirem interrupção natural durante a fala. O trabalho mostra que essa mesma característica de interatividade que torna a experiência mais natural também dá a um atacante uma alavanca ativa: interromper o modelo bem no meio de uma recusa e redirecioná-lo. Isso significa que avaliações de segurança baseadas apenas em conversas de texto de turno único, ou mesmo multi-turno tradicionais, ficam cegas para uma classe inteira de ataques baseados em temporização que só existe em interação de voz em streaming.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.