MMPIBench mede injeção de prompt multimodal via imagem e áudio contra frameworks de agentes de IA
Um benchmark reprodutível testou seis frameworks agênticos, cinco modelos de fronteira e seis formas de embutir instruções maliciosas em imagens (texto OCR, sobreposições, metadados EXIF, QR codes, interfaces falsas e combinações), em 720 execuções. Ataques completos ocorreram em apenas 1% das execuções, mas foram tentados em 12,8%, e ao estender o teste para áudio, o único outro canal perceptivo aceito por modelos de fronteira, a taxa de conclusão do ataque saltou para 49% em média e chegou a 75% num dos modelos.
Fonte ↗