Um benchmark reprodutível testou seis frameworks agênticos, cinco modelos de fronteira e seis formas de embutir instruções maliciosas em imagens (texto OCR, sobreposições, metadados EXIF, QR codes, interfaces falsas e combinações), em 720 execuções. Ataques completos ocorreram em apenas 1% das execuções, mas foram tentados em 12,8%, e ao estender o teste para áudio, o único outro canal perceptivo aceito por modelos de fronteira, a taxa de conclusão do ataque saltou para 49% em média e chegou a 75% num dos modelos.
Fonte ↗O framework EvoSafeHarness busca, de forma conjunta, uma politica em linguagem natural e uma logica de codigo executavel para criar um harness de seguranca especifico para um modelo e dominio de agente, guiado por revisao adversarial em contexto fresco para evitar regras coladas ao benchmark. Em quatro familias de benchmarks de agentes, ele supera defesas fixas desenhadas por especialistas: no DecodingTrust-Agent reduz a taxa de sucesso de ataque de 45,6% para 10,0% com custo de utilidade de apenas 3,3 pontos, e no AgentDojo atinge 82,8% de utilidade com 0% de ataques bem-sucedidos, o dobro da utilidade do CaMeL no mesmo ponto operacional.
Fonte ↗Praticamente todos os benchmarks de injeção de prompt existentes testam contextos curtos, o que segundo os autores infla artificialmente a eficácia percebida das defesas atuais. O LongPIBench cobre quatro cenários realistas — revisão de artigos, triagem de currículos, revisão de código e resumo de e-mails — com contextos de milhares a dezenas de milhares de tokens, e mostra que até ataques simples de injeção conseguem taxas de sucesso altas e contornam defesas de estado da arte nesse regime.
Fonte ↗Pesquisadores apresentam o ADeptS-Bench, benchmark que avalia se agentes de uso de computador (Computer Use Agents) resistem a ameacas embutidas na propria interface visual e se pedem esclarecimento diante de instrucoes ambiguas. Nenhum dos sete modelos avaliados consegue manter mais de 80% de sucesso em tarefas legitimas com menos de 30% de taxa de sucesso de ataque, e nenhum detecta um botao de 'reset de fabrica' disfarçado como 'Otimizar'.
Fonte ↗O estudo Fair-ASR mostra que comparações de eficácia entre ataques de jailbreak são enganosas quando não controlam o número de consultas usadas contra o alvo, e que, sob orçamento igual, técnicas simples continuam competitivas com métodos elaborados guiados por LLM. Usando essa análise, os autores criam o ReCode, um ataque barato que atinge 85% de sucesso contra o GPT-5 usando apenas 20 consultas ao modelo alvo.
Fonte ↗O WeSCE mede 'security drift' — a degradação silenciosa da postura de segurança de um código quando um LLM faz edições pedidas apenas por objetivos funcionais, sem requisito de segurança explícito. O benchmark reúne 400 programas reais cobrindo adição de funcionalidades, remoção de funcionalidades, correção de bugs e refatoração, com uma métrica de risco contínua que captura tanto o caso médio quanto o pior caso.
Fonte ↗Pesquisadores avaliaram 12 agentes de codificação no Terminal-Bench 2.1 sob camadas crescentes de restrições típicas de ambientes corporativos — credenciais limitadas, egresso de rede restrito, sistemas de arquivos somente leitura e execução sem privilégios de root. Sob a política mais rígida, a perda de taxa de sucesso chegou a 18,3 pontos percentuais e o custo de execução inflou até 167,3%, com o modelo que melhor preserva o sucesso sendo justamente o que mais perde em eficiência.
Fonte ↗Pesquisadores apresentam o StealthBench, benchmark que mede a capacidade de agentes de IA autônomos executarem tarefas ofensivas de segurança sem comprometer seu próprio sigilo operacional (OPSEC). Os resultados mostram que nenhum modelo avaliado ultrapassa 54% de taxa de sucesso seguro, revelando que agentes encontram vulnerabilidades reais mas frequentemente "queimam" a operação ao cometer erros grosseiros de tradecraft.
Fonte ↗Diante de um cenário em que técnicas de jailbreak evoluem mais rápido que os benchmarks usados para medi-las, o sistema Jailbreak Foundry usa um fluxo multiagente para traduzir automaticamente papers de jailbreak em módulos executáveis dentro de um harness unificado. Reproduzindo 30 ataques com desvio médio de apenas 0,26 pontos percentuais em relação às taxas de sucesso originalmente reportadas, o sistema permite avaliação padronizada de 10 modelos-alvo sob um único juiz (GPT-4o).
Fonte ↗