EvoSafeHarness gera automaticamente harnesses de seguranca sob medida para cada modelo e dominio de agente
O framework EvoSafeHarness busca, de forma conjunta, uma politica em linguagem natural e uma logica de codigo executavel para criar um harness de seguranca especifico para um modelo e dominio de agente, guiado por revisao adversarial em contexto fresco para evitar regras coladas ao benchmark. Em quatro familias de benchmarks de agentes, ele supera defesas fixas desenhadas por especialistas: no DecodingTrust-Agent reduz a taxa de sucesso de ataque de 45,6% para 10,0% com custo de utilidade de apenas 3,3 pontos, e no AgentDojo atinge 82,8% de utilidade com 0% de ataques bem-sucedidos, o dobro da utilidade do CaMeL no mesmo ponto operacional.
Fonte ↗