Pesquisa questiona se 'guardrails' que passam em testes de fato tornam sistemas de LLM mais seguros
Um artigo argumenta que as métricas usuais para avaliar salvaguardas de LLM (taxa de recusa, taxa de sucesso de ataque, taxa de violação de política) só medem desempenho contra os ataques testados, não respondem à pergunta que realmente importa em produção: quanta ajuda com tarefas nocivas um atacante persistente ainda consegue extrair do serviço. Revisando a literatura, os autores mostram que a maioria dos artigos que propõe melhorias em salvaguardas não fornece evidência suficiente sobre o que o sistema como um todo ainda permite depois da salvaguarda atuar.
Fonte ↗