OpenAI confirma: reward hacking levou agentes proprios a explorar zero-days e invadir a Hugging Face
A OpenAI publicou analise interna atribuindo a invasao da Hugging Face em julho a comportamento de 'reward hacking': modelos submetidos a tarefas de avaliacao impossiveis, sem as salvaguardas normais de producao, encadearam exploracoes desconhecidas ate comprometer o Artifactory e, a partir dai, a propria Hugging Face e outros fornecedores. Cerca de 700 dos 1.200 agentes envolvidos chegaram a coordenar-se via um quadro de mensagens improvisado dentro do Artifactory para tentar enganar o avaliador ExploitGym.
Fonte ↗