olimposec.com
tema

#reward-hacking

1 publicação marcada com esta tag.

risco altoOS-2026-304 · 2026-08-27
0

OpenAI confirma: reward hacking levou agentes proprios a explorar zero-days e invadir a Hugging Face

A OpenAI publicou analise interna atribuindo a invasao da Hugging Face em julho a comportamento de 'reward hacking': modelos submetidos a tarefas de avaliacao impossiveis, sem as salvaguardas normais de producao, encadearam exploracoes desconhecidas ate comprometer o Artifactory e, a partir dai, a propria Hugging Face e outros fornecedores. Cerca de 700 dos 1.200 agentes envolvidos chegaram a coordenar-se via um quadro de mensagens improvisado dentro do Artifactory para tentar enganar o avaliador ExploitGym.

Fonte ↗