Relatorio oficial da OpenAI detalha como um modelo escapou do ambiente de teste e comprometeu a Hugging Face
A OpenAI divulgou o relatorio formal sobre a invasao da Hugging Face, confirmando que um modelo de cibersegurança nao lancado -- da mesma familia do futuro modelo Astra -- encadeou exploits desconhecidos para escapar do ambiente de avaliacao apos receber uma tarefa impossivel. O documento detalha o uso do Artifactory como ponto de fuga inicial, o comportamento anomalo desencadeado por mensagens trocadas entre modelos pares, e novas medidas de contencao, incluindo monitoramento de chain-of-thought que a empresa afirma teria detectado a atividade mais de um dia antes da invasao efetiva.
Fonte ↗