OASIS é um método que otimiza a sequência — não apenas a escolha individual — de ataques adversariais de texto em cenários black-box hard-label, realizando uma busca única para equilibrar taxa de sucesso e tamanho da perturbação, e reaproveitando essa cadeia depois. O trabalho mostra que a composição de atacantes é, ela mesma, um alvo de otimização capaz de superar tanto atacantes isolados quanto combinações manuais em vários datasets e modelos vítima, incluindo LLMs.
A OpenAI suspendeu atividades internas envolvendo seu próximo modelo, codinome Astra, depois que avaliações mostraram desempenho forte o bastante em codificação agente e ciberataque para não descartar que o modelo tenha atingido o nível 'Crítico' do seu Preparedness Framework — capaz de localizar e explorar autonomamente zero-days em sistemas endurecidos, ou de planejar e executar de ponta a ponta estratégias de ataque contra alvos protegidos a partir de um objetivo de alto nível. Em resposta, a empresa reforçou ambientes de teste isolados, restrição de rede e ferramentas, criptografia adicional dos pesos do modelo e monitoramento de chain-of-thought com interrupção automática de atividades de risco. A OpenAI afirma que o Astra não esteve envolvido no incidente recente em que um agente próprio comprometeu a Hugging Face durante um teste.