olimposec.com
tema

#unlearning

2 publicações marcadas com esta tag.

panoramaOS-2026-344 · 2026-09-02
0

Pesquisa mostra que restrições de segurança em LLMs se combinam bem, mas a utilidade do modelo não

Um estudo sobre 'implantação com gating de capacidades' — controle de acesso por usuário dentro de um único conjunto de pesos de LLM — mostra que restrições de segurança individualmente inofensivas se compõem de forma previsível quando combinadas (a interseção de restrições de múltiplos perfis aprofunda a supressão), mas o mesmo não vale para a utilidade do modelo, que pode se degradar de forma imprevisível quando perfis são combinados.

Fonte ↗
panoramaOS-2026-225 · 2026-08-13
0

Instalar um backdoor conhecido para depois removê-lo ajuda a limpar backdoors desconhecidos em agentes LLM

Pesquisadores testaram a estratégia de "envenenamento defensivo": instalar deliberadamente um backdoor conhecido num agente LLM comprometido e depois desaprendê-lo, na esperança de que o backdoor original oculto seja removido como efeito colateral. Em 115 experimentos, essa técnica sozinha eliminou cerca de 56% dos backdoors originais, e a descontaminação subsequente removeu quase todos os sobreviventes — mas vestígios do gatilho original persistiram nas camadas internas do modelo mesmo após o comportamento malicioso ser eliminado.

Fonte ↗