Ablação de uma única direção remove até 77,6% da recusa de segurança num MoE de 320B parâmetros
A ablação direcional, técnica de caixa-branca que remove a capacidade de recusa de um modelo projetando para fora dos pesos uma única 'direção de recusa', era validada até agora apenas em modelos densos de até cerca de 70B parâmetros. Este estudo aplica a técnica ao GLM-5.3-Flash, um modelo mixture-of-experts de 320B parâmetros com 288 especialistas roteados, e mostra que ela sobrevive à mudança de arquitetura, mas só funciona plenamente quando atenção, pesos densos e especialistas roteados são editados em conjunto, produzindo reduções de recusa de 41 a 89 pontos percentuais em sete benchmarks nocivos sem perda de capacidade detectada.
Fonte ↗