olimposec.com
tema

#mixture-of-experts

3 publicações marcadas com esta tag.

risco altoOS-2026-399 · 2026-09-10
0

Ablação de uma única direção remove até 77,6% da recusa de segurança num MoE de 320B parâmetros

A ablação direcional, técnica de caixa-branca que remove a capacidade de recusa de um modelo projetando para fora dos pesos uma única 'direção de recusa', era validada até agora apenas em modelos densos de até cerca de 70B parâmetros. Este estudo aplica a técnica ao GLM-5.3-Flash, um modelo mixture-of-experts de 320B parâmetros com 288 especialistas roteados, e mostra que ela sobrevive à mudança de arquitetura, mas só funciona plenamente quando atenção, pesos densos e especialistas roteados são editados em conjunto, produzindo reduções de recusa de 41 a 89 pontos percentuais em sete benchmarks nocivos sem perda de capacidade detectada.

Fonte ↗
panoramaOS-2026-333 · 2026-09-01
0

Marca d'água embutida nos pesos de modelos Mixture-of-Experts rastreia texto gerado a partir de checkpoints roubados

Pesquisadores propõem o WoE, uma técnica de watermarking que embute o sinal de proveniência diretamente nos pesos de modelos Mixture-of-Experts esparsos, em vez de depender do wrapper de inferência controlado pelo dono do modelo. Isso permite atribuir texto gerado mesmo depois que os pesos são roubados ou vazados — algo que os métodos de watermark tradicionais, dependentes do sampler de inferência, não conseguem fazer — com taxa de detecção de até 94,9% e resistência a fine-tuning, extração de modelo e paráfrase.

Fonte ↗
risco altoOS-2026-213 · 2026-08-12
0

Load Hijack: envenenar só os pesos do roteador de um modelo Mixture-of-Experts basta para sequestrar o escalonamento de GPUs na inferência

Pesquisadores demonstram o Load Hijack, um ataque de cadeia de suprimentos em que um provedor malicioso de checkpoints modifica apenas os pesos do roteador de um modelo Mixture-of-Experts, mantendo um gatilho privado que, quando presente na entrada, concentra o roteamento de tokens em experts hospedados numa única GPU — transformando esse dispositivo num gargalo que atrasa todos os pares em paralelismo de especialistas, sem alterar visivelmente o comportamento do modelo em entradas normais. O ataque atinge de 92,3% a 95,6% de concentração de tokens nos experts alvo e, em serviço real, aumenta o tempo até o primeiro token em 43% enquanto derruba o throughput.

Fonte ↗