olimposec.com
tema

#alinhamento

10 publicações marcadas com esta tag.

risco altoOS-2026-397 · 2026-09-10
0

DuplexJail: interrupção falada quebra alinhamento de segurança em modelos de voz full-duplex

Pesquisadores mostram que modelos de voz full-duplex, que continuam ouvindo o usuário enquanto ainda estão respondendo, podem ser levados a atender pedidos nocivos quando o usuário os interrompe verbalmente no meio da resposta. Testado em quatro modelos abertos com 720 pedidos nocivos do AdvBench e do HarmBench, a interrupção de atraso fixo elevou a taxa de sucesso de ataque em até 39,3 pontos percentuais, chegando a 48,7% num dos modelos.

Fonte ↗
risco altoOS-2026-399 · 2026-09-10
0

Ablação de uma única direção remove até 77,6% da recusa de segurança num MoE de 320B parâmetros

A ablação direcional, técnica de caixa-branca que remove a capacidade de recusa de um modelo projetando para fora dos pesos uma única 'direção de recusa', era validada até agora apenas em modelos densos de até cerca de 70B parâmetros. Este estudo aplica a técnica ao GLM-5.3-Flash, um modelo mixture-of-experts de 320B parâmetros com 288 especialistas roteados, e mostra que ela sobrevive à mudança de arquitetura, mas só funciona plenamente quando atenção, pesos densos e especialistas roteados são editados em conjunto, produzindo reduções de recusa de 41 a 89 pontos percentuais em sete benchmarks nocivos sem perda de capacidade detectada.

Fonte ↗
panoramaOS-2026-378 · 2026-09-09
0

Bait-and-Recover: defesa envenena os sinais internos que ataques white-box usam para editar pesos de LLMs

Pesquisadores propoem uma defesa em nivel de pesos contra ataques de representation engineering, em que um atacante com acesso total ao modelo (peso aberto) estima a direcao interna de recusa e edita a matriz de projecao para desativar o alinhamento de seguranca em minutos, sem treinamento por gradiente. O metodo, chamado Bait-and-Recover, coloca um adaptador "isca" exatamente onde o atacante mede as ativacoes e um adaptador de "recuperacao" na camada seguinte, treinados via gradient routing para desacoplar o que o atacante observa do que o modelo de fato faz. Em quatro modelos abertos testados, a taxa minima de recusa sob esse tipo de ataque subiu de 16,25% para 71,75%, com impacto minimo na capacidade geral.

Fonte ↗
panoramaOS-2026-344 · 2026-09-02
0

Pesquisa mostra que restrições de segurança em LLMs se combinam bem, mas a utilidade do modelo não

Um estudo sobre 'implantação com gating de capacidades' — controle de acesso por usuário dentro de um único conjunto de pesos de LLM — mostra que restrições de segurança individualmente inofensivas se compõem de forma previsível quando combinadas (a interseção de restrições de múltiplos perfis aprofunda a supressão), mas o mesmo não vale para a utilidade do modelo, que pode se degradar de forma imprevisível quando perfis são combinados.

Fonte ↗
panoramaOS-2026-144 · 2026-08-05
0

Ataques white-box mostram que a segurança de LLMs pode ser desligada 'por dentro' — pesquisadores propõem rotas dinâmicas para blindar o modelo

Um novo estudo descreve uma classe de ataques que, ao invés de tentar contornar as defesas de um LLM por fora (jailbreaks clássicos), localiza e desativa diretamente os neurônios ou 'rotas' internas responsáveis pelo comportamento de recusa. Como resposta, os autores propõem o DRAA, um mecanismo que identifica essas rotas de segurança e constrói caminhos de recusa alternativos e dinâmicos que continuam funcionando mesmo quando a rota original é comprometida.

Fonte ↗
risco médioOS-2026-146 · 2026-08-05
0

Perguntar em lote engana a segurança dos LLMs: pesquisa expõe falha de alinhamento no 'batch prompting'

Um estudo mostra que perguntas nocivas normalmente recusadas de forma confiável quando enviadas isoladamente conseguem obter respostas prejudiciais quando embutidas em um lote de perguntas benignas — um ataque simples, de caixa preta, que não exige nenhuma modificação no modelo. Os autores atribuem a falha ao enfraquecimento do sinal de alinhamento e à diluição do sinal de recusa quando várias perguntas competem pelo mesmo contexto, e propõem uma otimização de preferência específica para lotes como mitigação.

Fonte ↗
risco altoOS-2026-130 · 2026-08-03
0

Guardrails de agentes GUI 'erodem' sob persuasão em múltiplos turnos, incluindo em Claude e GPT

Um estudo com três agentes de IA de ponta que operam interfaces gráficas mostra que guardrails baseados em prompt, eficazes em avaliações de turno único, perdem boa parte da eficácia quando o pedido malicioso é fragmentado ao longo de uma conversa de quatro turnos. A queda de robustez aparece nos três modelos testados, incluindo Claude e GPT, e o próprio guardrail muda o padrão de ataque mais eficaz — pedidos velados passam a funcionar melhor que explícitos. Os autores concluem que métricas de ataque de turno único superestimam sistematicamente a robustez real de agentes implantados.

Fonte ↗
risco altoOS-2026-135 · 2026-08-03
0

Pesquisa mostra como transformar o próprio alinhamento de segurança de LLMs em arma para bloquear RAG

Pesquisadores mostram que é possível transformar o próprio alinhamento de segurança de LLMs em uma arma para bloquear respostas legítimas de sistemas RAG, explorando a semelhança de critérios de recusa entre modelos diferentes, a chamada 'homogeneidade de alinhamento'. O ataque, batizado TabooRAG, envenena um único documento por consulta com contexto de risco, sem instrução explícita, e transfere bem entre modelos nunca vistos durante o ataque. Os resultados mostram 67% de ganho sobre a melhor defesa existente, configurando um ataque de negação de serviço difícil de filtrar com detectores tradicionais de prompt injection.

Fonte ↗
risco médioOS-2026-096 · 2026-07-28
0

Mask2Shield tenta blindar LLMs contra ataques que podam neurônios responsáveis pela recusa de conteúdo nocivo

Pesquisadores mostram que o comportamento de recusa de LLMs alinhados costuma depender de um pequeno conjunto de neurônios que, se removidos por poda (pruning), eliminam a segurança do modelo sem destruir sua capacidade geral. Em resposta, propõem o Mask2Shield, um método de treinamento que força o modelo a manter a recusa mesmo quando esses neurônios são artificialmente desativados durante o treino.

Fonte ↗
risco altoOS-2026-030 · 2026-07-20
0

Pesquisadores demonstram transferência de raciocínio nocivo entre modelos para criar jailbreaks reutilizáveis

Um novo estudo mostra que traços de chain-of-thought extraídos de modelos comprometidos podem ser transplantados para outros modelos, elevando taxas de resposta nociva acima de 80% nos alvos mais vulneráveis. A técnica também permite destilar padrões recorrentes de raciocínio malicioso em prompts de sistema reutilizáveis, superando o transplante direto em até 10x, inclusive contra o GPT-4.1.

Fonte ↗