olimposec.com
tema

#defesa

19 publicações marcadas com esta tag.

panoramaOS-2026-385 · 2026-09-09
0

SRD-GUARD reescreve o proprio prompt do usuario para expor jailbreaks disfarcados antes de responder

O SRD-GUARD e uma defesa contra jailbreak sem acesso aos pesos do modelo (black-box) que gera cinco reescritas semanticas do prompt original removendo a "embalagem" de contexto (roleplay, cenarios ficticios) e avalia o prompt original junto com as reescritas por meio de varios avaliadores LLM independentes, combinando limiares absolutos de risco com a variacao relativa de risco entre versoes. Testado contra os ataques UNIATTACK, CIPHER e DeepInception em Llama-3-8B-Uncensored e DeepSeek-V4-Flash, alcancou taxas de defesa de 91,44% e 100% mantendo taxa de recusa indevida de pedidos legitimos entre 8% e 12%.

Fonte ↗
risco médioOS-2026-364 · 2026-09-04
0

Quando a otimização vira manipulação: defendendo buscadores generativos contra GEO maliciosa

O artigo expõe como técnicas de 'Generative Engine Optimization' (GEO) podem ser usadas de forma maliciosa para reescrever páginas web e manipular quais fontes um mecanismo de busca baseado em LLM cita em suas respostas, alcançando hoje cerca de 50% de taxa de sucesso. Os autores propõem o GEO Defender, uma defesa em duas etapas — um reranker com viés defensivo aprendido e uma biblioteca de 'experiências' em linguagem natural — que não exige retreinar o modelo alvo. Nos experimentos, a defesa derruba a taxa de sucesso do ataque para cerca de 6%, preservando o uso de conteúdo legítimo e a qualidade das respostas, inclusive contra ataques inéditos.

Fonte ↗
risco médioOS-2026-365 · 2026-09-04
0

Segurança federada e preservadora de privacidade para sistemas multi-agente de LLMs via aprendizado em grafos

Guardas de segurança que analisam o grafo de comunicação entre agentes de IA para detectar agentes comprometidos normalmente exigem centralizar dados sensíveis de várias organizações, algo inviável na prática. O FGLGuard resolve isso com aprendizado federado sobre grafos: cada operador treina localmente seu próprio detector e compartilha apenas atualizações de modelo, nunca os dados brutos. Em testes com AgentDojo, Agent-SafetyBench e R-Judge, a abordagem federada superou até modelos centralizados dentro de um único domínio, cortando em 43% a taxa de sucesso de ataques reais sem custo de API e sem expor dados entre empresas.

Fonte ↗
risco médioOS-2026-370 · 2026-09-04
0

AlcaTRAz: defesa baseada em árvores de regras ancoradas contra jailbreaks em LLMs

Pesquisadores propõem o AlcaTRAz, uma defesa aplicada apenas ao texto do prompt de entrada, sem precisar acessar pesos ou internos do modelo. A técnica aprende automaticamente uma regra de transformação que insere pequenas perturbações em nível de caractere, quebrando padrões estruturais que ataques de jailbreak exploram. Testada em 33 modelos e 22 tipos de ataque, ela superou defesas concorrentes na maioria dos casos, reduzindo drasticamente a severidade das respostas maliciosas com pouco impacto em perguntas legítimas.

Fonte ↗
panoramaOS-2026-316 · 2026-08-31
0

ROPE: controle de origem para barrar injeção indireta de prompt em agentes de IA

Pesquisadores propõem ROPE, um mecanismo que só permite que um valor chegue a uma ferramenta sensível de um agente LLM se sua origem for rastreável de forma inforjável até o usuário, uma fonte por ele nomeada ou seus próprios registros. Em testes com quatro modelos de agente, a técnica reduziu a taxa de sucesso de ataques de injeção indireta de prompt para 1,6-2,6%, contra 0% em ataques de longo horizonte que hoje derrotam defesas de nível de sistema, preservando 82-100% da utilidade do agente sem proteção.

Fonte ↗
panoramaOS-2026-321 · 2026-08-31
0

CAITLYN combina biblioteca de regras com síntese autônoma de defesas contra novas injeções de prompt

CAITLYN é um middleware de defesa agnóstico ao agente que ataca o 'trilema' entre eficiência, precisão contextual e adaptabilidade das defesas atuais contra prompt injection, combinando uma camada imediata de detecção baseada em regras e inferência por LLM (System I) com uma camada que monitora sinais anômalos e sintetiza autonomamente novas defesas verificadas (System II). Em um novo benchmark de técnicas de injeção emergentes, o System I isolado permaneceu vulnerável, mas o System II reduziu substancialmente a taxa de sucesso de ataque em três ambientes de agente distintos.

Fonte ↗
risco médioOS-2026-323 · 2026-08-31
0

DeLLMGuard dificulta que agentes de LLM usem código-fonte verificado de contratos inteligentes para achar exploits

Contratos inteligentes costumam publicar o código-fonte verificado contra o bytecode em produção para gerar confiança, mas isso também dá a agentes LLM um caminho direto para escanear vulnerabilidades e produzir exploits em escala. O DeLLMGuard separa o código-fonte divulgado da execução real espalhando-a por múltiplos endereços de contrato (relações de proxy, delegate e factory), forçando o agente a reconstruir essa topologia antes de analisar vulnerabilidades — o que, em 387 contratos vulneráveis reais, derrubou a taxa de identificação correta da causa-raiz de 23,5% para 6,6%.

Fonte ↗
risco médioOS-2026-299 · 2026-08-26
0

RAGSentinel detecta documentos envenenados em RAG sem precisar de treinamento ou rótulos

Defesa geométrica para sistemas RAG usa um encoder substituto para medir como cada documento recuperado desloca o estado oculto do modelo, filtrando como outliers os documentos que tentam manipular a resposta, com garantia formal de recuperar um contexto livre de veneno sob suposição de maioria honesta.

Fonte ↗
risco médioOS-2026-260 · 2026-08-20
0

FedLNS propõe triagem no servidor contra clientes maliciosos em treinamento federado de LLMs

Pesquisadores apresentam o FedLNS, um mecanismo do lado do servidor para detectar atualizações maliciosas em aprendizado federado de modelos de linguagem, sem exigir acesso aos dados brutos dos clientes nem exemplos rotulados de ataque. A ideia é usar as mudanças nos parâmetros das camadas de normalização (LayerNorm) de cada atualização de cliente como uma "assinatura" comparável a uma referência histórica robusta entre clientes. Em experimentos com até 40% dos clientes manipulando alvos de treino, o método reduziu a perplexidade do modelo global mais do que seis baselines concorrentes, em arquiteturas estilo GPT, BERT e LLaMA.

Fonte ↗
panoramaOS-2026-232 · 2026-08-18
0

STAR-FL: defesa em duas camadas contra envenenamento de dados em aprendizado federado

O paper propõe o STAR-FL, um framework de defesa para federated learning que combina clustering espaço-temporal para identificar atualizações maliciosas de clientes com um ajuste adaptativo da taxa de aprendizado na agregação, reduzindo o impacto de envenenamentos que escapam da primeira camada. Os autores reportam desempenho superior a defesas do estado da arte contra ataques de poisoning direcionados em múltiplos benchmarks de visão computacional.

Fonte ↗
panoramaOS-2026-198 · 2026-08-11
0

Defesa "Capability-Routed Guard" mira jailbreaks que exploram o raciocínio de modelos de raciocínio grandes

Pesquisadores propõem o Capability-Routed Guard (CRG), uma defesa de inferência para modelos de raciocínio de código fechado que ataca um problema específico: prompts adversariais que manipulam o contexto de raciocínio ou a decomposição de tarefas para fazer o modelo tratar um objetivo malicioso como um passo de raciocínio legítimo. Em vez de inspecionar o prompt adversarial diretamente, o CRG constrói uma representação confiável da tarefa autorizada por um canal separado e roteia a execução conforme o risco.

Fonte ↗
panoramaOS-2026-200 · 2026-08-11
0

BASIS usa sinais de atenção para reduzir recusas desnecessárias em defesas de prompt injection

O BASIS ataca um problema pouco discutido em defesas contra prompt injection: modelos bem instruídos conseguem resistir à maioria das injeções sozinhos, mas defesas tradicionais recusam qualquer entrada onde uma injeção é detectada, mesmo quando o modelo teria lidado com ela corretamente. Usando um sinal chamado Attention Competition Ratio para treinar dois probes lineares esparsos, o método mantém detecção quase perfeita de injeção reduzindo substancialmente essas recusas desnecessárias, sem exigir inferência adicional do LLM.

Fonte ↗
panoramaOS-2026-156 · 2026-08-06
0

AgentAntibody propõe defesa que aprende com cada tentativa de prompt injection contra agentes de LLM

Os autores propõem uma analogia com o sistema imune adaptativo: em vez de tratar cada tarefa como um problema isolado, o AgentAntibody mantém uma biblioteca persistente de 'anticorpos' que captura o entendimento evolutivo do agente sobre os limites de segurança aceitáveis pelo usuário, aplicando esse aprendizado acumulado a cada nova interação. Em testes com três benchmarks e quatro LLMs base, o método superou defesas existentes tanto em bloquear ações maliciosas quanto em preservar a conclusão de tarefas legítimas.

Fonte ↗
panoramaOS-2026-161 · 2026-08-06
0

SecureCollaRAG usa validação por GNN para blindar sistemas RAG colaborativos contra envenenamento de conhecimento

Sistemas de geração aumentada por recuperação (RAG) reduzem alucinação em LLMs, mas abrem uma nova superfície de ataque: envenenar os documentos recuperados para manipular a saída do modelo. O SecureCollaRAG propõe um framework tolerante a falhas bizantinas que valida dinamicamente a proveniência dos documentos usando credibilidade baseada em GNN, mantendo robustez mesmo sob distribuições de dados não-IID entre agentes colaborativos.

Fonte ↗
risco médioOS-2026-137 · 2026-08-03
0

Framework detecta injeção de prompt distribuída em enxames de drones controlados por LLM

Pesquisadores propõem um framework de verificação em tempo de execução, em três camadas, para detectar violações de missão em enxames de drones e robôs assistidos por LLM que emergem apenas da composição de ações individualmente aceitáveis em cada plataforma. Em simulação, o framework detectou uma injeção indireta de prompt que fez quatro plataformas dividirem entre si um objetivo proibido, algo invisível a monitores por plataforma. O design evita 'tudo limpo' falso quando falta evidência, em vez de assumir segurança por padrão.

Fonte ↗
risco médioOS-2026-072 · 2026-07-23
0

ChannelGuard revela que a seguranca de pipelines multi-agente depende de filtros que ninguem media

Um estudo com 2.100 execucoes de ataque mostra que pipelines multi-agente que pareciam totalmente seguros em relatorios padrao (0% de sucesso de ataque) na verdade devem quase toda essa protecao a um filtro server-side do provedor de nuvem, e nao a defesas da propria aplicacao. Os autores propoem o ChannelGuard, portoes de information bottleneck colocados em cada canal entre agentes, para fechar essa lacuna sem depender de um unico ponto de filtragem opaco.

Fonte ↗
panoramaOS-2026-076 · 2026-07-23
0

FedLSG usa LLM em arquitetura student-teacher para defender aprendizado federado em grafos contra backdoor

O FedLSG e apresentado como o primeiro framework a integrar LLMs na defesa contra ataques de backdoor em Redes Neurais de Grafos Federadas (FedGNNs), traduzindo estruturas de grafo e comportamento de clientes para linguagem natural de modo que um LLM possa avaliar semanticamente se uma atualizacao e maliciosa. A motivacao e que defesas baseadas em regras fixas sao vulneraveis a gatilhos furtivos justamente por nao entenderem o significado semantico dos padroes que estao filtrando.

Fonte ↗
panoramaOS-2026-079 · 2026-07-23
0

DeCNIP remove backdoors de LLMs podando neuronios criticos identificados por analise representacional

O DeCNIP e uma defesa contra backdoors em LLMs que vai alem de heuristicas comportamentais, identificando e podando um conjunto minimo de neuronios responsaveis por ativar o gatilho malicioso. O metodo cobre tanto backdoors inseridos por fine-tuning quanto por edicao direta de modelo, reduzindo a taxa de sucesso do ataque em mais de 95% intervindo em apenas 0,1% dos neuronios e preservando 97% do desempenho original em tarefas normais.

Fonte ↗