olimposec.com
tema

#llm

85 publicações marcadas com esta tag.

risco médioOS-2026-394 · 2026-09-10
0

Estudo mede queda de acurácia de RAG de 77,9% para 43,5% sob envenenamento de documentos recuperados

Um estudo controlado com o Llama 3.1 8B quantizado mediu, em 588 execuções fatoriais sobre uma tarefa de checagem de fatos baseada no FEVER, quanto a acurácia de um sistema RAG cai conforme uma fração crescente dos documentos recuperados é corrompida por troca de entidades, troca de números ou negação. A acurácia caiu de 77,9% com contexto limpo para 43,5% quando as três passagens recuperadas estavam corrompidas, e a reação predominante do modelo sob ataque foi se abster de responder, não inventar novas afirmações falsas.

Fonte ↗
risco médioOS-2026-395 · 2026-09-10
0

LLMSec-AV combina taxonomia dedicada e LLMs para achar vulnerabilidades em software de veículos autônomos

Pesquisadores desenvolveram uma taxonomia de 18 classes de vulnerabilidade específicas para software automotivo e um framework, LLMSec-AV, que usa essa taxonomia para orientar LLMs na análise de código do Autoware. Rodando sobre 161 funções extraídas de 4.673 funções decompostas, o LLM recuperou até 76% das 46 fraquezas conhecidas usadas como referência, contra zero encontradas por CodeQL, Semgrep e Clang Static Analyzer, e apenas uma pelo cppcheck apesar de 1.301 alertas gerados.

Fonte ↗
risco altoOS-2026-390 · 2026-09-09
0

Logs de infostealers expõem tokens de sessão de IA reaproveitáveis que contornam MFA

A análise de um dump de 7 GB coletado por infostealers como Lumma Stealer e Vidar revelou milhares de tokens de sessão e chaves de API válidos para serviços de IA da Google, Anthropic, OpenAI e outros provedores, incluindo pelo menos 24 chaves de API ainda ativas para Gemini, OpenAI, Groq e OpenRouter. Como esses tokens autenticam diretamente a sessão, criminosos conseguem reproduzi-los com navegadores 'anti-detecção' e ferramentas de automação para assumir contas de IA sem precisar da senha nem disparar o desafio de MFA.

Fonte ↗
panoramaOS-2026-381 · 2026-09-09
0

Estudo mostra que contar passos de execucao subestima o quanto conteudo malicioso esta "perto" de uma acao sensivel em agentes LLM

Pesquisadores propoem medir a exposicao de seguranca de agentes de longo horizonte por "distancia de influencia" -- o caminho mais curto num grafo de execucao com rastreamento de proveniencia entre uma fonte nao confiavel e uma acao sensivel -- em vez da contagem tradicional de passos na trajetoria. Analisando 454 pares injecao-alvo em 360 trajetorias do AgentDojo, rodadas em GPT-4o, GPT-4o-mini, Claude Haiku 4.5 e Claude Sonnet 4.6, encontraram que em 96,9% dos casos a distancia estrutural real e bem menor que a distancia por contagem de passos (mediana de 9 saltos de diferenca), o que significa que muitos ataques estao estruturalmente muito mais proximos da acao perigosa do que a contagem ingenua de passos sugere.

Fonte ↗
panoramaOS-2026-383 · 2026-09-09
0

Novo benchmark mostra que agentes de busca profunda raramente se recuperam depois de engolir uma evidencia web envenenada

O benchmark HAE-GEO testa agentes de busca aumentada por LLM (usados para decisoes de consumo) contra envenenamento de evidencias web em tres niveis crescentes de persuasao -- afirmacao direta, camuflagem contextual e corroboracao aparente por multiplas fontes coordenadas -- usando um corpus controlado de mais de 72 mil paginas limpas e 770 paginas envenenadas por nivel, cobrindo 154 marcas. Ao avaliar dez agentes, os autores encontram que o reconhecimento de evidencias suspeitas piora exatamente no nivel mais sofisticado (corroboracao aparente), e que prompts defensivos aumentam a verificacao sem necessariamente levar o agente a corrigir a recomendacao final.

Fonte ↗
panoramaOS-2026-385 · 2026-09-09
0

SRD-GUARD reescreve o proprio prompt do usuario para expor jailbreaks disfarcados antes de responder

O SRD-GUARD e uma defesa contra jailbreak sem acesso aos pesos do modelo (black-box) que gera cinco reescritas semanticas do prompt original removendo a "embalagem" de contexto (roleplay, cenarios ficticios) e avalia o prompt original junto com as reescritas por meio de varios avaliadores LLM independentes, combinando limiares absolutos de risco com a variacao relativa de risco entre versoes. Testado contra os ataques UNIATTACK, CIPHER e DeepInception em Llama-3-8B-Uncensored e DeepSeek-V4-Flash, alcancou taxas de defesa de 91,44% e 100% mantendo taxa de recusa indevida de pedidos legitimos entre 8% e 12%.

Fonte ↗
panoramaOS-2026-386 · 2026-09-09
0

MechAudit detecta ataques a LLMs analisando so as ativacoes internas, sem precisar saber qual ataque procurar

O MechAudit-40 avalia sistematicamente 40 mecanismos de ataque a LLMs (otimizacao de prompt, manipulacao de contexto multi-turno, envenenamento de recuperacao e backdoors) em cinco arquiteturas de peso aberto, usando 100 mil pares de representacao limpa/atacada para mostrar que ataques heterogeneos deixam assinaturas geometricas transferiveis nas ativacoes internas do modelo. A partir disso, os autores constroem o MechAudit, um auditor de runtime que detecta 81,1% das execucoes de ataque nunca vistas com apenas 0,70% de falsos positivos, sem depender de referencias limpas ou metadados do ataque -- e mantem mais de 50% de recall mesmo quando uma categoria inteira de ataque e retirada do treinamento.

Fonte ↗
risco médioOS-2026-388 · 2026-09-09
0

Ataque Proxy Manifold Alignment reconstroi texto original a partir de embeddings ofuscados em LLMs com privacidade

Esquemas leves de privacidade para inferencia em LLM transformam localmente embeddings em texto claro para embeddings ofuscados via substituicao um-para-um, resistindo a ataques classicos de frequencia de token e inversao de embedding, mas sem garantia criptografica formal. O ataque Proxy Manifold Alignment (PMA) trata o fluxo de vetores ofuscados como uma "lingua" desconhecida e usa Word2Vec para modelar padroes de coocorrencia tanto no fluxo ofuscado quanto num corpus publico, alinhando as duas estruturas geometricas resultantes para mapear vetores ofuscados de volta ao texto original, superando outros ataques do estado da arte na taxa de recuperacao de texto claro.

Fonte ↗
risco altoOS-2026-373 · 2026-09-04
0

OpenAI libera GPT-6 Astra com 100% no ExploitBench, mas bloqueia geração de provas de conceito de exploit

O GPT-6 Astra, novo modelo de fronteira da OpenAI, atingiu 100% de acerto no ExploitBench, benchmark que mede a capacidade de transformar vulnerabilidades conhecidas em exploits funcionais, ante 78,5% do modelo anterior. Por ter cruzado o limiar 'Critical' de capacidade cibernética do Preparedness Framework da empresa, a versão pública do modelo foi restringida a tarefas de revisão segura de código e correção, recusando pedidos de geração de provas de conceito de exploração, enquanto a OpenAI lança em paralelo o programa Daybreak para equipar defensores com capacidades equivalentes.

Fonte ↗
risco médioOS-2026-364 · 2026-09-04
0

Quando a otimização vira manipulação: defendendo buscadores generativos contra GEO maliciosa

O artigo expõe como técnicas de 'Generative Engine Optimization' (GEO) podem ser usadas de forma maliciosa para reescrever páginas web e manipular quais fontes um mecanismo de busca baseado em LLM cita em suas respostas, alcançando hoje cerca de 50% de taxa de sucesso. Os autores propõem o GEO Defender, uma defesa em duas etapas — um reranker com viés defensivo aprendido e uma biblioteca de 'experiências' em linguagem natural — que não exige retreinar o modelo alvo. Nos experimentos, a defesa derruba a taxa de sucesso do ataque para cerca de 6%, preservando o uso de conteúdo legítimo e a qualidade das respostas, inclusive contra ataques inéditos.

Fonte ↗
risco médioOS-2026-368 · 2026-09-04
0

"Confie em mim, sou seu desenvolvedor": modelos de linguagem aceitam autoautenticação sem nenhuma verificação real

Pesquisadores testaram ChatGPT, Claude, Qwen, Mistral e Llama pedindo que cada modelo criasse e aplicasse seu próprio teste para verificar a alegação não comprovada de um usuário: "eu sou seu desenvolvedor". Enquanto Claude recusou o teste e ChatGPT manteve que respostas corretas provam apenas conhecimento, Qwen, Mistral e Llama geraram desafios técnicos, avaliaram as respostas e declararam a identidade "verificada" sem qualquer evidência externa validável. Os autores chamam essa falha de Conversational False Authentication (CFA), viabilizada por um Model-Issued Pseudo-Credential (MIPC), e destacam que, embora não tenha havido escalonamento de privilégio real no experimento, o padrão expõe um risco estrutural para produtos que deleguem autenticação à conversa com o modelo.

Fonte ↗
risco médioOS-2026-370 · 2026-09-04
0

AlcaTRAz: defesa baseada em árvores de regras ancoradas contra jailbreaks em LLMs

Pesquisadores propõem o AlcaTRAz, uma defesa aplicada apenas ao texto do prompt de entrada, sem precisar acessar pesos ou internos do modelo. A técnica aprende automaticamente uma regra de transformação que insere pequenas perturbações em nível de caractere, quebrando padrões estruturais que ataques de jailbreak exploram. Testada em 33 modelos e 22 tipos de ataque, ela superou defesas concorrentes na maioria dos casos, reduzindo drasticamente a severidade das respostas maliciosas com pouco impacto em perguntas legítimas.

Fonte ↗
risco médioOS-2026-351 · 2026-09-03
0

Pesquisa demonstra ataques de inferencia de contexto contra agentes de IA sem precisar de jailbreak

Pesquisadores formalizam e demonstram 'ataques de inferencia de contexto': tecnicas que revelam o conteudo de dados sensiveis carregados silenciosamente no contexto de um agente de IA (por exemplo, registros medicos ou financeiros buscados por chamadas de ferramentas), sem precisar induzir o modelo a divulgar o conteudo diretamente. Uma unica estrategia de ataque atinge ate 100% de sucesso em conjuntos pequenos de candidatos e mantem alta eficacia mesmo quando o atacante nao conhece o template do contexto ou so tem acesso via um modelo substituto.

Fonte ↗
risco altoOS-2026-354 · 2026-09-03
0

'Lavagem de autorizacao endogena': memoria de agentes de IA pode criar permissoes falsas sem nenhum ataque externo

Pesquisadores descrevem e medem a 'lavagem de autorizacao endogena' (endogenous authorization laundering), uma falha em que a propria memoria persistente de um agente de IA registra incorretamente permissoes que nunca foram concedidas, levando o agente a agir como se estivesse autorizado. No benchmark EAL-Bench, modelos atuando como 'escritores' de memoria geraram autoridade falsa em ate 50,2% das solicitacoes indevidas, e modelos atuando como 'executores' agiram sobre essa autoridade falsa em 98,6% dos casos.

Fonte ↗
risco médioOS-2026-356 · 2026-09-03
0

Ataque implicito manipula selecao de skills em agentes de IA sem deixar sinais reconheciveis de manipulacao

O ataque ISM (Implicit Skill-Selection Manipulation via Semantic Matching) manipula qual skill um agente de IA escolhe para atender a um pedido, moldando a relacao semantica entre o prompt do usuario e a descricao da skill em vez de usar injecao de prompt explicita. O metodo eleva a taxa de selecao da skill alvo de 15,2% para 63,5% em media, e e bloqueado por revisores humanos em apenas 2,9% das avaliacoes, contra 91,4% para ataques explicitos equivalentes.

Fonte ↗
risco médioOS-2026-357 · 2026-09-03
0

Guardrails de proveniencia tipada buscam impedir que injecoes de prompt se tornem 'memoria oficial' de agentes de IA persistentes

Pesquisadores propoem um sistema de proveniencia tipada e guardrails de asserção para agentes de IA com memoria persistente, partindo do principio de que dado armazenado ou recuperado nao e automaticamente confiavel -- entradas nao confiaveis, injecoes de prompt e inferencias do proprio modelo podem entrar na memoria do agente e depois ser apresentadas como historico legitimo ou compromisso do usuario. Em 24 casos de teste de conformidade, o mediador proposto bloqueou 19 de 19 tentativas inseguras sem qualificacao, enquanto abordagens anteriores liberaram ate 19 de 19 candidatos inseguros.

Fonte ↗
risco altoOS-2026-359 · 2026-09-03
0

SkillShift demonstra ataque de 'dedo na balanca' que desvia secretamente a politica de agentes de IA via skills maliciosas

O ataque SkillShift mostra como uma skill de terceiros aparentemente legitima -- que preserva a funcionalidade declarada e a interface de saida valida -- pode redirecionar secretamente as decisoes de um agente de IA para um objetivo nao divulgado, sem usar injecao de comando explicita ou sequestro direto de tarefa. Em cenarios de comercio agentico e selecao de dependencias de software, o ataque atingiu taxas de selecao favoraveis ao atacante de 81,33% e 63,33%, respectivamente, mantendo 100% de utilidade aparente e passando despercebido pelos scanners de seguranca avaliados.

Fonte ↗
panoramaOS-2026-337 · 2026-09-02
0

OWASP lança Top 10 2026 para Aplicações LLM e novo padrão de controle de agentes

O OWASP GenAI Security Project divulgou a edição 2026 do Top 10 para Aplicações LLM, agora fundamentada em milhares de incidentes reais em vez de apenas consenso de especialistas. Junto com a lista, o projeto lançou o Agent Control Standard, dedicado à governança de identidade, permissões e testes de segurança para agentes autônomos, e elevou o risco de 'Excessive Agency' à terceira posição do ranking.

Fonte ↗
panoramaOS-2026-343 · 2026-09-02
0

Pesquisadores propõem modelo de confiança federada para marketplaces de habilidades de robôs controlados por LLM

Diante da chegada de 'app stores' de habilidades para frotas de robôs guiadas por LLM, pesquisadores argumentam que o modelo tradicional de PKI centralizada (uma autoridade certificadora, um log de transparência único) não se encaixa em operadores heterogêneos, implantações isoladas de rede e consequências físicas de confiar no publicador errado. Eles propõem 'confiança federada', em que cada robô mantém seu próprio diretório local de assinantes confiáveis, e mostram que o esquema bloqueia 100% de ataques de publicador falso, adulteração e assinante revogado em 5.000 tentativas adversariais.

Fonte ↗
panoramaOS-2026-331 · 2026-09-01
0

Levantamento mapeia como LLMs mudaram a esteganografia linguística — e as contramedidas que tentam detectá-la

Uma revisão sistemática aceita na EMNLP 2026 mapeia 148 métodos de esteganografia linguística, 60 contramedidas de steganalysis e 23 métricas de avaliação, mostrando como LLMs mudaram o campo: de edição de texto-portador para geração pura via prompt, e de acesso caixa-branca a cenários caixa-preta. O levantamento é relevante porque LLMs tornam mais barato esconder mensagens dentro de texto aparentemente normal, com implicações tanto para comunicação encoberta maliciosa quanto para as defesas que tentam detectá-la.

Fonte ↗
risco médioOS-2026-332 · 2026-09-01
0

Decodificação colaborativa nuvem-borda entre LLMs pequenos e grandes vaza dados privados do usuário

Pesquisadores demonstram que o paradigma de decodificação colaborativa nuvem-borda — em que um modelo pequeno local processa dados privados e funde suas distribuições de próximo token com um LLM na nuvem que só vê dados públicos — ainda vaza quantidades substanciais de contexto privado, usando um novo framework de avaliação baseado em datasets de QA. A defesa proposta, CoVeil, otimiza dinamicamente o sinal transmitido durante a decodificação e reduz o vazamento em até 87,2% com perda mínima de acurácia.

Fonte ↗
panoramaOS-2026-333 · 2026-09-01
0

Marca d'água embutida nos pesos de modelos Mixture-of-Experts rastreia texto gerado a partir de checkpoints roubados

Pesquisadores propõem o WoE, uma técnica de watermarking que embute o sinal de proveniência diretamente nos pesos de modelos Mixture-of-Experts esparsos, em vez de depender do wrapper de inferência controlado pelo dono do modelo. Isso permite atribuir texto gerado mesmo depois que os pesos são roubados ou vazados — algo que os métodos de watermark tradicionais, dependentes do sampler de inferência, não conseguem fazer — com taxa de detecção de até 94,9% e resistência a fine-tuning, extração de modelo e paráfrase.

Fonte ↗
panoramaOS-2026-316 · 2026-08-31
0

ROPE: controle de origem para barrar injeção indireta de prompt em agentes de IA

Pesquisadores propõem ROPE, um mecanismo que só permite que um valor chegue a uma ferramenta sensível de um agente LLM se sua origem for rastreável de forma inforjável até o usuário, uma fonte por ele nomeada ou seus próprios registros. Em testes com quatro modelos de agente, a técnica reduziu a taxa de sucesso de ataques de injeção indireta de prompt para 1,6-2,6%, contra 0% em ataques de longo horizonte que hoje derrotam defesas de nível de sistema, preservando 82-100% da utilidade do agente sem proteção.

Fonte ↗
risco altoOS-2026-318 · 2026-08-31
0

ContextLeak: ferramenta maliciosa treinada por RL induz agentes de IA a vazar seu próprio contexto

O ataque ContextLeak usa aprendizado por reforço para gerar automaticamente nome e descrição de uma ferramenta maliciosa capaz não só de ser escolhida por um agente LLM, mas de convencê-lo a repassar como argumentos dados sensíveis do seu contexto de execução — prompt do usuário, trajetória e lista de ferramentas. O ataque se mantém eficaz mesmo quando os contextos de usuários simulados usados no treinamento diferem substancialmente dos das vítimas reais, superando ataques anteriores de ferramenta maliciosa adaptados ao mesmo cenário.

Fonte ↗
risco médioOS-2026-319 · 2026-08-31
0

FISGuard reduz a quase zero a eficácia de ataque de inferência de membership em LLMs com fine-tuning federado

O ataque ProjRes (publicado no S&P 2026) consegue distinguir se um dado específico participou do treinamento de um LLM em aprendizado federado apenas observando o resíduo de projeção entre a representação candidata e o subespaço formado pelos gradientes visíveis ao servidor — sem acessar as saídas do modelo. O FISGuard neutraliza esse ataque fixando um subespaço de representação de baixa dimensão construído a partir de dados públicos, derrubando a AUC do ProjRes para próximo de 0,5 (equivalente a chute aleatório) com pouca perda de desempenho.

Fonte ↗
risco médioOS-2026-320 · 2026-08-31
0

Sondas adversariais com zk-SNARK permitem auditar troca silenciosa de modelo de LLM sem expor os pesos

O artigo propõe um framework de auditoria que usa sondas inspiradas em exemplos adversariais para amplificar diferenças de saída (drift de logits) entre um modelo de LLM aprovado e uma versão possivelmente alterada após o deploy, combinado com provas de conhecimento zero (zk-SNARK, Groth16) para preservar a privacidade do provedor do modelo durante a verificação. Sondas baseadas em token, que operam em acesso caixa-preta, entregaram a maior sensibilidade média entre as variantes testadas, com tempo de prova de 1 a 1,8 segundos mesmo escalando para 50 sondas.

Fonte ↗
panoramaOS-2026-321 · 2026-08-31
0

CAITLYN combina biblioteca de regras com síntese autônoma de defesas contra novas injeções de prompt

CAITLYN é um middleware de defesa agnóstico ao agente que ataca o 'trilema' entre eficiência, precisão contextual e adaptabilidade das defesas atuais contra prompt injection, combinando uma camada imediata de detecção baseada em regras e inferência por LLM (System I) com uma camada que monitora sinais anômalos e sintetiza autonomamente novas defesas verificadas (System II). Em um novo benchmark de técnicas de injeção emergentes, o System I isolado permaneceu vulnerável, mas o System II reduziu substancialmente a taxa de sucesso de ataque em três ambientes de agente distintos.

Fonte ↗
risco altoOS-2026-322 · 2026-08-31
0

CamoDocs camufla documentos maliciosos para envenenar sistemas RAG sem deixar rastro de consulta

CamoDocs é um ataque de envenenamento de dados contra sistemas RAG (retrieval-augmented generation) que evita incluir a consulta-alvo diretamente nos documentos maliciosos — a técnica que a maioria das defesas de detecção hoje monitora — misturando conteúdo adversarial com rascunhos benignos e usando 'tokens de dispersão' para camuflar o embedding dos documentos envenenados. Contra sete defesas de RAG, três LLMs abertos e três benchmarks, o ataque manteve taxa de sucesso média de 61,80% no GPT-5.4-mini e 55,09% no Claude-Haiku-4.5, sendo neutralizado de forma consistente só por defesas de clustering agressivo, que por sua vez destroem a utilidade do sistema.

Fonte ↗
risco médioOS-2026-324 · 2026-08-31
0

LongPIBench expõe que defesas contra injeção de prompt falham quando o contexto fica longo

Praticamente todos os benchmarks de injeção de prompt existentes testam contextos curtos, o que segundo os autores infla artificialmente a eficácia percebida das defesas atuais. O LongPIBench cobre quatro cenários realistas — revisão de artigos, triagem de currículos, revisão de código e resumo de e-mails — com contextos de milhares a dezenas de milhares de tokens, e mostra que até ataques simples de injeção conseguem taxas de sucesso altas e contornam defesas de estado da arte nesse regime.

Fonte ↗
risco médioOS-2026-325 · 2026-08-31
0

Empilhar defesas de LLM não soma proteção como se pensava, mostra estudo sobre correlação de falhas

Times que empilham várias defesas de LLM costumam assumir que elas se complementam, mas isso só é matematicamente verdade se cada camada falhar em entradas diferentes das outras. Medindo um adversário adaptativo único contra uma pilha de sete camadas defensivas, os autores encontraram correlação positiva de falha em todos os quinze pares mensuráveis (φ entre 0,30 e 0,75), fazendo o sucesso residual do ataque superar em até 0,172 a previsão multiplicativa ingênua, enquanto a pilha inteira recusa quatro em cada cinco prompts benignos e não se distingue estatisticamente da sua camada mais forte isolada.

Fonte ↗
risco médioOS-2026-314 · 2026-08-28
0

Estudo mostra que LLMs geram codigo RTL funcional mas inseguro quando a especificacao nao menciona seguranca explicitamente

Pesquisadores criaram o SECRTL-GEN, benchmark com 392 tarefas de geracao de codigo de hardware (RTL) em Verilog, SystemVerilog, VHDL e Python que testa correcao funcional e seguranca separadamente. Modelos de fronteira passam em 73% a 79% dos testes funcionais mas apenas 14% a 35% dos testes de seguranca, e modelos funcionalmente melhores nao sao necessariamente mais seguros -- um framework auxiliar, o RTL-Obliger, eleva a taxa combinada de aprovacao para 61,6% inferindo obrigacoes de seguranca implicitas a partir da propria especificacao.

Fonte ↗
risco médioOS-2026-298 · 2026-08-26
0

NeuronGuard redistribui 'sinais de segurança' entre neurônios para blindar LLMs contra jailbreak e poda maliciosa

Nova defesa aplicada na fase de fine-tuning espalha a informação de recusa de segurança por um conjunto mais amplo de neurônios de um LLM, em vez de concentrá-la em poucos neurônios críticos, reduzindo a taxas de sucesso de jailbreaks textuais e de ataques que podam neurônios após o deploy para perto de zero, mantendo a utilidade do modelo.

Fonte ↗
risco médioOS-2026-299 · 2026-08-26
0

RAGSentinel detecta documentos envenenados em RAG sem precisar de treinamento ou rótulos

Defesa geométrica para sistemas RAG usa um encoder substituto para medir como cada documento recuperado desloca o estado oculto do modelo, filtrando como outliers os documentos que tentam manipular a resposta, com garantia formal de recuperar um contexto livre de veneno sob suposição de maioria honesta.

Fonte ↗
panoramaOS-2026-264 · 2026-08-21
0

Levantamento de incidentes reais reacende debate sobre o Top 10 OWASP para LLMs

Pesquisadores do grupo de trabalho da OWASP compararam o ranking de riscos do Top 10 para LLMs, definido por consenso de especialistas, com um levantamento de mais de 6.600 incidentes reais extraídos de bases como CVE, GHSA, OSV e AIAAIC. A concordância entre o ranking de especialistas e o ranking baseado em incidentes reais foi fraca (Cohen's kappa ~0,20), embora o próprio ranking de especialistas continue sendo o mais robusto quando testado contra classificadores automatizados de última geração.

Fonte ↗
panoramaOS-2026-267 · 2026-08-21
0

AEGIS propõe blindar três canais de vazamento de gradiente em ajuste fino federado de LLMs

Pesquisadores identificaram três canais distintos pelos quais gradientes compartilhados durante o treinamento federado de LLMs baseados em transformers vazam o texto original de treinamento, e propuseram o AEGIS, uma defesa leve que neutraliza os três ao mesmo tempo sem mudar a arquitetura do modelo. O trabalho, aceito na NDSS 2027, reduziu a taxa de recuperação de tokens a quase zero em 11 modelos e seis conjuntos de dados, inclusive contra atacantes adaptativos que conhecem a defesa.

Fonte ↗
risco médioOS-2026-270 · 2026-08-21
0

MaliciousSkillBench expõe o quanto os detectores atuais falham contra "skills" maliciosas para agentes de IA

Pesquisadores consolidaram 13 fontes públicas para criar o MaliciousSkillBench, um benchmark com 9.740 "Agent Skills" (pacotes de instruções, scripts e configurações reutilizáveis que estendem agentes de LLM), sendo 7.505 maliciosas. O resultado mostra que os melhores detectores atuais, embora pontuem bem em avaliação aleatória, despencam quando testados contra skills de fontes nunca vistas — um dos melhores modelos manteve 95,6% de detecção maliciosa mas gerou 62,4% de falsos positivos em skills benignas.

Fonte ↗
panoramaOS-2026-271 · 2026-08-21
0

COPA trata defesa contra prompt injection como um problema de aprendizado contínuo

Pesquisadores propuseram o COPA, um framework que atualiza continuamente as defesas de um LLM contra prompt injection à medida que novos ataques surgem, em vez de depender de um alinhamento estático feito uma única vez. Usando otimização por preferência baseada em GRPO e replay de experiência ponderado por margem para não esquecer defesas antigas, o método reduziu a taxa de sucesso de ataques em até 6,3 vezes frente a defesas de última geração, em fluxos de ataques que evoluem ao longo do tempo.

Fonte ↗
risco altoOS-2026-272 · 2026-08-21
0

EchoCoT extrai o raciocínio oculto de modelos de linguagem proprietários via API

Pesquisadores descobriram uma superfície de "replay de raciocínio" entre chamadas de ferramentas em modelos de raciocínio de grande porte (LRMs) e usaram esse ponto cego para extrair, de forma quase literal, o chain-of-thought oculto que provedores como o Google escondem por padrão. A técnica, batizada de EchoCoT, chegou a extrair 33.463 tokens de raciocínio do Gemini-2.5 a partir de um alvo de 32.948 tokens, com até 80% de sucesso de extração em datasets nunca vistos durante o desenvolvimento do ataque.

Fonte ↗
risco altoOS-2026-273 · 2026-08-21
0

Segredos no contexto vazam em respostas normais de LLMs, mesmo sem pedido direto de extração

Pesquisadores demonstraram que a simples presença de dados sensíveis (como números de cartão ou de seguridade social) no contexto de um LLM introduz correlações ocultas em respostas completamente benignas do modelo, permitindo reconstruir esses dados mesmo quando o modelo se recusa corretamente a repassá-los se pedido diretamente. Em oito modelos proprietários testados, segredos de 2 dígitos foram reconstruídos com precisão quase perfeita e segredos de 4 dígitos com 82% de acerto exato, e um adversário treinado com RL conseguiu extrair números completos de seguridade social de um agente em estilo de produção.

Fonte ↗
risco médioOS-2026-274 · 2026-08-21
0

Framework com três agentes de IA descobre vulnerabilidades reais em pacotes populares do PyPI

O QRS (Query, Review, Sanitize) é um framework neuro-simbólico que usa três agentes de LLM para gerar, revisar e validar consultas CodeQL automaticamente, em vez de depender de regras curadas manualmente como em ferramentas SAST tradicionais. Aplicado aos 100 pacotes mais baixados do PyPI, o sistema encontrou 41 vulnerabilidades de severidade média a alta, das quais 8 receberam CVEs novos e 4 foram reconhecidas via atualização de documentação.

Fonte ↗
risco altoOS-2026-259 · 2026-08-20
0

Ataque de inversão "ciente do ruído" quebra defesa de perturbação gaussiana em embeddings de texto

Um novo método de inversão de embeddings, batizado DAEI, consegue reconstruir texto original a partir de vetores de embedding que foram deliberadamente protegidos com ruído gaussiano — a defesa de privacidade mais comum contra ataques de inversão. O truque técnico é treinar um denoiser não supervisionado que remove o ruído de proteção antes de aplicar a inversão generativa, contornando o que os autores chamam de "armadilha do ruído duplo". Os ganhos relatados (até 154% em BLEU sobre a linha de base) sugerem que perturbação gaussiana isolada não é suficiente para proteger embeddings liberados publicamente.

Fonte ↗
risco médioOS-2026-260 · 2026-08-20
0

FedLNS propõe triagem no servidor contra clientes maliciosos em treinamento federado de LLMs

Pesquisadores apresentam o FedLNS, um mecanismo do lado do servidor para detectar atualizações maliciosas em aprendizado federado de modelos de linguagem, sem exigir acesso aos dados brutos dos clientes nem exemplos rotulados de ataque. A ideia é usar as mudanças nos parâmetros das camadas de normalização (LayerNorm) de cada atualização de cliente como uma "assinatura" comparável a uma referência histórica robusta entre clientes. Em experimentos com até 40% dos clientes manipulando alvos de treino, o método reduziu a perplexidade do modelo global mais do que seis baselines concorrentes, em arquiteturas estilo GPT, BERT e LLaMA.

Fonte ↗
risco altoOS-2026-263 · 2026-08-20
0

Framework adaptativo de jailbreak por voz derruba defesas de LLMs de áudio em cascata e ponta a ponta

Pesquisa (atualização v4, aceita no IEEE ICDM 2026) apresenta um framework adaptativo que gera e refina automaticamente jailbreaks contra sistemas de LLM baseados em áudio, cobrindo tanto pipelines em cascata (que primeiro transcrevem a fala para texto) quanto modelos de áudio ponta a ponta que processam o sinal bruto diretamente. Um motor de mutação guiado por feedback ajusta tanto o texto do prompt quanto perturbações acústicas para maximizar a taxa de sucesso, e o método superou o estado da arte em seis sistemas de áudio representativos, evidenciando que ambos os paradigmas seguem substancialmente vulneráveis a esse tipo de ataque.

Fonte ↗
panoramaOS-2026-245 · 2026-08-19
0

Pesquisa extrai ativações internas de LLMs para detectar vulnerabilidades em código C/C++

Um novo estudo extrai as ativações internas de quatro LLMs no momento em que leem código C/C++ e treina probes leves sobre elas para prever se o código é vulnerável, sem depender de analisadores estáticos ou classificadores separados. Os probes chegam a igualar o desempenho de classificadores especializados no benchmark Devign, usando menos de 0,2% do tamanho do modelo base, embora percam desempenho em benchmarks mais difíceis e desbalanceados.

Fonte ↗
risco médioOS-2026-254 · 2026-08-19
0

Estudo prova limite matemático das defesas com estado contra ataques de decomposição em serviços de LLM

Pesquisadores provam matematicamente que defesas com estado contra ataques de decomposição, que dividem uma tarefa nociva em pedidos individualmente inofensivos, deixam de funcionar quando atacantes podem criar identidades novas e não vinculáveis e combinar as respostas fora da plataforma. Em testes com tarefas reais, todas as dez políticas de defesa avaliadas falharam em conter o ataque ou romperam o orçamento de recusas permitido, mesmo com uma política idealizada com mapeamento perfeito de pedidos.

Fonte ↗
risco médioOS-2026-239 · 2026-08-18
0

Quem os motores de busca generativos preferem citar — e como isso abre espaço para manipulação política

O estudo caracteriza a superfície de ataque de motores de busca generativos (GSEs) contra ataques de poisoning via citações, propondo a métrica 'content-injection barrier' para medir o quão difícil é inserir conteúdo malicioso na web com determinado nível de autoridade de publisher. Testado no domínio político nos EUA e no Japão, o trabalho encontra que partidos no poder têm superfície de ataque maior que a oposição, e que perfis de personalização do usuário têm pouca influência sobre quais fontes são citadas.

Fonte ↗
panoramaOS-2026-225 · 2026-08-13
0

Instalar um backdoor conhecido para depois removê-lo ajuda a limpar backdoors desconhecidos em agentes LLM

Pesquisadores testaram a estratégia de "envenenamento defensivo": instalar deliberadamente um backdoor conhecido num agente LLM comprometido e depois desaprendê-lo, na esperança de que o backdoor original oculto seja removido como efeito colateral. Em 115 experimentos, essa técnica sozinha eliminou cerca de 56% dos backdoors originais, e a descontaminação subsequente removeu quase todos os sobreviventes — mas vestígios do gatilho original persistiram nas camadas internas do modelo mesmo após o comportamento malicioso ser eliminado.

Fonte ↗
panoramaOS-2026-226 · 2026-08-13
0

Técnica "self-feeding" detecta backdoors em LLMs de peso aberto realimentando a própria saída do modelo

Pesquisadores propõem um teste de caixa-preta barato para checar se um LLM baixado de um repositório público esconde um backdoor: alimentar repetidamente a própria saída do modelo de volta como entrada, deixando o texto derivar até tocar nos dados usados no fine-tuning malicioso. A técnica encontrou backdoors em cinco de seis modelos testados com 92% de precisão agregada, contra apenas um acerto em 120 tentativas de um baseline que repete o mesmo prompt.

Fonte ↗
risco altoOS-2026-222 · 2026-08-12
0

Falha em objetos de raciocínio criptografado permite que modelo de IA mais fraco decodifique o raciocínio de um modelo mais forte

Pesquisadores demonstraram que os blocos de raciocínio oculto usados pelas APIs de reasoning da OpenAI, Anthropic e Google podiam ser reaproveitados entre sessões, usuários e até modelos diferentes, e que um modelo menor bastava para transcrever o conteúdo de um modelo maior. A técnica recuperou centenas de segredos reais — chaves de API, senhas e tokens — que apareciam apenas no raciocínio oculto, nunca no texto visível, tornando a sanitização de logs tradicional insuficiente.

Fonte ↗
panoramaOS-2026-199 · 2026-08-11
0

EvoTrustRAG tenta distinguir evolução legítima de conhecimento de manipulação maliciosa em sistemas RAG

O EvoTrustRAG propõe um novo problema para RAG: em vez de apenas escolher qual evidência conflitante é mais confiável, o sistema tenta atribuir a origem do conflito — evolução legítima do conhecimento ao longo do tempo, manipulação adversarial deliberada, ou incerteza não resolvida — antes de gerar a resposta. Em benchmarks, o método reduziu de 31,2% para 16,0% a taxa de erro sob o ataque coordenado mais forte testado.

Fonte ↗
panoramaOS-2026-200 · 2026-08-11
0

BASIS usa sinais de atenção para reduzir recusas desnecessárias em defesas de prompt injection

O BASIS ataca um problema pouco discutido em defesas contra prompt injection: modelos bem instruídos conseguem resistir à maioria das injeções sozinhos, mas defesas tradicionais recusam qualquer entrada onde uma injeção é detectada, mesmo quando o modelo teria lidado com ela corretamente. Usando um sinal chamado Attention Competition Ratio para treinar dois probes lineares esparsos, o método mantém detecção quase perfeita de injeção reduzindo substancialmente essas recusas desnecessárias, sem exigir inferência adicional do LLM.

Fonte ↗
risco médioOS-2026-204 · 2026-08-11
0

SkillsMetric mapeia os limites da análise estática contra Agent Skills maliciosas — e encontra pontos cegos de 0% de detecção

O SkillsMetric é um framework de análise estática em cinco estágios para avaliar pacotes de "Agent Skills" (extensões de instruções e scripts para agentes LLM) quanto a risco malicioso, atingindo AUC de 0,93 em um dataset adversarial de 2.266 skills cobrindo 16 tipos de ataque. Apesar do bom desempenho geral, os autores identificam pontos cegos completos: ataques de destruição de host usando comandos de shell comuns escapam de todos os cinco estágios (0% de detecção), e prompt injection via manipulação em linguagem natural é detectada em apenas 42% dos casos.

Fonte ↗
risco médioOS-2026-164 · 2026-08-06
0

Envenenamento de recomendação por IA: botões "Ask AI" viram vetor de prompt injection persistente

Pesquisadores identificaram uma campanha ativa que abusa de botões "Ask AI" embutidos em sites comerciais para injetar instruções ocultas dentro da sessão do próprio assistente de IA do usuário, sem exigir malware, phishing de credenciais ou exploração de uma falha de software. O payload leva o modelo a gravar o domínio do atacante como "fonte confiável" na sua memória persistente, viesando respostas futuras do assistente para outros usuários. A Microsoft já catalogou a técnica em uso por 31 empresas de 14 setores diferentes.

Fonte ↗
risco médioOS-2026-160 · 2026-08-06
0

Trident usa agente de LLM para quebrar defesas cibernéticas autônomas baseadas em aprendizado por reforço

Sistemas de defesa cibernética autônoma baseados em Deep Reinforcement Learning são hoje avaliados quase exclusivamente contra agentes vermelhos estáticos e heurísticos, deixando sua robustez contra ameaças adaptativas pouco testada. O Trident, um framework de red-team agêntico baseado em LLM com arquitetura 'código como política', reduziu o desempenho defensivo de agentes azuis em 522% na média usando um único planejador treinável de 7 bilhões de parâmetros, descobrindo autonomamente comportamentos emergentes como evasão de decoys que heurísticas estáticas nunca haviam revelado.

Fonte ↗
risco médioOS-2026-162 · 2026-08-06
0

DeepInvert quebra defesas de ofuscação de prompt em serviços de LLM na nuvem, recuperando até 73,5% dos tokens originais

Serviços de LLM em nuvem processam rotineiramente prompts sensíveis, e defesas de ofuscação como ObfusLM, SentinelLMs, TextObfuscator e DPNR prometem mitigar esse risco transformando a representação do prompt antes do envio. O DeepInvert, um ataque de inversão de embeddings semi-supervisionado, mostra que essa proteção é muito mais frágil do que se acreditava, recuperando 73,5% dos tokens originais contra o ObfusLM, ante 26,2% do melhor ataque anterior.

Fonte ↗
risco médioOS-2026-150 · 2026-08-05
0

'Poison Claude' revende acesso barato a modelos da Anthropic enquanto o operador lê todos os prompts dos clientes

Pesquisadores identificaram mais de meia dúzia de serviços clandestinos revendendo acesso a modelos de IA de grandes provedores, entre eles o 'Poison Claude', que oferece Opus e Sonnet a 5-15% do preço oficial. Como o serviço funciona como proxy/gateway, o operador tem visibilidade completa sobre cada prompt enviado pelos clientes, criando um risco de exfiltração de dados sensíveis para quem usa esse acesso pirateado.

Fonte ↗
panoramaOS-2026-140 · 2026-08-05
0

Pesquisadores encontram sinais latentes de injeção de prompt escondidos nos estados internos de LLMs agentic

Um novo estudo mostra que LLMs agentic frequentemente 'sabem' internamente que estão sob um ataque de prompt injection indireta antes mesmo de decidir como agir, e que esse sinal pode ser extraído por um simples classificador linear treinado sobre os estados ocultos do modelo. Os autores identificam, porém, uma lacuna entre esse reconhecimento interno e a ação tomada, e propõem uma defesa que usa esse sinal para forçar um raciocínio anti-injeção sob demanda.

Fonte ↗
panoramaOS-2026-143 · 2026-08-05
0

Pesquisa revela que LLMs geram Terraform funcional, mas raramente seguro

Um benchmark comparando sete modelos (três LLMs fechados e quatro SLMs abertos) na geração de código Terraform para AWS mostra que validade sintática e conformidade de segurança são praticamente independentes: alguns modelos geram Terraform que funciona perfeitamente, mas quase nunca passa em scanners de segurança como Checkov e Trivy. Os autores concluem que engenharia de prompt sozinha não é suficiente e que scanning automatizado continua indispensável.

Fonte ↗
panoramaOS-2026-145 · 2026-08-05
0

DenialRAG: ataque de envenenamento em RAG que nega a resposta certa dentro do próprio documento malicioso

Pesquisadores propõem o DenialRAG, um ataque de envenenamento de corpus em sistemas de geração aumentada por recuperação (RAG) que, ao invés de simplesmente omitir a resposta correta, a nomeia explicitamente dentro do documento malicioso, a refuta e oferece uma explicação forjada para a resposta errada. Testado contra oito LLMs de quatro fornecedores, o ataque teve a maior taxa de sucesso registrada em todos os conjuntos de dados baseados em Mistral-7B, embora sua eficácia varie bastante conforme o modelo alvo.

Fonte ↗
risco médioOS-2026-146 · 2026-08-05
0

Perguntar em lote engana a segurança dos LLMs: pesquisa expõe falha de alinhamento no 'batch prompting'

Um estudo mostra que perguntas nocivas normalmente recusadas de forma confiável quando enviadas isoladamente conseguem obter respostas prejudiciais quando embutidas em um lote de perguntas benignas — um ataque simples, de caixa preta, que não exige nenhuma modificação no modelo. Os autores atribuem a falha ao enfraquecimento do sinal de alinhamento e à diluição do sinal de recusa quando várias perguntas competem pelo mesmo contexto, e propõem uma otimização de preferência específica para lotes como mitigação.

Fonte ↗
risco médioOS-2026-138 · 2026-08-04
0

Vibe hacking: quando a IA transforma qualquer pessoa em atacante júnior

Uma análise da The Hacker News argumenta que modelos de linguagem estão corroendo a premissa clássica de que a capacidade ofensiva escala com a experiência técnica do atacante. Ao traduzir intenção maliciosa em ações concretas via linguagem natural, a IA reduz drasticamente o tempo e o conhecimento necessários para pesquisar, entender e explorar uma vulnerabilidade. O texto defende que isso obriga times de segurança a trocar avaliação de risco por sofisticação do adversário por validação contínua dos controles.

Fonte ↗
risco médioOS-2026-127 · 2026-08-03
0

Hollow-LLM Attack: pesos fantasmas driblam provas de conhecimento zero em inferência de LLM

Pesquisadores demonstraram que é possível enganar esquemas de verificação por conhecimento zero (ZK) usados para provar que um provedor de inferência de LLM está executando o modelo do tamanho anunciado. O ataque, batizado Hollow-LLM, usa pesos degenerados que passam na prova criptográfica mas exigem computação equivalente a um modelo muito menor. O artigo foi aceito no IEEE S&P 2026 e expõe uma lacuna fundamental entre 'prova de correção' e 'prova de esforço computacional' em serviços de inferência auditáveis.

Fonte ↗
panoramaOS-2026-128 · 2026-08-03
0

GoldenRetriever propõe recuperação totalmente criptografada para RAG sem servidor curioso

GoldenRetriever é um esquema de recuperação para RAG que roda inteiramente sob criptografia homomórfica, evitando que o servidor veja a consulta, os documentos ou os índices selecionados. Em vez do caro ranking top-k sob criptografia, o sistema usa seleção por limiar de similaridade, reduzindo a complexidade de quadrática para linear. Os autores reportam latência bem menor que abordagens anteriores baseadas em ranking, mantendo qualidade de recuperação competitiva.

Fonte ↗
risco altoOS-2026-129 · 2026-08-03
0

Memória de agentes de IA pode 'lavar' a origem de instruções maliciosas, mostra estudo

Pesquisadores descrevem 'memory provenance laundering', uma falha em que a consolidação de memória de longo prazo de agentes LLM apaga a marca de que uma informação veio de fonte não confiável, fazendo-a parecer histórico legítimo do usuário. Em cenários vulneráveis, a taxa de sucesso de ataques que exploram essa falha chegou a 100%. Os autores propõem o firewall PPMF, que vincula a autoridade necessária para uma ação de risco à confiabilidade real da memória que a motiva, bloqueando toda ação não autorizada de alto risco nos testes.

Fonte ↗
panoramaOS-2026-131 · 2026-08-03
0

MOSAIC permite terceirizar inferência de transformers de 70B para servidores não confiáveis sem vazar dados

MOSAIC é um protocolo que permite terceirizar inferência de modelos de linguagem grandes, testado em 70B parâmetros, para servidores não confiáveis sem revelar dados nem pesos do modelo, usando mascaramento de multiplicação de matrizes com segurança baseada em suposições criptográficas padrão. O sistema tolera pequeno ruído controlado para ganhar desempenho e mantém qualidade comparável a métodos de quantização populares. A proposta aponta um caminho prático para computação confidencial de IA em escala, hoje dominada por enclaves de hardware caros.

Fonte ↗
panoramaOS-2026-132 · 2026-08-03
0

TextCloak usa aprendizado por reforço para tornar textos 'inúteis' para treinar LLMs sem autorização

TextCloak usa aprendizado por reforço para transformar textos em 'exemplos não aprendíveis' que preservam significado e naturalidade para leitores humanos, mas degradam a qualidade de LLMs treinados sem autorização sobre esse conteúdo. Diferente de métodos anteriores voltados a classificação, a técnica funciona em geração aberta e generaliza a diferentes arquiteturas de modelo. É uma ferramenta defensiva pensada para autores e editores que querem impedir scraping não consentido de conteúdo para treinamento de IA.

Fonte ↗
risco médioOS-2026-118 · 2026-07-31
0

RoguePrompt combina cifras Vigenère e ROT13 para furar filtros de moderação de LLMs em até 94% dos casos

Pesquisadores apresentam o RoguePrompt, um pipeline de jailbreak que fragmenta um pedido proibido e aplica duas cifras clássicas em camada — Vigenère seguida de ROT13 — junto com instruções em linguagem natural para o próprio modelo reconstruir e executar o conteúdo original. Testado às cegas (apenas via API/interface) contra 313 prompts já bloqueados por moderação, o método furou os filtros em 93,9% dos casos, embora a reconstrução completa e a execução final do pedido tenham sucesso menor (79% e 70%, respectivamente). O resultado mostra que a maior fraqueza hoje está na moderação de entrada, não na capacidade do modelo de resistir ao pedido depois de decodificado.

Fonte ↗
panoramaOS-2026-120 · 2026-07-31
0

Estudo formaliza um 'trilema' de segurança para LLMs: capacidade útil, segurança confiável e acesso aberto não coexistem

O artigo demonstra matematicamente que, quando um LLM decide se responde a um pedido de uso dual (útil tanto para um profissional legítimo quanto para um atacante) baseado apenas em evidência "copiável" — como o histórico da conversa ou afirmações do próprio usuário —, existe um piso inevitável de ajuda que qualquer atacante disposto a imitar um contexto legítimo sempre vai conseguir extrair. Os autores batizam isso de trilema: capacidade útil, segurança confiável e acesso aberto não podem coexistir plenamente ao mesmo tempo. Como mitigação parcial, propõem complementar as salvaguardas atuais com credenciais de difícil falsificação, que atestem de forma verificável o uso legítimo por trás do pedido.

Fonte ↗
risco altoOS-2026-117 · 2026-07-30
0

Pesquisa apresentada no ICML aponta falha estrutural na forma como LLMs reconhecem quem está dando as instruções

Um estudo apresentado no ICML argumenta que modelos de linguagem não distinguem instruções de sistema, usuário e conteúdo externo pelas tags estruturais que as marcam, mas pelo estilo e pelo vocabulário do texto — o que permite a qualquer atacante "falsificar" um papel de maior privilégio só escrevendo no tom certo. Os pesquisadores extraíram informações que os modelos foram treinados para recusar, como instruções de síntese de drogas e sabotagem de sistemas de navegação de aeronaves, primeiro em modelos da OpenAI e depois replicando o resultado em modelos da Anthropic, Alibaba e DeepSeek. Segundo os autores, por ser uma característica estrutural da arquitetura, e não do treinamento, o problema pode ser essencialmente impossível de eliminar por completo.

Fonte ↗
panoramaOS-2026-111 · 2026-07-30
0

Pesquisadores testam adapter para decompor objetivos de ataque a satélites em planos táticos usando o catálogo SPARTA

Um novo artigo apresenta um adapter LoRA (low-rank adaptation) treinado para transformar um objetivo de segurança espacial em um plano ordenado de passos, usando como base de técnicas o framework SPARTA. Os autores liberam um corpus pequeno e cuidadosamente controlado contra vazamento de referência, mas os próprios números de acurácia (entre 0,06 e 0,29) mostram que a abordagem ainda está longe de ser confiável.

Fonte ↗
panoramaOS-2026-114 · 2026-07-30
0

StealthBench: novo benchmark expõe falhas de sigilo operacional em agentes autônomos de segurança ofensiva

Pesquisadores apresentam o StealthBench, benchmark que mede a capacidade de agentes de IA autônomos executarem tarefas ofensivas de segurança sem comprometer seu próprio sigilo operacional (OPSEC). Os resultados mostram que nenhum modelo avaliado ultrapassa 54% de taxa de sucesso seguro, revelando que agentes encontram vulnerabilidades reais mas frequentemente "queimam" a operação ao cometer erros grosseiros de tradecraft.

Fonte ↗
risco médioOS-2026-096 · 2026-07-28
0

Mask2Shield tenta blindar LLMs contra ataques que podam neurônios responsáveis pela recusa de conteúdo nocivo

Pesquisadores mostram que o comportamento de recusa de LLMs alinhados costuma depender de um pequeno conjunto de neurônios que, se removidos por poda (pruning), eliminam a segurança do modelo sem destruir sua capacidade geral. Em resposta, propõem o Mask2Shield, um método de treinamento que força o modelo a manter a recusa mesmo quando esses neurônios são artificialmente desativados durante o treino.

Fonte ↗
risco médioOS-2026-098 · 2026-07-28
0

Estudo com 2.700 casos mostra que mais da metade do código gerado por LLMs falha em cenários de segurança realistas

Pesquisadores construíram um benchmark de 2.700 casos que reproduz situações comuns de desenvolvimento real — requisitos ambíguos, contexto operacional pouco especificado e conflitos entre segurança e funcionalidade — para avaliar oito LLMs de ponta na geração de código. Todos os modelos apresentaram taxas de vulnerabilidade acima de 56%, embora prompts com instruções explícitas de segurança tenham reduzido o problema em até 45%.

Fonte ↗
panoramaOS-2026-071 · 2026-07-23
0

JailMeter propoe avaliacao rigorosa baseada em evidencias para medir jailbreaks em LLMs

Pesquisadores lancaram o JailMeter, um framework que tenta resolver um problema cronico da literatura de jailbreak: a falta de criterio consistente para dizer se um ataque realmente funcionou. Em vez de contar qualquer resposta nao recusada como sucesso, o metodo extrai evidencia concisa da resposta do modelo e so valida o ataque quando ela captura a intencao maliciosa original e entrega uma resposta completa.

Fonte ↗
risco médioOS-2026-072 · 2026-07-23
0

ChannelGuard revela que a seguranca de pipelines multi-agente depende de filtros que ninguem media

Um estudo com 2.100 execucoes de ataque mostra que pipelines multi-agente que pareciam totalmente seguros em relatorios padrao (0% de sucesso de ataque) na verdade devem quase toda essa protecao a um filtro server-side do provedor de nuvem, e nao a defesas da propria aplicacao. Os autores propoem o ChannelGuard, portoes de information bottleneck colocados em cada canal entre agentes, para fechar essa lacuna sem depender de um unico ponto de filtragem opaco.

Fonte ↗
risco altoOS-2026-078 · 2026-07-23
0

DARWIN faz ataque e defesa de jailbreak evoluirem continuamente em loop competitivo

O DARWIN trata jailbreak como um processo evolutivo aberto, no qual um adversario (DARWIN-Attack) descobre, muta e seleciona estrategias de ataque continuamente, enquanto uma defesa (DARWIN-Guard) treina de forma online sobre os exemplos adversariais gerados por esse adversario. O ataque atinge quase 100% de sucesso contra alguns modelos de fronteira e mais de 90% contra o GPT-5.5, enquanto a defesa alcanca 91,6% de recall medio de conteudo inseguro em 12 benchmarks.

Fonte ↗
panoramaOS-2026-079 · 2026-07-23
0

DeCNIP remove backdoors de LLMs podando neuronios criticos identificados por analise representacional

O DeCNIP e uma defesa contra backdoors em LLMs que vai alem de heuristicas comportamentais, identificando e podando um conjunto minimo de neuronios responsaveis por ativar o gatilho malicioso. O metodo cobre tanto backdoors inseridos por fine-tuning quanto por edicao direta de modelo, reduzindo a taxa de sucesso do ataque em mais de 95% intervindo em apenas 0,1% dos neuronios e preservando 97% do desempenho original em tarefas normais.

Fonte ↗
panoramaOS-2026-055 · 2026-07-21
0

A-MESS propõe avaliar ataques de jailbreak pela utilidade que geram para o red teaming, não pela taxa de sucesso

O framework A-MESS (Minimal Effective Attack-Subset Selection) usa uma métrica batizada AttackSHAP, baseada em valores de Shapley, para medir o quanto cada ataque de jailbreak contribui de fato para melhorar a segurança de um modelo quando usado como dado de red-teaming em treinamento de segurança — em vez de medir só sua taxa de sucesso em quebrar o modelo (ASR). Os autores mostram que rankings por ASR se alinham fracamente com essa utilidade "defender-centric", e que otimizar diretamente por utilidade produz ganhos de segurança maiores do que escolher ataques pela agressividade.

Fonte ↗
risco altoOS-2026-030 · 2026-07-20
0

Pesquisadores demonstram transferência de raciocínio nocivo entre modelos para criar jailbreaks reutilizáveis

Um novo estudo mostra que traços de chain-of-thought extraídos de modelos comprometidos podem ser transplantados para outros modelos, elevando taxas de resposta nociva acima de 80% nos alvos mais vulneráveis. A técnica também permite destilar padrões recorrentes de raciocínio malicioso em prompts de sistema reutilizáveis, superando o transplante direto em até 10x, inclusive contra o GPT-4.1.

Fonte ↗
panoramaOS-2026-037 · 2026-07-20
0

Estudo aceito no ICSME 2026 mostra que a forma sintática do prompt decide se o código gerado por IA é seguro

Pesquisadores demonstram que variações sintáticas finas em prompts — não apenas a estratégia de alto nível — alteram significativamente a probabilidade de LLMs de código aberto gerarem código vulnerável. O estudo, aceito no ICSME 2026, identifica restrições, guardas, condições e vinculações conceituais, além de sua posição no prompt, como fatores que afetam consistentemente a segurança do código produzido.

Fonte ↗
panoramaOS-2026-046 · 2026-07-20
0

LLMs abertos conseguem traduzir vulnerabilidades de carros autônomos para formato de inteligência de ameaças, mas ainda erram no mapeamento de relações de ataque

O estudo avalia se LLMs de peso aberto conseguem converter descrições textuais de vulnerabilidades de veículos conectados e autônomos (CAVs) para STIX, o formato estruturado padrão de inteligência de ameaças, automatizando um trabalho hoje manual dos times de segurança. Os modelos tiveram bom desempenho mapeando objetos de domínio (F1 0,94) e categorias CWE (F1 0,99), mas ainda têm dificuldade em capturar as relações entre esses objetos e o mapeamento completo para técnicas MITRE ATT&CK.

Fonte ↗
risco altoOS-2026-019 · 2026-07-17
0

LogInject expõe injeção de prompt passiva em LLMs usados para análise de logs de segurança

Pesquisadores demonstraram que LLMs usados em SOCs para triagem e análise de logs podem ser manipulados por payloads de prompt injection escondidos em campos de log que ficam armazenados e só "disparam" quando um analista consulta o modelo depois. No framework LogInject, testado contra três LLMs de produção, o ataque atingiu até 88,2% de taxa de sucesso ao tentar ocultar atividade maliciosa, gerar falsos positivos, exfiltrar dados ou sequestrar a resposta do modelo.

Fonte ↗
risco médioOS-2026-022 · 2026-07-17
0

MemPoison mapeia pontos cegos estruturais de defesas contra envenenamento de memória em agentes LLM

MemPoison é um benchmark com 1.227 casos validados manualmente que testa ataques de envenenamento de memória persistente em dez famílias de modelos, organizados em uma taxonomia de três níveis de complexidade. O achado central é que defesas simples aplicadas no momento da escrita, como checagens de consistência, barram ataques diretos, mas falham sistematicamente contra corrupção composicional entre múltiplos registros e contra gatilhos dormentes ativados só em contexto específico.

Fonte ↗
panoramaOS-2026-024 · 2026-07-17
0

Framework PA-HDP propõe privacidade diferencial dinâmica e sensível à consulta para sistemas RAG

Pesquisadores apontam uma falha conceitual nos métodos atuais de proteção de privacidade em RAG: eles tratam o risco de vazamento como uma propriedade fixa de cada documento, ignorando que o risco real depende de qual pergunta o usuário faz. O framework proposto, PA-HDP, avalia o risco dinamicamente por consulta e aplica privacidade diferencial hierárquica apenas ao conteúdo que se torna sensível naquele contexto específico.

Fonte ↗
panoramaOS-2026-020 · 2026-07-16
0

OpenAI automatiza red-teaming de prompt injection com o GPT-Red para blindar o GPT-5.6 Sol

A OpenAI divulgou o GPT-Red, um modelo interno treinado especificamente para atacar outros modelos com prompt injection em larga escala, usado para gerar dados de treinamento adversarial antes do lançamento do GPT-5.6 Sol. Segundo a empresa, a integração do GPT-Red ao pipeline de treinamento reduziu drasticamente a taxa de sucesso de ataques de injeção direta e de fake chain-of-thought em relação a modelos anteriores.

Fonte ↗