olimposec.com
tema

#integridade-de-modelo

4 publicações marcadas com esta tag.

risco médioOS-2026-320 · 2026-08-31
0

Sondas adversariais com zk-SNARK permitem auditar troca silenciosa de modelo de LLM sem expor os pesos

O artigo propõe um framework de auditoria que usa sondas inspiradas em exemplos adversariais para amplificar diferenças de saída (drift de logits) entre um modelo de LLM aprovado e uma versão possivelmente alterada após o deploy, combinado com provas de conhecimento zero (zk-SNARK, Groth16) para preservar a privacidade do provedor do modelo durante a verificação. Sondas baseadas em token, que operam em acesso caixa-preta, entregaram a maior sensibilidade média entre as variantes testadas, com tempo de prova de 1 a 1,8 segundos mesmo escalando para 50 sondas.

Fonte ↗
risco médioOS-2026-313 · 2026-08-28
0

SILK fecha brecha de tempo entre verificacao e uso que permite adulterar pesos de modelos protegidos por Root-of-Trust

Pesquisadores identificam uma janela de ataque do tipo TOCTOU (time-of-check-to-time-of-use) em sistemas de IA protegidos por Root-of-Trust: os pesos de um modelo sao autenticados no carregamento, mas podem ser adulterados depois, no trajeto entre memoria e o motor de computacao, sem invalidar a verificacao inicial. O mecanismo proposto, SILK, verifica a integridade continuamente ate o ultimo instante antes do calculo, detectando 100% dos ataques testados com custo de hardware muito menor que uma Root-of-Trust completa.

Fonte ↗
risco médioOS-2026-220 · 2026-08-12
0

Modelos de IA que se retreinam sozinhos em produção quebram a auditoria tradicional — e um provedor desonesto pode esconder isso

O artigo aborda a governança de modelos generativos auto-adaptativos — que atualizam os próprios pesos durante a operação em produção — mostrando que essa prática invalida a premissa de validação pontual usada na gestão tradicional de risco de modelo. Na primeira parte, os autores propõem uma arquitetura de telemetria com cadeia Merkle à prova de adulteração e logging orientado a eventos; na segunda, tratam o cenário em que o próprio provedor do modelo é adversário, formalizando o "Model Hiding Problem" e catalogando seis estratégias distintas para esconder atualizações de aprendizado que deveriam disparar revisão obrigatória, com uma contramedida formal para cada uma.

Fonte ↗
panoramaOS-2026-171 · 2026-08-07
0

Ferramenta detecta, via análise de ativações, quando o treinamento de segurança de um modelo foi removido ou contornado

Pesquisadores apresentam o AMS (Activation-based Model Scanner), que detecta modificações no treinamento de segurança de LLMs medindo a geometria de conceitos relacionados a conteúdo nocivo no espaço de ativações do modelo. Testado em 14 configurações de quatro famílias de modelos abertos (Llama, Gemma, Qwen, Mistral), o AMS classifica corretamente 10 de 14 casos em validação cruzada, e a métrica que ele extrai se correlaciona de forma estatisticamente significativa com o quanto o modelo de fato obedece a pedidos prejudiciais em testes de jailbreak.

Fonte ↗