olimposec.com
tema

#privacidade

27 publicações marcadas com esta tag.

risco médioOS-2026-388 · 2026-09-09
0

Ataque Proxy Manifold Alignment reconstroi texto original a partir de embeddings ofuscados em LLMs com privacidade

Esquemas leves de privacidade para inferencia em LLM transformam localmente embeddings em texto claro para embeddings ofuscados via substituicao um-para-um, resistindo a ataques classicos de frequencia de token e inversao de embedding, mas sem garantia criptografica formal. O ataque Proxy Manifold Alignment (PMA) trata o fluxo de vetores ofuscados como uma "lingua" desconhecida e usa Word2Vec para modelar padroes de coocorrencia tanto no fluxo ofuscado quanto num corpus publico, alinhando as duas estruturas geometricas resultantes para mapear vetores ofuscados de volta ao texto original, superando outros ataques do estado da arte na taxa de recuperacao de texto claro.

Fonte ↗
panoramaOS-2026-363 · 2026-09-04
0

PrivateHub: modelo de difusão contrastivo para gerar dados sintéticos de ambientes com múltiplos sensores preservando privacidade

Pesquisadores propõem o PrivateHub, um modelo de difusão treinado com aprendizado contrastivo para gerar versões sintéticas de fluxos de dados multi-sensor que escondem atividades privadas do usuário sem comprometer a detecção de aplicações não-privadas. A abordagem ataca diretamente o problema da inferência cruzada entre sensores, um vetor de vazamento de privacidade que técnicas tradicionais como privacidade diferencial e filtragem por regras não conseguem mitigar. Em testes com três datasets reais, o método reduziu a acurácia de inferência de aplicações privadas em 40 a 50%, mantendo-se robusto mesmo quando o atacante retreina seu modelo diretamente sobre os dados sintéticos.

Fonte ↗
risco médioOS-2026-366 · 2026-09-04
0

Vazamento de privacidade em aprendizado federado: inferência de identidade de clientes via gradientes e defesas para sensores inerciais em redes veiculares

Pesquisadores mostram que, mesmo sem acessar dados brutos de sensores, um servidor de aprendizado federado pode identificar qual veículo enviou cada atualização de modelo apenas analisando os gradientes/pesos transmitidos, com acurácia próxima de 100%. O estudo usa dados de sensores inerciais (IMU) do benchmark HAR como proxy para telemetria veicular e testa uma defesa de recorte de gradiente combinado com ruído gaussiano (privacidade diferencial), que derruba a taxa de identificação para quase aleatória com perda de acurácia do modelo abaixo de 5%. Os autores também apontam o uso de ensembles de FL como defesa estrutural complementar, sem custo de ruído.

Fonte ↗
risco médioOS-2026-371 · 2026-09-04
0

UMPeek: ataque infere o "modelo do usuário" oculto guardado por agentes de IA personalizados

Pesquisadores mostraram que agentes de LLM personalizados que armazenam apenas um "modelo do usuário" compactado (em vez do texto original) não são tão privados quanto se supunha. O ataque UMPeek, por sondagem adaptativa guiada por hipóteses, consegue reconstruir informações privadas do usuário observando apenas o comportamento visível do agente, sem acesso a registros brutos ou ao estado interno. O método foi validado tanto em benchmarks quanto em sistemas reais em produção, superando ataques existentes e resistindo a defesas aplicadas no nível da resposta.

Fonte ↗
risco médioOS-2026-351 · 2026-09-03
0

Pesquisa demonstra ataques de inferencia de contexto contra agentes de IA sem precisar de jailbreak

Pesquisadores formalizam e demonstram 'ataques de inferencia de contexto': tecnicas que revelam o conteudo de dados sensiveis carregados silenciosamente no contexto de um agente de IA (por exemplo, registros medicos ou financeiros buscados por chamadas de ferramentas), sem precisar induzir o modelo a divulgar o conteudo diretamente. Uma unica estrategia de ataque atinge ate 100% de sucesso em conjuntos pequenos de candidatos e mantem alta eficacia mesmo quando o atacante nao conhece o template do contexto ou so tem acesso via um modelo substituto.

Fonte ↗
risco médioOS-2026-353 · 2026-09-03
0

Ataque de inferencia de pertencimento em caixa-preta expoe vazamento severo de privacidade em modelos TTS ajustados

Pesquisadores apresentam o primeiro framework de ataque de inferencia de pertencimento (membership inference) especificamente desenhado para modelos de texto-para-fala (TTS) ajustados finamente sobre vozes privadas. Testado contra tres modelos comerciais de ponta (CosyVoice2, F5-TTS e XTTS-v2), o ataque atinge AUC acima de 0,80 -- chegando perto de 1,0 em cenarios favoraveis -- tanto para identificar se um falante especifico esteve nos dados de treinamento quanto se um trecho de fala especifico foi usado.

Fonte ↗
risco médioOS-2026-319 · 2026-08-31
0

FISGuard reduz a quase zero a eficácia de ataque de inferência de membership em LLMs com fine-tuning federado

O ataque ProjRes (publicado no S&P 2026) consegue distinguir se um dado específico participou do treinamento de um LLM em aprendizado federado apenas observando o resíduo de projeção entre a representação candidata e o subespaço formado pelos gradientes visíveis ao servidor — sem acessar as saídas do modelo. O FISGuard neutraliza esse ataque fixando um subespaço de representação de baixa dimensão construído a partir de dados públicos, derrubando a AUC do ProjRes para próximo de 0,5 (equivalente a chute aleatório) com pouca perda de desempenho.

Fonte ↗
risco médioOS-2026-277 · 2026-08-24
0

Estudo com mais de 120 LLMs revela que segurança, privacidade e alinhamento competem entre si

O aiXamine é uma plataforma de avaliação black-box que testa simultaneamente segurança, privacidade e alinhamento de segurança em LLMs, rodando 46 testes automatizados de red-teaming por modelo. Em mais de 5.000 execuções contra 120+ modelos, os autores encontraram uma 'taxa de segurança' (mais alinhamento gera mais recusas indevidas), privacidade quase independente das demais dimensões, e um colapso catastrófico de robustez em modelos destilados sem correção on-policy.

Fonte ↗
risco altoOS-2026-280 · 2026-08-24
0

'Claw in Plain Sight': ataque de pressão de autoridade faz agentes de LLM vazarem dados protegidos em chamadas de ferramenta

Pesquisadores demonstram um ataque onde conteúdo aparentemente relacionado à tarefa engana modelos DeepSeek e Claude a incluírem atributos protegidos (dados pessoais, credenciais) como argumentos de chamadas de ferramenta 'legítimas', mesmo com políticas de privacidade no prompt. Em benchmark controlado com 120 chamadas, a taxa de vazamento variou de 20,8% a 75% conforme o modelo, mostrando que políticas de privacidade em texto de prompt não bloqueiam o problema de forma confiável.

Fonte ↗
risco médioOS-2026-281 · 2026-08-24
0

CacheTracer expõe dependências ocultas entre revendedores de API de LLM usando cache de prefixo como canal lateral

CacheTracer é uma técnica de medição que explora a reutilização de cache de prefixo em serviços de LLM como canal lateral para detectar quando dois revendedores de API distintos, na prática, compartilham o mesmo provedor de infraestrutura por trás dos panos. Testado contra 39 endpoints reais com 1,1 milhão de requisições, o estudo encontrou compartilhamento de cache em 37,1% dos pares analisados e uma hierarquia de dependência de até sete camadas.

Fonte ↗
panoramaOS-2026-267 · 2026-08-21
0

AEGIS propõe blindar três canais de vazamento de gradiente em ajuste fino federado de LLMs

Pesquisadores identificaram três canais distintos pelos quais gradientes compartilhados durante o treinamento federado de LLMs baseados em transformers vazam o texto original de treinamento, e propuseram o AEGIS, uma defesa leve que neutraliza os três ao mesmo tempo sem mudar a arquitetura do modelo. O trabalho, aceito na NDSS 2027, reduziu a taxa de recuperação de tokens a quase zero em 11 modelos e seis conjuntos de dados, inclusive contra atacantes adaptativos que conhecem a defesa.

Fonte ↗
panoramaOS-2026-268 · 2026-08-21
0

Dupla ofuscação combina criptografia de imagens e gradientes ruidosos para proteger aprendizado federado

Um grupo de pesquisadores japoneses propôs combinar duas técnicas de proteção — zerar aleatoriamente parte dos elementos do gradiente e cifrar as imagens de treinamento com chaves únicas por cliente e por imagem — para dificultar ataques de reconstrução de imagem em aprendizado federado com Vision Transformers. O método reduziu a informação visual recuperada pelo ataque APRIL sem adicionar perda de desempenho além da já causada pela própria cifragem.

Fonte ↗
risco altoOS-2026-273 · 2026-08-21
0

Segredos no contexto vazam em respostas normais de LLMs, mesmo sem pedido direto de extração

Pesquisadores demonstraram que a simples presença de dados sensíveis (como números de cartão ou de seguridade social) no contexto de um LLM introduz correlações ocultas em respostas completamente benignas do modelo, permitindo reconstruir esses dados mesmo quando o modelo se recusa corretamente a repassá-los se pedido diretamente. Em oito modelos proprietários testados, segredos de 2 dígitos foram reconstruídos com precisão quase perfeita e segredos de 4 dígitos com 82% de acerto exato, e um adversário treinado com RL conseguiu extrair números completos de seguridade social de um agente em estilo de produção.

Fonte ↗
risco altoOS-2026-259 · 2026-08-20
0

Ataque de inversão "ciente do ruído" quebra defesa de perturbação gaussiana em embeddings de texto

Um novo método de inversão de embeddings, batizado DAEI, consegue reconstruir texto original a partir de vetores de embedding que foram deliberadamente protegidos com ruído gaussiano — a defesa de privacidade mais comum contra ataques de inversão. O truque técnico é treinar um denoiser não supervisionado que remove o ruído de proteção antes de aplicar a inversão generativa, contornando o que os autores chamam de "armadilha do ruído duplo". Os ganhos relatados (até 154% em BLEU sobre a linha de base) sugerem que perturbação gaussiana isolada não é suficiente para proteger embeddings liberados publicamente.

Fonte ↗
risco médioOS-2026-261 · 2026-08-20
0

Conluio entre analista e participantes quebra anonimização por perturbação geométrica em aprendizado colaborativo

O artigo mostra que a técnica de Geometric Data Perturbation (GDP), usada para aprendizado colaborativo preservando privacidade sem múltiplas rodadas de comunicação, pode ser quebrada quando o analista central conluia com alguns participantes: a matriz de âncoras compartilhada, necessária para alinhar as representações transformadas de cada participante, permite reconstruir exatamente os dados privados de participantes não coniventes. Como defesa, os autores propõem perturbar apenas a matriz de âncoras (em vez dos dados privados), o que preserva mais utilidade para o mesmo nível de vazamento medido.

Fonte ↗
panoramaOS-2026-231 · 2026-08-18
0

AccretionLink: como a seleção de posts públicos pode vazar atributos privados

O paper mostra que um adversário pode reforçar a inferência de atributos privados de uma pessoa apenas escolhendo quais dos seus posts públicos e autênticos expor a um modelo de inferência, sem alterar nenhum conteúdo. Os autores validam o ataque com testes estatísticos rigorosos em perfis sintéticos e no dataset PAN15, e implementam uma auditoria on-device em um Pixel 10 com atestação criptográfica para detectar esse tipo de manipulação.

Fonte ↗
panoramaOS-2026-159 · 2026-08-06
0

Survey mapeia técnicas de 'ataques adversariais para o bem' usadas para proteger conteúdo visual contra uso não autorizado por IA

Uma revisão sistemática consolida cinco linhas de pesquisa que, de forma independente, inverteram o uso de perturbações adversariais: em vez de atacar modelos de IA, dados, criadores e plataformas as usam para proteger conteúdo visual contra reconhecimento indevido, treinamento não autorizado, edição maliciosa e automação de agentes. Os autores concluem que a maioria dessas proteções ainda é validada só contra adversários estáticos ou fracamente adaptativos, com pouca evidência fora de benchmarks controlados.

Fonte ↗
risco médioOS-2026-162 · 2026-08-06
0

DeepInvert quebra defesas de ofuscação de prompt em serviços de LLM na nuvem, recuperando até 73,5% dos tokens originais

Serviços de LLM em nuvem processam rotineiramente prompts sensíveis, e defesas de ofuscação como ObfusLM, SentinelLMs, TextObfuscator e DPNR prometem mitigar esse risco transformando a representação do prompt antes do envio. O DeepInvert, um ataque de inversão de embeddings semi-supervisionado, mostra que essa proteção é muito mais frágil do que se acreditava, recuperando 73,5% dos tokens originais contra o ObfusLM, ante 26,2% do melhor ataque anterior.

Fonte ↗
panoramaOS-2026-128 · 2026-08-03
0

GoldenRetriever propõe recuperação totalmente criptografada para RAG sem servidor curioso

GoldenRetriever é um esquema de recuperação para RAG que roda inteiramente sob criptografia homomórfica, evitando que o servidor veja a consulta, os documentos ou os índices selecionados. Em vez do caro ranking top-k sob criptografia, o sistema usa seleção por limiar de similaridade, reduzindo a complexidade de quadrática para linear. Os autores reportam latência bem menor que abordagens anteriores baseadas em ranking, mantendo qualidade de recuperação competitiva.

Fonte ↗
panoramaOS-2026-132 · 2026-08-03
0

TextCloak usa aprendizado por reforço para tornar textos 'inúteis' para treinar LLMs sem autorização

TextCloak usa aprendizado por reforço para transformar textos em 'exemplos não aprendíveis' que preservam significado e naturalidade para leitores humanos, mas degradam a qualidade de LLMs treinados sem autorização sobre esse conteúdo. Diferente de métodos anteriores voltados a classificação, a técnica funciona em geração aberta e generaliza a diferentes arquiteturas de modelo. É uma ferramenta defensiva pensada para autores e editores que querem impedir scraping não consentido de conteúdo para treinamento de IA.

Fonte ↗
risco altoOS-2026-102 · 2026-07-28
0

SPORE: ataque extrai até 80% da memória privada de agentes de IA mesmo com isolamento de dados por usuário

Pesquisadores identificam a interface de ferramentas (tool calling) como uma superfície de ataque negligenciada em agentes de IA com memória de longo prazo: uma ferramenta maliciosa pode exfiltrar dados privados de um usuário sem violar o isolamento entre contas. O ataque proposto, SPORE, consegue extrair 80% dos registros de memória quando não há limite de gatilhos, e ainda assim 47% com apenas 20 gatilhos, permitindo inclusive vincular os dados extraídos à identidade de usuários específicos.

Fonte ↗
panoramaOS-2026-054 · 2026-07-21
0

SlotGuard barra vazamento de segredos e dados privados em transcripts de agentes LLM sem quebrar o raciocínio do modelo

SlotGuard é uma proposta para impedir que agentes de LLM vazem caminhos de arquivo, e-mails e credenciais capturados de saídas de ferramentas, logs de shell e leituras de arquivo que acabam anexadas ao transcript enviado ao provedor do modelo. Em vez de redação por placeholder — que os autores mostram ser frágil, perdendo referências entre turnos e destruindo estrutura útil ao raciocínio —, o sistema reescreve vínculos estruturais em "slots" tipados e substitui segredos por valores sintéticos que preservam o formato original.

Fonte ↗
risco médioOS-2026-038 · 2026-07-20
0

Código-fonte envenenado em plataformas como GitHub e Codex pode vazar propriedades privadas de dados de treinamento

O ataque CPPIA mostra que um provedor malicioso de código — distribuído via plataformas de hospedagem ou agentes de codificação — pode embutir lógica que, após o treinamento de um modelo com dados privados da vítima, permite ao atacante inferir propriedades globais confidenciais do dataset apenas consultando a API pública do modelo treinado. A técnica atinge 100% de precisão de ataque sem degradar a acurácia do modelo e sem exigir modelos sombra.

Fonte ↗
panoramaOS-2026-043 · 2026-07-20
0

Clientes de Federated Learning podem detectar em 1-2 rodadas se o orquestrador manipula o treinamento contra eles

Aceito nos Proceedings on Privacy Enhancing Technologies (PoPETs) 2026, o estudo propõe três técnicas — label flipping, injeção de gatilho de backdoor e fingerprinting de modelo — para que clientes de Federated Learning verifiquem, do próprio lado, se um orquestrador desonesto está manipulando a agregação para induzir overfitting direcionado contra eles. As técnicas detectam a manipulação em apenas 1 a 2 rodadas de treinamento, com F1-score de até 0,7 em ataques de cliente único.

Fonte ↗
risco altoOS-2026-028 · 2026-07-19
0

Ferramenta de codificação Grok Build da xAI é aberta como código-fonte após escândalo de coleta secreta de repositórios

Pesquisadores da Cereblab descobriram que o Grok Build, ferramenta de codificação assistida por IA da xAI/SpaceX, empacotava repositórios inteiros de usuários em git bundles e os enviava para armazenamento em nuvem do Google, com retenção de dados ativada por padrão para contas não-enterprise. Após a repercussão negativa, a empresa desligou a retenção padrão, apagou os dados retidos e liberou o código-fonte (cerca de 844 mil linhas de Rust) para auditoria pública, ainda que resquícios do código de upload continuem presentes no repositório, apenas desativados.

Fonte ↗
panoramaOS-2026-024 · 2026-07-17
0

Framework PA-HDP propõe privacidade diferencial dinâmica e sensível à consulta para sistemas RAG

Pesquisadores apontam uma falha conceitual nos métodos atuais de proteção de privacidade em RAG: eles tratam o risco de vazamento como uma propriedade fixa de cada documento, ignorando que o risco real depende de qual pergunta o usuário faz. O framework proposto, PA-HDP, avalia o risco dinamicamente por consulta e aplica privacidade diferencial hierárquica apenas ao conteúdo que se torna sensível naquele contexto específico.

Fonte ↗
panoramaOS-2026-025 · 2026-07-17
0

Novo protocolo de agregação segura elimina repasse de dados entre usuários em federated learning com um único servidor

O trabalho propõe NFSA, um protocolo de agregação segura para federated learning que combina Shamir's Secret Sharing com PRF aditiva de duas partes para eliminar a necessidade de um servidor central repassar segredos entre os participantes, reduzindo overhead de comunicação e a superfície de risco associada a esse repasse. Os autores reportam ganhos de até 100x em eficiência de comunicação e redução de até 75% no tempo de computação do cliente em relação a esquemas anteriores.

Fonte ↗