olimposec.com
tema

#embeddings

4 publicações marcadas com esta tag.

risco médioOS-2026-388 · 2026-09-09
0

Ataque Proxy Manifold Alignment reconstroi texto original a partir de embeddings ofuscados em LLMs com privacidade

Esquemas leves de privacidade para inferencia em LLM transformam localmente embeddings em texto claro para embeddings ofuscados via substituicao um-para-um, resistindo a ataques classicos de frequencia de token e inversao de embedding, mas sem garantia criptografica formal. O ataque Proxy Manifold Alignment (PMA) trata o fluxo de vetores ofuscados como uma "lingua" desconhecida e usa Word2Vec para modelar padroes de coocorrencia tanto no fluxo ofuscado quanto num corpus publico, alinhando as duas estruturas geometricas resultantes para mapear vetores ofuscados de volta ao texto original, superando outros ataques do estado da arte na taxa de recuperacao de texto claro.

Fonte ↗
panoramaOS-2026-256 · 2026-08-19
0

Reflex-Guard propõe guardrail local de baixíssima latência para bloquear jailbreaks de LLM em tempo real

Reflex-Guard é um guardrail de segurança para prompts de LLM que roda inteiramente local, usando embeddings compactos e classificadores binários rápidos, para detectar jailbreaks em cerca de 38 milissegundos, muito abaixo dos 250-900ms típicos de abordagens baseadas em LLM-juiz ou APIs de moderação na nuvem. O sistema detecta 100% dos ataques de sufixo GCG e prompts em Base64, mas exige ajuste de limiar para lidar com ataques estruturados do tipo DrAttack, que ocupam uma região diferente do espaço de embeddings.

Fonte ↗
panoramaOS-2026-231 · 2026-08-18
0

AccretionLink: como a seleção de posts públicos pode vazar atributos privados

O paper mostra que um adversário pode reforçar a inferência de atributos privados de uma pessoa apenas escolhendo quais dos seus posts públicos e autênticos expor a um modelo de inferência, sem alterar nenhum conteúdo. Os autores validam o ataque com testes estatísticos rigorosos em perfis sintéticos e no dataset PAN15, e implementam uma auditoria on-device em um Pixel 10 com atestação criptográfica para detectar esse tipo de manipulação.

Fonte ↗
panoramaOS-2026-206 · 2026-08-11
0

HaloMark propõe marca d'água criptográfica para embeddings de IA compatível com o padrão de proveniência C2PA

Embeddings de modelos de fundação são hoje um ativo de dados valioso, mas a infraestrutura de proveniência de conteúdo criada para imagens e áudio (C2PA) não funciona para eles, já que quantização, projeção e fine-tuning alteram os vetores de forma rotineira e quebram qualquer hash fixo. O HaloMark resolve isso assinando um "commitment" derivado do vetor diretamente no manifesto C2PA, mantendo AUROC de detecção acima de 0,98 mesmo sob tentativas adaptativas de remoção da marca.

Fonte ↗