Ataque Proxy Manifold Alignment reconstroi texto original a partir de embeddings ofuscados em LLMs com privacidade
Esquemas leves de privacidade para inferencia em LLM transformam localmente embeddings em texto claro para embeddings ofuscados via substituicao um-para-um, resistindo a ataques classicos de frequencia de token e inversao de embedding, mas sem garantia criptografica formal. O ataque Proxy Manifold Alignment (PMA) trata o fluxo de vetores ofuscados como uma "lingua" desconhecida e usa Word2Vec para modelar padroes de coocorrencia tanto no fluxo ofuscado quanto num corpus publico, alinhando as duas estruturas geometricas resultantes para mapear vetores ofuscados de volta ao texto original, superando outros ataques do estado da arte na taxa de recuperacao de texto claro.
Para equilibrar privacidade e utilidade em inferencia de LLM sobre dados sensiveis, uma familia de esquemas leves de ofuscacao (Embedding-to-Embedding Obfuscation, E2EO) transforma localmente, no lado do usuario, os embeddings de texto claro em embeddings ofuscados de tamanho fixo, antes de envia-los para o modelo. Esses esquemas ja demonstraram resistencia razoavel contra ataques tradicionais como analise de frequencia de token e inversao direta de embedding, mas o mecanismo subjacente continua sendo uma substituicao em larga escala, um-para-um, que nao oferece nenhuma garantia criptografica formal -- e e exatamente essa lacuna que o ataque explora.
A percepcao central dos autores e que, como o E2EO preserva a estrutura semantica original dos dados (apenas troca os simbolos, nao a geometria das relacoes entre eles), o fluxo de vetores ofuscados pode ser tratado como se fosse uma "lingua" desconhecida, cujos "simbolos" sao os proprios vetores. Isso reformula o problema de recuperar o texto original como uma tarefa de traducao entre essa lingua desconhecida e o texto em claro -- em vez de um problema criptografico de quebra de cifra.
O ataque, batizado Proxy Manifold Alignment (PMA), funciona em tres etapas: primeiro, usa Word2Vec para aprender, de forma independente, os padroes de coocorrencia tanto no fluxo de vetores ofuscados observado quanto num corpus publico comum, gerando dois conjuntos de embeddings "proxy" que capturam a estrutura semantica de cada lado separadamente. Em seguida, alinha as duas variedades geometricas (manifolds) resultantes com base em similaridade estrutural -- basicamente encontrando a transformacao que faz a "forma" do espaco ofuscado coincidir com a "forma" do espaco de texto claro. Por fim, usa esse alinhamento para mapear os vetores ofuscados observados de volta a palavras e frases em texto claro.
Os autores reportam que o PMA supera consistentemente outros ataques do estado da arte na taxa de recuperacao de texto claro, usando apenas acesso ao fluxo de vetores ofuscado, ao tokenizador alvo e a um corpus publico -- nenhum desses recursos e informacao privilegiada ou dificil de obter. Isso e um sinal de alerta para qualquer produto que dependa de ofuscacao por substituicao de embedding como unica camada de privacidade em pipelines de LLM: a resistencia demonstrada contra ataques anteriores nao implica seguranca real, porque o esquema preserva justamente o tipo de estrutura semantica que um atacante paciente, com acesso a corpus publico comparavel, consegue explorar sem nenhuma chave ou informacao secreta da vitima.