Sondas adversariais com zk-SNARK permitem auditar troca silenciosa de modelo de LLM sem expor os pesos
O artigo propõe um framework de auditoria que usa sondas inspiradas em exemplos adversariais para amplificar diferenças de saída (drift de logits) entre um modelo de LLM aprovado e uma versão possivelmente alterada após o deploy, combinado com provas de conhecimento zero (zk-SNARK, Groth16) para preservar a privacidade do provedor do modelo durante a verificação. Sondas baseadas em token, que operam em acesso caixa-preta, entregaram a maior sensibilidade média entre as variantes testadas, com tempo de prova de 1 a 1,8 segundos mesmo escalando para 50 sondas.
Fonte ↗