FISGuard reduz a quase zero a eficácia de ataque de inferência de membership em LLMs com fine-tuning federado
O ataque ProjRes (publicado no S&P 2026) consegue distinguir se um dado específico participou do treinamento de um LLM em aprendizado federado apenas observando o resíduo de projeção entre a representação candidata e o subespaço formado pelos gradientes visíveis ao servidor — sem acessar as saídas do modelo. O FISGuard neutraliza esse ataque fixando um subespaço de representação de baixa dimensão construído a partir de dados públicos, derrubando a AUC do ProjRes para próximo de 0,5 (equivalente a chute aleatório) com pouca perda de desempenho.
Fonte ↗