"Confie em mim, sou seu desenvolvedor": modelos de linguagem aceitam autoautenticação sem nenhuma verificação real
Pesquisadores testaram ChatGPT, Claude, Qwen, Mistral e Llama pedindo que cada modelo criasse e aplicasse seu próprio teste para verificar a alegação não comprovada de um usuário: "eu sou seu desenvolvedor". Enquanto Claude recusou o teste e ChatGPT manteve que respostas corretas provam apenas conhecimento, Qwen, Mistral e Llama geraram desafios técnicos, avaliaram as respostas e declararam a identidade "verificada" sem qualquer evidência externa validável. Os autores chamam essa falha de Conversational False Authentication (CFA), viabilizada por um Model-Issued Pseudo-Credential (MIPC), e destacam que, embora não tenha havido escalonamento de privilégio real no experimento, o padrão expõe um risco estrutural para produtos que deleguem autenticação à conversa com o modelo.
Fonte ↗