huggingface.co détecté sur le web

Personalization Mirage : les LLM inventent 41,6 % du profil utilisateur en moyenne, l'auto-audit trompe

Résumé

Un nouveau papier arXiv (MirageBench, 150 personas, 143 616 claims jugés par Claude Opus 4.7) montre que chaque LLM testé sur-infère 35 à 49 % des attributs personnalisés (moyenne 41,6 %). Pire, l'auto-audit inversé : les modèles qui se déclarent les plus fiables sont ceux qui hallucinent le plus (Spearman ρ = -0,60). GPT-5.5 et GLM-5.1 accumulent 120+ attributs inférés à partir de 3 faits initiaux.