AntiSkillBench Shows Persona Skills Leak 55-66% of User Traits Across GPT-5.4, Gemini 3.6 and Claude Haiku 4.5
Summary
AntiSkillBench, a 7,500-turn benchmark across 50 personas, finds that persona-skill distillation leaks 55.2-66.2% of user traits across GPT-5.4, Gemini 3.6 Flash and Claude Haiku 4.5, with communication style leakage as high as 92%. Attackers achieve 56% field-QA accuracy and up to 87.7% VocabGain in impersonating target users. Existing sanitization, adversarial obfuscation and semantic-backdoor defenses degrade sharply under persona-centric abstraction, dropping backdoor detection from 100% to 30-40%.
Originally reported by huggingface.co
Read the original article →Original headline: AntiSkillBench Shows Persona Skills Leak 55-66% of User Traits Across GPT-5.4, Gemini 3.6 and Claude Haiku 4.5