huggingface.co web signal

AntiSkillBench Shows Persona Skills Leak 55-66% of User Traits Across GPT-5.4, Gemini 3.6 and Claude Haiku 4.5

Agents Safety AI Ethics ai-business

Summary

AntiSkillBench, a 7,500-turn benchmark across 50 personas, finds that persona-skill distillation leaks 55.2-66.2% of user traits across GPT-5.4, Gemini 3.6 Flash and Claude Haiku 4.5, with communication style leakage as high as 92%. Attackers achieve 56% field-QA accuracy and up to 87.7% VocabGain in impersonating target users. Existing sanitization, adversarial obfuscation and semantic-backdoor defenses degrade sharply under persona-centric abstraction, dropping backdoor detection from 100% to 30-40%.