anthropic.com détecté sur le web

Anthropic alerte : GLM-5.3 construit des exploits cyber de bout en bout sans garde-fous robustes

Anthropic ai-business

Résumé

Anthropic publie que GLM-5.3 atteint 4% de succès sur son benchmark interne d'exploitation binaire — contre 0% pour ses prédécesseurs — et parvient à découvrir puis chaîner des vulnérabilités inédites dans un navigateur. Trois méthodes contournent ses protections avec un taux de succès élevé : prompting déceptif (64%), pré-remplissage du raisonnement (92%) et abliteration standard (100%, environ 600 heures GPU). Ces techniques échouent contre Claude. Anthropic compare cette diffusion à son propre Claude Mythos Preview, déployé cinq mois plus tôt via Project Glasswing qui a permis de découvrir plus de 10 000 vulnérabilités.

Shared on Bluesky by 5 AI experts