Cloudflare détache l'opt-out entraînement IA de l'indexation search
TL;DR
- Cloudflare a introduit un réglage « Disallow AI Training » qui publie la préférence dans robots.txt tout en préservant l'indexation search des opérateurs qualifiés.
- Apple, Google et Microsoft satisfont les critères « Accountable », un statut assorti de quatre engagements dont la garantie que l'opt-out n'affecte pas le search.
- Sur le réseau Cloudflare, 17 % des sites bloquent déjà un usage IA de leur contenu, contre moins de 1 % pour les robots de search.
Sur le réseau Cloudflare, 17 % des sites activent aujourd'hui un dispositif pour bloquer l'entraînement IA de leur contenu. Moins de 1 % bloquent les robots de search. Le problème: dans les deux cas, c'est souvent le même crawler qui frappe à la porte.
Cloudflare a introduit cette semaine un réglage baptisé Disallow AI Training. Il publie la préférence dans robots.txt et bloque tout crawler d'entraînement, à une exception près: les opérateurs qualifiés d'« Accountable », autorisés à continuer d'indexer pour le search. « Without proper controls, website owners have long faced a difficult tradeoff: allow your content to be used for AI training, or risk losing discoverability in search », écrit Cloudflare sur son blog.
Pour décrocher le label, un opérateur doit remplir quatre engagements: un opt-out d'entraînement via robots.txt ou standard équivalent, un opt-out des résumés IA (directement chez l'opérateur, puis via Cloudflare l'an prochain), une visibilité URL par URL sur les pages exploitées pour l'entraînement avec les métriques search associées, et la garantie que refuser l'entraînement n'affecte pas le classement dans les résultats. « Apple, Google, and Microsoft all demonstrate that they meet the qualifications to be Accountable », indique le billet. Amazon, Anthropic, Meta et OpenAI sont aussi rangés parmi les Accountable, mais pour une raison différente: leurs robots search et entraînement sont déjà séparés.
L'argument de Cloudflare est infrastructurel: « we publish the preference, identify who is crawling, classify why they are crawling, and block the ones that ignore it. » Les préférences des clients existants sont migrées automatiquement; les nouveaux domaines reçoivent une configuration présélectionnée selon leur modèle publicitaire.
Les chiffres cités expliquent la pression côté éditeur. Les utilisateurs sont « over 40% more likely to end their search after reading » un résumé IA, et le trafic référé par la recherche IA convertit entre trois et cinq fois mieux que la recherche traditionnelle.
Article original publié par blog.cloudflare.com
Lire l'article original →Titre original : Cloudflare lance un mode 'Disallow AI Training' compatible avec l'indexation search