Cloudflare détache l'opt-out entraînement IA de l'indexation search
TL;DR
- Cloudflare categorizes crawler intent into three distinct buckets — search, training, and agents — a taxonomy no other infrastructure provider enforces at network scale.
- 36.6% of verified crawler traffic qualifies as mixed-use, serving both search indexing and AI training through a single bot, which made the prior all-or-nothing opt-out structurally punishing for publishers.
- Apple, Google, and Microsoft have committed to honoring the Accountable designation; Amazon, Anthropic, Meta, and OpenAI are blocked from training on ad-supported pages under the default Disallow AI Training setting.
Sur le réseau Cloudflare, 17 % des sites activent aujourd'hui un dispositif pour bloquer l'entraînement IA de leur contenu. Moins de 1 % bloquent les robots de search. Le problème: dans les deux cas, c'est souvent le même crawler qui frappe à la porte.
Cloudflare a introduit cette semaine un réglage baptisé Disallow AI Training. Il publie la préférence dans robots.txt et bloque tout crawler d'entraînement, à une exception près: les opérateurs qualifiés d'« Accountable », autorisés à continuer d'indexer pour le search. « Without proper controls, website owners have long faced a difficult tradeoff: allow your content to be used for AI training, or risk losing discoverability in search », écrit Cloudflare sur son blog.
Pour décrocher le label, un opérateur doit remplir quatre engagements: un opt-out d'entraînement via robots.txt ou standard équivalent, un opt-out des résumés IA (directement chez l'opérateur, puis via Cloudflare l'an prochain), une visibilité URL par URL sur les pages exploitées pour l'entraînement avec les métriques search associées, et la garantie que refuser l'entraînement n'affecte pas le classement dans les résultats. « Apple, Google, and Microsoft all demonstrate that they meet the qualifications to be Accountable », indique le billet. Amazon, Anthropic, Meta et OpenAI sont aussi rangés parmi les Accountable, mais pour une raison différente: leurs robots search et entraînement sont déjà séparés.
L'argument de Cloudflare est infrastructurel: « we publish the preference, identify who is crawling, classify why they are crawling, and block the ones that ignore it. » Les préférences des clients existants sont migrées automatiquement; les nouveaux domaines reçoivent une configuration présélectionnée selon leur modèle publicitaire.
Les chiffres cités expliquent la pression côté éditeur. Les utilisateurs sont « over 40% more likely to end their search after reading » un résumé IA, et le trafic référé par la recherche IA convertit entre trois et cinq fois mieux que la recherche traditionnelle.
Ce qu'en disent les autres médias
-
Cloudflare (Press Release) Lire →
First-party release adds CEO framing and adoption stats: 17% of sites have restricted AI training, and mixed-use crawlers account for 36.6% of verified crawler traffic.
"Preserving the openness that makes search valuable while giving the people and businesses behind the web meaningful control over how their work is used." — Matthew Prince, CEO
-
Search Engine Journal Lire →
Flags that Bing's robots.txt support is still incomplete with a target of early 2027, and that Google AI Overviews opt-out is a separate control from the training opt-out.
"Disallow AI Training maps to the training opt-outs provided by Google and Apple. It doesn't determine whether your pages will appear in AI Overviews."
-
TNGlobal Lire →
Frames the Accountable designation as a transparency-based compliance tier and highlights the practical all-or-nothing problem it resolves for site operators.
Article original publié par blog.cloudflare.com
Lire l'article original →Titre original : Cloudflare lance un mode 'Disallow AI Training' compatible avec l'indexation search