Un même robot peut explorer un site pour alimenter un index de recherche et pour entraîner un modèle. Jusqu’à présent, refuser le second usage revenait à renoncer au premier, faute d’outil capable de séparer les deux. Cloudflare, qui protège plus de 20 % des sites dans le monde, propose désormais un réglage qui fait la distinction.
Une directive de non-entraînement qui ne coupe pas l’indexation
Le réglage Disallow AI Training (interdire l’entraînement IA, en français) inscrit dans le fichier robots.txt du site la directive de refus propre à chaque opérateur. Les crawlers mixtes que Cloudflare classe comme « Accountable » gardent leur accès pour la recherche. Les autres robots d’entraînement restent bloqués, à commencer par ceux d’Amazon, d’Anthropic, de Meta et d’OpenAI, qui font tourner des robots d’entraînement distincts de leurs robots de recherche.
L’arbitrage n’a rien de théorique pour les éditeurs. Selon Cloudflare, « moins de 1 % des sites [qu’il protège] choisissent de bloquer les robots de recherche, quand 17 % activent un mécanisme de blocage de l’entraînement ».
La désignation « Accountable » repose sur quatre conditions, qu’un opérateur doit remplir ou s’engager à remplir dans un délai défini :
- Un mécanisme d’opt-out de l’entraînement, par robots.txt ou par un standard équivalent,
- Un mécanisme d’opt-out des résumés générés par IA, auprès de l’opérateur aujourd’hui, via Cloudflare à partir de 2027,
- Une visibilité à l’échelle de l’URL sur les pages rendues disponibles pour l’entraînement, assortie de mesures sur la façon dont le contenu est apparu dans les résultats de recherche,
- La garantie que le refus de l’entraînement n’affecte pas le référencement classique.
Apple, Google et Microsoft remplissent ces critères, avec des fonctionnalités déjà en place et des engagements datés pour le reste. Chez Google, la consigne passe par une règle « Disallow » sur Google-Extended, chez Apple par Applebot-Extended. Microsoft doit encore ajouter la prise en charge d’une préférence de non-entraînement dans le robots.txt, attendue début 2027. D’ici là, activer Disallow AI Training ne transmet rien à Bing, dont l’opt-out repose sur la balise NOARCHIVE.
Comment paramétrer son domaine et ce qui change pour les sites existants
Les changements touchent deux produits, Bot Management et AI Crawl Control. Les contrôles s’appliquent au niveau du domaine, depuis les paramètres de sécurité du tableau de bord, et sur toutes les offres. Cloudflare y distingue trois comportements de robots : Search pour l’indexation, Training pour l’entraînement des modèles, Agent pour les agents déclenchés par un internaute. Quatre réglages sont disponibles :
- Allow, qui laisse passer tous les robots,
- Disallow AI Training, réservé au comportement Training,
- Block on pages with ads, qui ne bloque que les pages sur lesquelles une publicité est détectée,
- Block, qui bloque l’ensemble des robots concernés.
Le principal changement porte justement sur Block, qui s’applique désormais aussi aux crawlers mixtes. Le sélectionner coupe l’accès d’Applebot, de Bingbot et de Googlebot, recherche comprise. Deux options disparaissent au passage : Block AI Bots est remplacé par les contrôles Search, Training et Agent, tandis que Managed Robots.txt est remplacé par Bot Preference Sync.
Les sites déjà configurés n’ont aucune action à mener, leurs préférences étant reprises automatiquement. Un domaine réglé sur Block ou sur Block on pages with ads pour l’entraînement bascule automatiquement vers Disallow AI Training. Un domaine qui utilisait l’ancienne case Block AI Bots se retrouve en Allow pour Search, en Disallow AI Training pour Training et en Block on pages with ads pour Agent.
Pour les nouveaux domaines, Cloudflare propose deux configurations préréglées selon que le site est monétisé par la publicité ou non. Les sites financés par la publicité se voient proposer Disallow AI Training sur Training et Block on pages with ads sur Agent, les autres restant en Allow sur les trois contrôles.
La suite d’un positionnement d’arbitre entre éditeurs et IA
L’annonce prolonge une série d’initiatives menées autour du crawl et de l’IA. Cloudflare a d’abord piégé les robots d’entraînement dans des pages générées avec AI Labyrinth, puis lancé le modèle de paiement au crawl « Pay per Crawl ». L’entreprise a ensuite proposé aux sites de servir automatiquement une version Markdown de leurs pages aux agents, avant d’ouvrir un endpoint capable d’explorer un site entier en une seule requête API. Comme nous l’évoquions après la panne de novembre 2025, cette position d’intermédiaire pèse lourd sur les échanges entre les contenus web et les systèmes d’IA.
Le prochain chantier porte sur les résumés générés par IA. Cloudflare vise début 2027 un réglage unique, côté plateforme, pour doser la part de contenu qu’un opérateur peut reprendre dans ses résumés, au lieu d’un paramétrage à négocier avec chacun.
