
Cloudflare contribue à mettre fin au compromis opposant recherche et entraînement des IA
Cloudflare annonce une nouvelle certification « Responsable » pour l’exploration pilotée par IA. Dans ce contexte, Cloudflare a lancé un paramètre « Interdire l’entraînement d’IA », qui permet à n’importe quel site web de refuser de contribuer à l’entraînement des IA, tout en préservant pleinement sa visibilité dans les résultats de recherche. Il y a onze semaines, Cloudflare a déclaré que les propriétaires de sites web méritaient de disposer d’un véritable contrôle sur la manière dont les IA utilisent leurs contenus, et a défini les conditions auxquelles les opérateurs de robots d’exploration devraient satisfaire pour conserver leur accès.
Nouveaux contrôles, nouvelles recommandations
Cloudflare remplace son sélecteur « Bloquer les bots IA » par trois commandes indépendantes : une commande pour la recherche, une deuxième pour l’entraînement des IA et une troisième pour les agents IA. Les nouveaux sites web hébergés sur Cloudflare bénéficieront désormais de paramètres recommandés, adaptés à leur modèle opérationnel :
- Sites diffusant de la publicité : l’exploration est activée, l’entraînement des IA est interdit et les agents IA sont bloqués sur les pages contenant des publicités.
- Tous les autres sites : la recherche, l’entraînement des IA et les agents IA sont tous autorisés, conformément au mode de fonctionnement de la plupart des sites web non financés par la publicité.
Cloudflare remplace également sa fonctionnalité « Managed Robots.txt » par « Bot Preference Sync », qui permet aux propriétaires de sites de définir une fois pour toutes leurs préférences d’exploration, puis de les appliquer automatiquement à tous les robots d’exploration pris en charge. Les clients peuvent facilement modifier leurs paramètres et leurs préférences à tout moment.
Exploration par l’IA responsable
Cloudflare a défini des critères clairs pour garantir une exploration par l’IA responsable et transparente, notamment pour les robots d’exploration à usage mixte. Les opérateurs doivent satisfaire à quatre exigences ou s’engager à les respecter dans un délai déterminé :
- Fournir aux propriétaires de sites un moyen clair de refuser l’entraînement des IA via le fichier robots.txt ou une norme équivalente
- Permettre aux propriétaires de sites de refuser les résumés de recherche générés par IA
- Offrir aux propriétaires de sites une visibilité au niveau des URL sur l’utilisation de leur contenu à des fins de recherche et d’entraînement
- Confirmer publiquement que le fait de refuser l’entraînement n’aura aucune incidence sur le classement d’un site dans les résultats de recherche traditionnels

