IA générative : Google précise à son tour comment bloquer ses crawlers

Google a présenté jeudi 28 septembre Google Extended, un processus qui permet aux éditeurs de ne pas consentir à l’utilisation de leurs contenus pour entraîner ses dispositifs d’IA générative Bard et Vertex AI. Comme la démarche indiquée par OpenAI pour ChatGPT, cela consiste au blocage des robots crawlers via le fichier robots.txt. Google ne donne pas d’informations quant à l’impact sur le référencement des sites qui refuseraient d’entraîner ses modèles.

Selon notre dernier relevé du 29 septembre 2023, TF1 est le seul éditeur français de notre panel de 389 sites à avoir bloqué les robots de Google. Au total, 60 sites (18,2 %) appartenant à 26 éditeurs (16,9 %) bloquent les bots Google-Extended, GPTBot, ChatGPT-User, ou les trois.

Huit éditeurs français utilisent le TDM Reservation protocol

Robots.txt n’est pas la seule possibilité pour un éditeur de signifier son non-consentement, mais la seule reconnue par les fournisseurs d’AI pour le moment. Le Geste recommande l’utilisation du TDM Reservation protocol pour communiquer sa politique en matière de réservation de droits sur le contenu.

Nous avons vérifié vendredi 29 septembre la présence du protocole TDMRep au sein des sites de notre panel. Il ressort que 31 sites (7,7 %) appartenant à huit éditeurs (4 %) (Groupe EBRA, Groupe Les Echos – Le Parisien, Groupe Télégramme, Groupe La Dépêche du Midi, Eurosport, Groupe Centre France, Groupe Figaro, Groupe Amaury) ont ajouté ce protocole dans leur code html, l’en-tête http de leur site ou dans un fichier json dédié, parfois en bloquant également via robots.txt. Interrogé au mois d’août, Laurent Le Meur, CTO d’European Digital Reading Lab, la structure au sein de laquelle a été développé le protocole, soulignait l’enjeu d’adoption pour envisager d’en faire un standard au sens du W3C.