97 % des fichiers llms.txt publiés ne reçoivent jamais une requête d'un robot d'IA. Et 82 % des sites qui bloquent le robot de recherche de ChatGPT sont cités quand même.
Philippe Trento, CEO de Watizi, décortique le relevé Ahrefs sur 137 000 domaines et les deux études BuzzStream d'avril 2026 (100 grands sites d'actualité, 4 millions de citations). Le constat : llms.txt n'est lu par personne, et robots.txt exprime une préférence sans rien appliquer.
Au programme :
- Pourquoi Google a clos le dossier llms.txt en mai 2026
- Recherche, agent, entraînement : les trois robots à ne plus confondre (GPTBot n'est pas OAI-SearchBot, ClaudeBot n'est pas Claude-Web)
- 71 % des grands sites d'actualité bloquent un robot de recherche, souvent sans le savoir
- Le blocage échoue : 88,2 % des sites qui bloquent GPTBot restent cités
- Bot Preference Sync de Cloudflare : quand le fichier déclare une chose et que le réseau en applique une autre, certains crawlers passent outre
- La seule mesure défensive qui ne coûte rien en visibilité : bloquer Google-Extended
- Ce qui décide vraiment de votre présence dans les réponses IA : la clarté de votre marque comme entité
Article complet et sources : https://watizi.com/blog/robots-txt-crawlers-ia-trois-politiques
Diagnostic IA en 48 h : https://watizi.com/diagnostic-ia
Ouvrez votre robots.txt. S'il bloque Claude-Web ou OAI-SearchBot, vous avez pris une décision que vous ne saviez pas prendre.