DocumentationRobots et IA

Robots et IA

Moteurs de recherche, robots d’IA, outils SEO, aperçus de liens : voyez qui lit votre site, quelles pages, avec quelles réponses, puis décidez qui autoriser.

Sur cette page
  1. Rendre les robots visibles
  2. Catégories
  3. Le rapport Robots
  4. Robots d’IA : entraînement ou réponse
  5. Autoriser ou bloquer

Rendre les robots visibles#

La plupart des robots ne chargent pas le JavaScript : le traceur ne les voit pas. Pour les compter, votre serveur doit signaler leurs passages :

Les robots qui exécutent le JavaScript (navigateurs sans interface, certains outils) sont reconnus à la collecte grâce à leur User-Agent et rangés avec les autres. Dans tous les cas, ils sont comptés à part et n’entrent jamais dans l’audience.

Catégories#

Chaque passage est identifié par son User-Agent et rangé dans une catégorie :

CatégorieExemples
Moteurs de rechercheGooglebot (et ses variantes Image, Video, News), Bingbot, Applebot, DuckDuckBot, Qwantbot, YandexBot, Baiduspider, KreomnisBot…
Robots d’IAGPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, Claude-User, PerplexityBot, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot…
Outils SEOAhrefsBot, SemrushBot, Majestic, Moz, Screaming Frog, Lighthouse, PageSpeed Insights…
Réseaux sociaux et messageriesAperçus de liens de Facebook, X, LinkedIn, Slack, Discord, WhatsApp, Telegram, Bluesky…
SurveillanceUptimeRobot, Pingdom, StatusCake, Better Stack, Datadog, Checkly…
Scripts et autresNavigateurs sans interface (headless), curl, Python, Node.js, lecteurs RSS, User-Agent vide ou inconnu…

Un User-Agent qui ressemble à un robot sans être connu apparaît sous son propre nom, ou comme « Robot inconnu ».

Le rapport Robots#

Sur 7, 28 ou 90 jours, la page Robots montre :

  • le nombre de passages, de robots différents et de pages lues, et la part des robots dans l’ensemble des pages servies (robots et humains) ;
  • les passages par jour, séparés entre moteurs, IA et autres ;
  • chaque robot : passages, pages distinctes, dernier passage et réponses en erreur (codes 400 et plus) ;
  • les pages les plus lues, avec la part des moteurs et des IA ;
  • la répartition des codes HTTP renvoyés aux robots.
Le nom vient du User-Agent déclaré

N’importe quel programme peut se présenter comme Googlebot. Le rapport montre ce que les robots déclarent ; il ne vérifie pas leur adresse d’origine.

Robots d’IA : entraînement ou réponse#

Les robots d’IA n’ont pas tous le même rôle, ce qui guide la décision de les autoriser :

  • Collecte pour l’entraînement : GPTBot, ClaudeBot, CCBot, Google-Extended, Applebot-Extended, Bytespider…
  • Lecture à la demande d’un utilisateur ou pour une recherche : ChatGPT-User, OAI-SearchBot, Claude-User, Claude-SearchBot, Perplexity-User…

Le fichier /llms.txt présente votre site aux modèles de langage (proposition llmstxt.org) : KreomnisBot le lit à chaque exploration et en affiche l’état (voir Indexation et couverture).

Bloquer les seconds peut vous priver de citations et de visites venues des assistants, visibles dans le canal Assistants IA de vos statistiques.

Autoriser ou bloquer#

Les consignes se donnent dans le fichier robots.txt à la racine de votre site. Par exemple, pour refuser l’entraînement des IA tout en restant lisible par les moteurs et les assistants :

robots.txttext
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Pour bloquer une partie du site à un robot précis :

robots.txttext
User-agent: AhrefsBot
Disallow: /recherche/
Une consigne, pas une barrière

Les robots sérieux respectent robots.txt, mais rien ne les y oblige techniquement. Le rapportRobots vous permet de vérifier, après quelques jours, qu’un robot bloqué ne lit plus les pages concernées.

Une question sans réponse ici ? Consultez les questions fréquentes.