La crawlabilité est la couche invisible de toute stratégie GEO : elle conditionne l’accès des robots des intelligences artificielles à vos contenus. Sur un échantillon de 200 sites audités, environ 35 % bloquaient involontairement au moins un robot IA majeur dans leur fichier robots.txt, se privant de visibilité générative sans le savoir.
Vous pouvez avoir aligné votre entité et multiplié vos points de validation : si les robots ne peuvent pas lire vos pages, tout ce travail reste sans effet. En SEO classique, on se préoccupait principalement du Googlebot. En GEO, une nouvelle génération de robots entre en jeu, et la plupart des configurations n’ont jamais été pensées pour eux.
Le paradoxe du blocage involontaire
C’est la situation la plus fréquente et la plus absurde rencontrée en audit : des entreprises qui ont investi massivement dans leur contenu, et qui bloquent les robots IA sans l’avoir décidé.
Le mécanisme est simple. Face à l’aspiration massive de contenus, beaucoup d’entreprises ont ajouté une règle de blocage générique dans leur robots.txt. Cette règle protège effectivement contre les aspirateurs, et elle bloque aussi les robots légitimes qui cherchent à comprendre votre entité pour vous citer.
des sites audités bloquaient involontairement au moins un robot IA majeur dans leur fichier robots.txt, sur un échantillon de 200 sites clients.
Source : Audits Stéphane Delgado, 2024 et 2025
Les robots à autoriser explicitement
| User-agent | Éditeur | Rôle |
|---|---|---|
| GPTBot | OpenAI | Exploration pour l’entraînement et l’enrichissement des modèles GPT |
| OAI-SearchBot | OpenAI | Recherche en temps réel dans ChatGPT |
| ChatGPT-User | OpenAI | Requêtes déclenchées par un utilisateur |
| ClaudeBot | Anthropic | Exploration pour les modèles Claude |
| Claude-User | Anthropic | Requêtes déclenchées par un utilisateur |
| anthropic-ai | Anthropic | Agent historique, à conserver |
| PerplexityBot | Perplexity | Recherche augmentée en temps réel |
| Google-Extended | Usage des contenus par les modèles Google, distinct de Googlebot | |
| CCBot | Common Crawl | Archives du web reprises par de nombreux modèles |
| Amazonbot | Amazon | Assistants et services Amazon |
| Applebot-Extended | Apple | Modèles Apple Intelligence |
| meta-externalagent | Meta | Modèles Llama et assistants Meta |
# Robots des moteurs de recherche
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
# Robots des intelligences artificielles
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: CCBot
Allow: /
User-agent: Amazonbot
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: meta-externalagent
Allow: /
# Regle generale
User-agent: *
Allow: /
Disallow: /espace-client/
Disallow: /*?tri=
Sitemap: https://www.votre-site.fr/sitemap.xml
Le problème du JavaScript
Les robots IA ne sont pas des navigateurs. Dans la plupart des cas, ils n’exécutent pas JavaScript et n’attendent pas qu’un rendu se termine. Ils lisent le HTML brut. Si votre contenu est généré dynamiquement dans le navigateur, il leur est simplement invisible.
La solution est le rendu côté serveur ou la génération statique. Si votre site repose sur un cadriciel JavaScript, vérifiez avec votre équipe technique si le rendu serveur est activé. Dans le cas contraire, c’est votre première priorité, avant tout travail éditorial.
La vitesse de réponse
Les robots disposent de ressources limitées et n’attendent pas indéfiniment. Le temps de réponse du serveur, mesuré par le TTFB, doit rester sous 500 millisecondes. Au-delà d’une seconde, une part des explorations échoue silencieusement.
La fraîcheur compte tout autant. Selon une analyse de Dataslayer, les sources citées par les intelligences artificielles sont en moyenne 25,7 % plus fraîches que celles affichées dans les résultats organiques classiques. Les modèles privilégient nettement l’information récente disponible.
Le pare-feu et le CDN, obstacles invisibles
Au-delà du robots.txt, deux couches techniques bloquent régulièrement les robots IA sans que personne ne l’ait décidé.
Les pare-feux applicatifs identifient les robots par signature. Un agent récent, inconnu de leurs listes, peut être classé comme suspect et rejeté. La vérification est simple : cherchez dans vos journaux d’accès les requêtes bloquées provenant de GPTBot, ClaudeBot ou PerplexityBot, et créez des exceptions pour ces agents.
Les réseaux de diffusion de contenu posent un problème différent : si leurs règles de cache sont trop agressives, les robots reçoivent des versions périmées de vos pages et indexent des informations obsolètes.
Les contenus que les robots ne peuvent pas lire
- Les tableaux de données en image. Un tableau en capture d’écran n’est pas un tableau : il est illisible. Passez systématiquement au HTML natif.
- Les infographies sans équivalent textuel. Doublez-les d’une description complète des données qu’elles portent.
- Les PDF stratégiques. Doublez-les d’une version HTML de la même information.
- Les images sans attribut alt. Un alt descriptif et complet est ce qui reste d’une image pour un robot.
La pagination et le défilement infini
Les robots explorent généralement les premières pages d’un site et ne parcourent pas systématiquement toutes les pages paginées. Si vos meilleurs contenus se trouvent en page 5 de votre blog, ils risquent de ne jamais être lus.
La solution est de créer des liens internes explicites vers vos contenus de référence depuis votre page d’accueil et vos pages principales. C’est aussi le rôle du fichier llms.txt, qui liste directement ce que vous voulez faire lire.
Le fichier llms.txt, la voie la plus directe
Placé à la racine, il élimine toute ambiguïté sur qui vous êtes, ce que vous faites et où trouver vos contenus importants. Sa structure recommandée comprend six sections.
- Identité : votre définition canonique exacte, votre nom légal, votre date de fondation, votre zone géographique.
- Activités : vos services ou produits principaux, décrits factuellement en deux à trois phrases chacun.
- Équipe : les noms et fonctions de vos dirigeants, avec le lien vers leur profil professionnel.
- Ressources : les liens vers vos contenus de référence, chacun accompagné d’une ligne de description.
- Contact : adresse complète, téléphone, courriel, horaires.
- Profils officiels : les adresses de vos présences sur les principales plateformes.
Ce site applique la règle à lui-même : llms.txt et llms-full.txt.
Le sitemap XML
Un sitemap bien construit liste toutes vos pages importantes, pas seulement l’accueil, avec pour chacune une date de dernière modification réelle et une priorité relative cohérente. Soumettez-le à la Search Console : les robots IA ne l’utilisent pas directement, mais un sitemap correctement pris en compte par Google est généralement exploré par les autres.
La grille d’audit
La grille d’audit de crawlabilité en 20 points reprend l’ensemble de ces contrôles sous forme de liste interactive, avec un niveau de priorité pour chacun.
Chantier suivant · chapitre 10 Le fan-out, penser en grappes de questions