La crawlabilité est la capacité d’un contenu web à être exploré et interprété par les robots des moteurs de recherche et des intelligences artificielles. Un contenu bloqué par robots.txt, rendu uniquement en JavaScript ou trop lent à répondre est invisible pour les IA, quelle que soit sa qualité.
Les cinq causes d’invisibilité
- Un robots.txt qui bloque les robots IA. GPTBot, ClaudeBot, PerplexityBot et Google-Extended doivent être explicitement autorisés.
- Un pare-feu ou un CDN trop zélé. Beaucoup de configurations bloquent par défaut les agents inconnus, ce qui inclut les robots IA récents.
- Un rendu uniquement côté client. Une partie des robots IA n’exécute pas JavaScript : ils lisent le HTML brut et n’y trouvent rien.
- Des temps de réponse élevés. Au-delà de 500 millisecondes, une part des explorations échoue silencieusement.
- Des données enfermées dans des images ou des PDF. Un tableau en image n’est pas un tableau.
Le test le plus simple
Désactivez JavaScript dans votre navigateur et rechargez votre page. Ce que vous voyez est, à peu de chose près, ce que voit une partie des robots IA. Si le contenu principal a disparu, la priorité technique est trouvée.
Où ce terme intervient dans la méthode
Ce terme relève de la Phase 2, aligner votre entité de la méthode Passeport vers la Citation. Pour aller plus loin : La grille d’audit de crawlabilité en 20 points.
SSR (rendu côté serveur)
Le SSR, ou rendu côté serveur, est la technique consistant à générer le HTML d’une page sur le serveur avant de l’envoyer au navigateur.
llms.txt
Le fichier llms.txt est un fichier texte placé à la racine d’un site web qui fournit aux robots des intelligences artificielles une synthèse structurée de l’entité et de ses contenus.
Chunk (fragment)
Un chunk est un fragment de document extrait par un système de recherche augmentée pour être injecté dans le contexte d’un modèle de langage.
Balisage Schema.org
Le balisage Schema.org est un vocabulaire standardisé de données structurées, créé conjointement par Google, Microsoft, Yahoo et Yandex, qui permet de décrire le contenu d’une page dans un format compréhensible par les machines.