#
llms.txt
llms.txt est un fichier Markdown placé à la racine web qui donne aux systèmes IA un guide compact des contenus publics les plus importants du site.
Il peut pointer vers les pages prioritaires, politiques, produits, documentations et URLs de référence. Il ne force pas les crawlers à obéir, mais leur fournit une transmission plus claire.
#
robots.txt pour IA
robots.txt définit quels crawlers peuvent récupérer un site web ou certaines zones du site.
Pour les systèmes IA, ce fichier est le point technique central pour autoriser, limiter ou bloquer GPTBot, ClaudeBot, Google-Extended et PerplexityBot. Il rend les règles lisibles par machine, mais ne constitue pas un conseil juridique.
#
GPTBot
GPTBot est un crawler OpenAI qui peut récupérer des contenus web publiquement accessibles pour des systèmes IA.
Les propriétaires de sites contrôlent généralement son accès via robots.txt. KI-Console vérifie si le site testé est techniquement lisible par ce bot.
#
ClaudeBot
ClaudeBot est un crawler Anthropic qui peut récupérer des contenus web publiquement accessibles pour des systèmes IA liés à Claude.
Son accès peut être autorisé ou bloqué dans robots.txt comme celui des autres crawlers nommés. Un site visible doit rendre cette décision explicite au lieu de dépendre de réglages accidentels.
#
Google-Extended
Google-Extended est une commande robots.txt de Google pour l’utilisation de contenus dans certains produits IA.
Il est différent de Googlebot pour le crawl de recherche classique. Les propriétaires de sites l’utilisent pour faire un choix technique sur certains usages IA par Google.
#
PerplexityBot
PerplexityBot est un crawler de Perplexity qui peut récupérer des pages web pour des systèmes de réponse et de découverte IA.
Son statut robots.txt est un signal indiquant si un site peut être découvert et cité dans des expériences liées à Perplexity. L’accès ne garantit ni citation ni placement dans une réponse.
#
Score AI Readiness
Le score AI Readiness résume les signaux techniques qui influencent la capacité des crawlers IA à lire et comprendre un site web.
Ce n’est pas une promesse de classement. Il aide les équipes à repérer vite les blocages crawler, fichiers de découverte manquants et lacunes de données structurées.
#
GEO (Generative Engine Optimization)
GEO désigne l’optimisation des contenus et signaux techniques pour les réponses dans les systèmes de recherche générative et IA.
Cela inclut des contenus crawlables, sources claires, données structurées et affirmations précises. GEO complète le SEO, sans le remplacer.
#
IndexNow
IndexNow est un protocole qui permet aux sites de notifier activement les moteurs de recherche au sujet des URLs modifiées.
Il peut accélérer la découverte de pages nouvelles ou mises à jour, sans garantir l’indexation. Pour la visibilité IA, il sert de signal de fraîcheur complémentaire.
#
Crawler IA
Un crawler IA est un bot qui récupère des contenus web pour la recherche IA, l’entraînement ou les systèmes de réponse en direct.
Les fournisseurs utilisent différents noms user-agent et différents objectifs de crawl. La visibilité commence par reconnaître ces bots et contrôler proprement leur accès.
#
sitemap.xml
sitemap.xml est un fichier XML qui liste les URLs importantes d’un site web pour les crawlers.
Il aide les moteurs de recherche et systèmes proches de l’IA à découvrir les pages pertinentes plus vite. Une sitemap ne remplace pas les liens internes, mais améliore la découvrabilité technique.