website@ki-console.com

Glossaire

Glossaire de la visibilité IA

Définitions courtes et citables pour les termes utilisés par les propriétaires de sites, équipes search et systèmes IA autour de la visibilité IA.

#

llms.txt

llms.txt est un fichier Markdown placé à la racine web qui donne aux systèmes IA un guide compact des contenus publics les plus importants du site.

Il peut pointer vers les pages prioritaires, politiques, produits, documentations et URLs de référence. Il ne force pas les crawlers à obéir, mais leur fournit une transmission plus claire.

#

robots.txt pour IA

robots.txt définit quels crawlers peuvent récupérer un site web ou certaines zones du site.

Pour les systèmes IA, ce fichier est le point technique central pour autoriser, limiter ou bloquer GPTBot, ClaudeBot, Google-Extended et PerplexityBot. Il rend les règles lisibles par machine, mais ne constitue pas un conseil juridique.

#

GPTBot

GPTBot est un crawler OpenAI qui peut récupérer des contenus web publiquement accessibles pour des systèmes IA.

Les propriétaires de sites contrôlent généralement son accès via robots.txt. KI-Console vérifie si le site testé est techniquement lisible par ce bot.

#

ClaudeBot

ClaudeBot est un crawler Anthropic qui peut récupérer des contenus web publiquement accessibles pour des systèmes IA liés à Claude.

Son accès peut être autorisé ou bloqué dans robots.txt comme celui des autres crawlers nommés. Un site visible doit rendre cette décision explicite au lieu de dépendre de réglages accidentels.

#

Google-Extended

Google-Extended est une commande robots.txt de Google pour l’utilisation de contenus dans certains produits IA.

Il est différent de Googlebot pour le crawl de recherche classique. Les propriétaires de sites l’utilisent pour faire un choix technique sur certains usages IA par Google.

#

PerplexityBot

PerplexityBot est un crawler de Perplexity qui peut récupérer des pages web pour des systèmes de réponse et de découverte IA.

Son statut robots.txt est un signal indiquant si un site peut être découvert et cité dans des expériences liées à Perplexity. L’accès ne garantit ni citation ni placement dans une réponse.

#

Score AI Readiness

Le score AI Readiness résume les signaux techniques qui influencent la capacité des crawlers IA à lire et comprendre un site web.

Ce n’est pas une promesse de classement. Il aide les équipes à repérer vite les blocages crawler, fichiers de découverte manquants et lacunes de données structurées.

#

GEO (Generative Engine Optimization)

GEO désigne l’optimisation des contenus et signaux techniques pour les réponses dans les systèmes de recherche générative et IA.

Cela inclut des contenus crawlables, sources claires, données structurées et affirmations précises. GEO complète le SEO, sans le remplacer.

#

IndexNow

IndexNow est un protocole qui permet aux sites de notifier activement les moteurs de recherche au sujet des URLs modifiées.

Il peut accélérer la découverte de pages nouvelles ou mises à jour, sans garantir l’indexation. Pour la visibilité IA, il sert de signal de fraîcheur complémentaire.

#

Crawler IA

Un crawler IA est un bot qui récupère des contenus web pour la recherche IA, l’entraînement ou les systèmes de réponse en direct.

Les fournisseurs utilisent différents noms user-agent et différents objectifs de crawl. La visibilité commence par reconnaître ces bots et contrôler proprement leur accès.

#

sitemap.xml

sitemap.xml est un fichier XML qui liste les URLs importantes d’un site web pour les crawlers.

Il aide les moteurs de recherche et systèmes proches de l’IA à découvrir les pages pertinentes plus vite. Une sitemap ne remplace pas les liens internes, mais améliore la découvrabilité technique.

#

llms-full.txt

llms-full.txt est la version longue de llms.txt : un fichier unique contenant le texte complet des pages importantes au lieu de simples liens.

Surtout utile pour la documentation, quand un système d'IA doit lire l'ensemble en une fois. Pour un site d'entreprise ordinaire, llms.txt suffit.

#

AEO (Answer Engine Optimization)

L'AEO consiste à préparer un contenu pour être cité dans une réponse finie plutôt que pour figurer dans une liste de résultats.

La différence avec la recherche classique : il n'y a pas de clic à gagner, seulement une mention. Ce sont les affirmations claires et vérifiables qui sont retenues.

#

LLM (grand modèle de langage)

Un LLM est un modèle entraîné sur de très grandes quantités de texte qui poursuit le langage et, ce faisant, répond, résume ou traduit.

ChatGPT, Claude, Gemini et Perplexity reposent tous sur un LLM. Ce qu'il sait d'un site vient soit de l'entraînement, soit d'une requête au moment de la question.

#

RAG (génération augmentée par recherche)

Le RAG désigne un système qui récupère des sources pertinentes avant de répondre et construit la réponse à partir d'elles plutôt que de sa mémoire.

Pour un éditeur de site, c'est le cas décisif : celui qui est accessible et lisible au moment de la requête entre dans la réponse, quelle que soit la date d'entraînement.

#

Grounding (ancrage)

Le grounding consiste à rattacher une réponse d'IA à des sources vérifiables plutôt qu'à la laisser formuler librement.

Un site aide l'ancrage quand les chiffres, les dates et les responsabilités figurent clairement sur la page, pas dans une image ni derrière un clic.

#

Hallucination

On appelle hallucination une réponse d'IA qui semble fluide et assurée mais qui est factuellement fausse.

Les lacunes y invitent : si une donnée manque sur le site, le modèle la comble de façon plausible. Des informations complètes sont la meilleure protection contre les affirmations fausses sur sa propre entreprise.

#

Citation

Une citation est la mention nominative d'une source dans une réponse d'IA, généralement accompagnée d'un lien vers la page citée.

C'est la monnaie de la visibilité IA : être cité, c'est apparaître, même sans première place dans une liste de résultats. Est cité ce qui est précis et autoportant.

#

Date de coupure des connaissances

La date de coupure est la limite temporelle des données d'entraînement d'un modèle. Ce qui suit, il ne le connaît que par une requête.

C'est pourquoi un modèle peut décrire une entreprise avec des informations périmées. Être accessible lors d'une requête corrige cela ; être bloqué laisse l'ancienne image en place.

#

Données d'entraînement

Les données d'entraînement sont les textes dont un modèle a appris. Elles sont figées dès la fin de l'entraînement.

Savoir si son site en fait partie est invérifiable de l'extérieur. Ce qui se pilote, c'est l'accès des futurs robots et la réussite d'une requête en direct.

#

Token (jeton)

Un token est la plus petite unité de texte dans laquelle un modèle découpe un texte, souvent un fragment de mot plutôt qu'un mot entier.

Un modèle ne peut considérer qu'un nombre limité de tokens à la fois. Les pages longues sont donc tronquées, et ce qui se trouve tout en bas disparaît en premier.

#

Prompt

Un prompt est la saisie par laquelle quelqu'un interroge un système d'IA : la phrase dont découle la réponse.

Les prompts sont plus longs et plus parlés que les requêtes : non pas « garage Berne » mais « quel garage à Berne répare les hybrides ? ». Un contenu qui répond à ces questions entières est plus souvent cité.

#

Embedding (plongement)

Un embedding représente un texte sous forme de suite de nombres, ce qui rend mesurable la proximité de sens entre deux textes.

C'est ainsi qu'un système d'IA trouve les passages correspondant à une question même sans mot commun. Une délimitation thématique nette par section aide plus que la densité de mots-clés.

#

schema.org

schema.org est un vocabulaire commun par lequel un site indique, sous forme lisible par machine, ce dont traite une page : une entreprise, un produit, une recette, une question.

Sans lui, un système doit deviner à partir du texte courant. Avec lui, la page dit explicitement : voici le numéro de téléphone, voici le prix, voici les horaires.

#

JSON-LD

JSON-LD est la notation courante des données structurées : un bloc dans l'en-tête de la page qui porte les informations sans toucher au texte visible.

Son avantage sur les formats plus anciens est la séparation : le balisage tient en un seul endroit au lieu d'être éparpillé. Google et les grands systèmes d'IA le lisent.

#

Entité

Une entité est une chose du monde identifiée sans ambiguïté — cette entreprise-là, cette personne-là, ce lieu-là — indépendamment de son orthographe.

Pour les moteurs et les systèmes d'IA, c'est la différence entre une chaîne de caractères et un interlocuteur. Qui est reconnu comme entité n'est pas confondu avec une homonyme.

#

Graphe de connaissances

Un graphe de connaissances est un réseau d'entités et de leurs relations : cette entreprise siège dans cette ville, appartient à ce groupe, propose ce produit.

Google et les fournisseurs d'IA entretiennent de tels réseaux. Qui n'y figure pas n'existe pour eux que comme texte ; qui y figure est cité avec ses rattachements.

#

sameAs

sameAs est une déclaration des données structurées qui dit : ce profil sur une autre plateforme appartient à la même entreprise ou personne que cette page.

C'est une affirmation d'identité, à réserver aux profils dont on est réellement titulaire. Des entrées étrangères ou inventées ne sont pas une astuce mais une fausse déclaration.

#

Lien canonique

Un lien canonique désigne l'adresse faisant autorité pour une page quand le même contenu est accessible à plusieurs adresses.

Sans lui, l'effet se disperse entre les variantes avec ou sans www, avec paramètres, avec majuscules. Avec lui, tout se cumule sur une seule adresse — y compris pour un système d'IA qui veut citer une source.

#

hreflang

hreflang indique quelle version linguistique d'une page s'adresse à quel public et relie chaque version à toutes les autres.

Sans cette indication, un moteur prend facilement plusieurs traductions pour une même page dupliquée. Avec elle, chaque langue a sa propre chance.

#

X-Robots-Tag

Le X-Robots-Tag est une directive placée dans l'en-tête HTTP, qui pilote l'indexation et l'usage y compris pour des fichiers qui ne sont pas du HTML.

Un PDF ou une image n'a pas de balise meta dans le document : l'en-tête est le seul endroit possible. Il agit en complément de robots.txt, non à sa place.

#

noai et noimageai

noai et noimageai sont des indications par lesquelles un site déclare que ses textes ou ses images ne doivent pas servir à l'entraînement d'une IA.

Elles viennent du monde de l'image et ne constituent pas une norme contraignante : seule une partie des acteurs les prend en compte. Comme déclaration d'intention elles gardent un sens ; comme protection, non.

#

Crawl-delay

Crawl-delay est une indication de robots.txt qui impose à un robot une pause minimale entre deux requêtes.

Google l'ignore depuis des années ; Anthropic et quelques autres la respectent. Face à une charge trop lourde, essayez-la donc avant de bloquer : ralentir coûte du temps, bloquer coûte de la visibilité.

#

Vérification des robots

La vérification des robots consiste à contrôler qu'un visiteur est bien le robot qu'il prétend être — par l'adresse IP, non par l'identifiant.

Une ligne d'agent utilisateur se falsifie en une seconde. C'est pourquoi les grands acteurs publient leurs plages d'adresses. Sans cette comparaison, toute statistique de visites n'est qu'un recueil d'affirmations.

#

E-E-A-T

E-E-A-T signifie expérience, expertise, autorité et fiabilité — les quatre points sur lesquels Google fonde la qualité d'une source.

Ce n'est ni une mesure ni un facteur de classement que l'on pourrait régler, mais la description de ce qui caractérise une bonne source : une paternité traçable, des preuves, des mentions légales, une mise à jour.

#

Rendu côté serveur

Avec le rendu côté serveur, le serveur livre la page finie ; avec le rendu côté client, c'est JavaScript qui assemble le contenu dans le navigateur.

Les robots d'IA n'exécutent en général pas JavaScript. Une page qui ne se construit que dans le navigateur leur parvient vide — c'est la cause invisible la plus fréquente d'un manque de visibilité.

#

Pay-per-crawl

Le pay-per-crawl désigne les approches où un éditeur fait payer l'accès à un robot d'IA, techniquement via le statut HTTP 402.

Cloudflare l'a lancé comme offre en 2025. Reste ouverte la question de savoir si un marché en naîtra ; pour la plupart des petits sites, elle n'est pas encore pratique.

Vérifier votre site

Voyez quels signaux IA fonctionnent maintenant

Commencez par le scan gratuit. Avec un compte, vous vérifiez le domaine, gardez l'historique, générez des fichiers et documentez les visites de crawlers.