#
llms.txt
llms.txt es un archivo Markdown en la raíz web que da a los sistemas de IA una guía compacta de los contenidos públicos más importantes de un sitio.
Puede apuntar a páginas prioritarias, políticas, productos, documentación y URLs de referencia. No obliga a los crawlers a obedecer, pero les da una entrega más clara.
#
robots.txt para IA
robots.txt define qué crawlers pueden recuperar un sitio web o zonas concretas del sitio.
Para los sistemas de IA, es el archivo técnico central para permitir, limitar o bloquear GPTBot, ClaudeBot, Google-Extended y PerplexityBot. Hace las reglas legibles por máquinas, pero no es asesoramiento legal.
#
GPTBot
GPTBot es un crawler de OpenAI que puede recuperar contenido web públicamente accesible para sistemas de IA.
Los propietarios de sitios suelen controlar su acceso mediante robots.txt. KI-Console comprueba si el sitio probado es técnicamente legible para este bot.
#
ClaudeBot
ClaudeBot es un crawler de Anthropic que puede recuperar contenido web públicamente accesible para sistemas de IA relacionados con Claude.
Su acceso puede permitirse o bloquearse en robots.txt como el de otros crawlers nombrados. Un sitio visible debe hacer explícita esa decisión en vez de depender de valores por defecto accidentales.
#
Google-Extended
Google-Extended es un control robots.txt de Google para el uso de contenidos en determinados productos de IA.
Es distinto de Googlebot para el rastreo clásico de búsqueda. Los propietarios de sitios lo usan para tomar una decisión técnica sobre ciertos usos de IA por parte de Google.
#
PerplexityBot
PerplexityBot es un crawler de Perplexity que puede recuperar páginas web para sistemas de respuesta y descubrimiento de IA.
Su estado robots.txt es una señal de si un sitio puede descubrirse y citarse en experiencias relacionadas con Perplexity. El acceso no garantiza cita ni posición en una respuesta.
#
AI Readiness Score
El AI Readiness Score resume señales técnicas que influyen en si los crawlers de IA pueden leer y comprender un sitio web.
No es una promesa de ranking. Ayuda a los equipos a detectar rápido bloqueos de crawler, archivos de descubrimiento faltantes y brechas de datos estructurados.
#
GEO (Generative Engine Optimization)
GEO describe la optimización de contenidos y señales técnicas para respuestas en sistemas de búsqueda generativa e IA.
Incluye contenidos rastreables, fuentes claras, datos estructurados y afirmaciones precisas. GEO complementa el SEO, no lo sustituye.
#
IndexNow
IndexNow es un protocolo que permite a los sitios notificar activamente a los motores de búsqueda sobre URLs modificadas.
Puede acelerar el descubrimiento de páginas nuevas o actualizadas, pero no garantiza indexación. Para visibilidad IA, es una señal adicional de frescura.
#
Crawler de IA
Un crawler de IA es un bot que recupera contenido web para búsqueda IA, entrenamiento o sistemas de respuesta en vivo.
Cada proveedor usa nombres user-agent y propósitos de rastreo distintos. La visibilidad empieza por reconocer esos bots y controlar su acceso con claridad.
#
sitemap.xml
sitemap.xml es un archivo XML que lista URLs importantes de un sitio web para crawlers.
Ayuda a buscadores y sistemas cercanos a la IA a descubrir más rápido páginas relevantes. Una sitemap no sustituye los enlaces internos, pero mejora la descubribilidad técnica.
#
llms-full.txt
llms-full.txt es la versión larga de llms.txt: un único archivo con el texto completo de las páginas clave en lugar de solo enlaces.
Útil sobre todo en documentación, cuando un sistema de IA debe leer todo de una vez. Para una web de empresa normal, llms.txt es suficiente.
#
AEO (Answer Engine Optimization)
AEO consiste en preparar el contenido para ser citado dentro de una respuesta terminada, no para aparecer en una lista de resultados.
La diferencia con la búsqueda clásica: no hay clic que ganar, solo una mención. Se premian las afirmaciones claras y verificables.
#
LLM (gran modelo de lenguaje)
Un LLM es un modelo entrenado con cantidades muy grandes de texto que continúa el lenguaje y así responde, resume o traduce.
ChatGPT, Claude, Gemini y Perplexity se apoyan en uno. Lo que sabe de una web procede del entrenamiento o de una consulta en el momento de la pregunta.
#
RAG (generación aumentada por recuperación)
RAG describe un sistema que recupera fuentes pertinentes antes de responder y construye la respuesta con ellas en lugar de con su memoria.
Para quien gestiona una web es el caso decisivo: quien está accesible y es legible en el momento de la consulta entra en la respuesta, sea cual sea la fecha de entrenamiento.
#
Grounding (anclaje)
El grounding consiste en atar una respuesta de IA a fuentes verificables en lugar de dejar que se formule libremente.
Una web ayuda al anclaje cuando cifras, fechas y responsabilidades figuran claras en la página, no dentro de una imagen ni tras un clic.
#
Alucinación
Se llama alucinación a una respuesta de IA que suena fluida y segura pero es factualmente falsa.
Los huecos la provocan: si falta un dato en la web, el modelo lo rellena de forma plausible. La información completa es la protección más eficaz frente a afirmaciones falsas sobre la propia empresa.
#
Cita
Una cita es la mención nominal de una fuente dentro de una respuesta de IA, normalmente con enlace a la página citada.
Es la moneda de la visibilidad en IA: ser citado es aparecer, incluso sin el primer puesto en una lista de resultados. Se cita lo que es preciso y autosuficiente.
#
Fecha de corte del conocimiento
La fecha de corte es el límite temporal de los datos de entrenamiento de un modelo. Lo posterior solo lo conoce mediante una consulta.
Por eso un modelo puede describir una empresa con datos caducados. Estar accesible en una consulta lo corrige; estar bloqueado deja en pie la imagen antigua.
#
Datos de entrenamiento
Los datos de entrenamiento son los textos con los que aprendió un modelo. Quedan fijados al terminar el entrenamiento.
Si la propia web figura en ellos no puede comprobarse desde fuera. Lo que sí se dirige es el acceso de los rastreadores futuros y el éxito de una consulta en directo.
#
Token
Un token es la unidad mínima de texto en la que un modelo divide un texto, casi siempre un fragmento de palabra y no una palabra entera.
Un modelo solo puede considerar un número limitado de tokens a la vez. Por eso las páginas largas se recortan y lo que está más abajo cae primero.
#
Prompt
Un prompt es la entrada con la que alguien interroga a un sistema de IA: la frase de la que se deriva la respuesta.
Los prompts son más largos y conversacionales que las búsquedas: no « taller Berna » sino « ¿qué taller de Berna repara híbridos? ». El contenido que responde a preguntas enteras se cita más.
#
Embedding
Un embedding representa un texto como una serie de números, lo que hace medible la cercanía de significado entre textos.
Así un sistema de IA encuentra los pasajes que responden a una pregunta aunque no coincida ninguna palabra. Delimitar bien el tema de cada sección ayuda más que la densidad de palabras clave.
#
schema.org
schema.org es un vocabulario común con el que una web indica en forma legible por máquinas de qué trata una página: una empresa, un producto, una receta, una pregunta.
Sin él, un sistema tiene que adivinar a partir del texto corrido. Con él, la página dice sin rodeos: este es el teléfono, este es el precio, estos son los horarios.
#
JSON-LD
JSON-LD es la notación habitual hoy para los datos estructurados: un bloque en la cabecera de la página que lleva la información sin alterar el texto visible.
Su ventaja sobre formatos más antiguos es la separación: el marcado está en un solo sitio en vez de disperso. Google y los grandes sistemas de IA lo leen.
#
Entidad
Una entidad es una cosa del mundo determinada sin ambigüedad —esta empresa, esta persona, este lugar— con independencia de cómo se escriba.
Para buscadores y sistemas de IA esa es la diferencia entre una cadena de caracteres y un interlocutor. Quien se reconoce como entidad no se confunde con una homónima.
#
Grafo de conocimiento
Un grafo de conocimiento es una red de entidades y sus relaciones: esta empresa tiene sede en esta ciudad, pertenece a aquel grupo, ofrece este producto.
Google y los proveedores de IA mantienen redes así. Quien falta en ellas existe para ellos solo como texto; quien figura se nombra en las respuestas con sus vínculos.
#
sameAs
sameAs es una declaración de los datos estructurados que dice: este perfil en otra plataforma pertenece a la misma empresa o persona que esta página.
Es una afirmación de identidad y solo debe usarse para perfiles que uno posee de verdad. Entradas ajenas o inventadas no son un truco, sino una declaración falsa.
#
Enlace canónico
Un enlace canónico señala la dirección de referencia de una página cuando el mismo contenido es accesible en varias direcciones.
Sin él, el efecto se reparte entre variantes con y sin www, con parámetros, con mayúsculas. Con él, todo suma en una sola dirección, también para un sistema de IA que quiera citar una fuente.
#
hreflang
hreflang indica qué versión lingüística de una página se dirige a qué público y enlaza cada versión con todas las demás.
Sin esa indicación, un buscador toma con facilidad varias traducciones por una misma página duplicada. Con ella, cada idioma tiene su propia oportunidad.
#
X-Robots-Tag
La X-Robots-Tag es una directiva en la cabecera HTTP que controla la indexación y el uso, también en archivos que no son HTML.
Un PDF o una imagen no tienen elemento meta dentro del documento: la cabecera es el único sitio. Actúa como complemento de robots.txt, no en su lugar.
#
noai y noimageai
noai y noimageai son indicaciones con las que una web declara que sus textos o imágenes no deben usarse para entrenar IA.
Vienen del mundo de la imagen y no son un estándar vinculante: solo una parte de los proveedores las atiende. Como declaración de intenciones tienen sentido; como protección no bastan.
#
Crawl-delay
Crawl-delay es una indicación de robots.txt que impone a un rastreador una pausa mínima entre dos peticiones.
Google lleva años ignorándola; Anthropic y algunos más la respetan. Quien sufra por la carga debería probarla antes de bloquear del todo: frenar cuesta tiempo, bloquear cuesta visibilidad.
#
Verificación de rastreadores
La verificación de rastreadores es la comprobación de que un visitante es realmente el bot que dice ser, a través de la dirección IP y no del identificador.
Una línea de agente de usuario se falsifica en un segundo. Por eso los grandes proveedores publican sus rangos de direcciones. Sin esa comparación, cualquier estadística de visitas es solo un montón de afirmaciones.
#
E-E-A-T
E-E-A-T significa experiencia, pericia, autoridad y fiabilidad: los cuatro puntos con los que Google describe la calidad de una fuente.
No es una medida ni un factor de posicionamiento que se pueda ajustar, sino la descripción de lo que distingue a una buena fuente: autoría rastreable, pruebas, aviso legal y actualidad.
#
Renderizado en el servidor
Con el renderizado en el servidor, el servidor entrega la página terminada; con el del cliente, JavaScript compone el contenido en el navegador.
Los rastreadores de IA no suelen ejecutar JavaScript. Una página que construye su contenido solo en el navegador les llega vacía: es la causa invisible más frecuente de falta de visibilidad.
#
Pay-per-crawl
Pay-per-crawl designa los enfoques en los que quien gestiona una web cobra por el acceso de un rastreador de IA, técnicamente mediante el estado HTTP 402.
Cloudflare lo lanzó como oferta en 2025. Queda abierto si de ahí surge un mercado; para la mayoría de las webs pequeñas la pregunta todavía no es práctica.