website@ki-console.com

Глосарій

Глосарій ШІ-видимості

Короткі, придатні для цитування визначення термінів, які власники вебсайтів, пошукові команди та ШІ-системи використовують щодо ШІ-видимості.

#

llms.txt

llms.txt — це файл у форматі Markdown у кореневому каталозі вебсайту, який компактно пояснює ШІ-системам найважливіший публічний контент і вказівки вебсайту.

Він може посилатися на пріоритетні сторінки, політики, продукти, документацію та достовірні джерела. Він не змушує краулерів дотримуватися вказівок, але забезпечує їм чіткішу передачу інформації.

#

robots.txt (для ШІ)

robots.txt визначає, які краулери можуть звертатися до вебсайту або окремих його розділів.

Для ШІ-систем це центральний технічний файл, щоб дозволяти, обмежувати або блокувати GPTBot, ClaudeBot, Google-Extended чи PerplexityBot. Він робить правила доступу машиночитними, але не замінює юридичну консультацію.

#

GPTBot

GPTBot — це краулер OpenAI, який може отримувати публічно доступний вебконтент для ШІ-систем.

Власники вебсайтів зазвичай керують доступом через robots.txt. KI-Console перевіряє, чи технічно читабельний перевірений вебсайт для цього бота.

#

ClaudeBot

ClaudeBot — це краулер Anthropic, який може отримувати публічно доступний вебконтент для ШІ-систем, пов'язаних із Claude.

Його доступ можна дозволити або заблокувати в robots.txt, як і для інших названих краулерів. Видимий вебсайт має ухвалити це рішення чітко, а не покладатися на випадкові стандартні налаштування.

#

Google-Extended

Google-Extended — це елемент керування robots.txt від Google для використання контенту в певних продуктах ШІ.

Він відрізняється від Googlebot для класичного пошукового сканування. За його допомогою власники вебсайтів ухвалюють технічне рішення щодо певних видів використання ШІ компанією Google.

#

PerplexityBot

PerplexityBot — це краулер Perplexity, який може отримувати вебсторінки для систем ШІ-відповідей і виявлення.

Його статус у robots.txt є сигналом того, чи може вебсайт бути виявлений і процитований у сервісах, пов'язаних із Perplexity. Доступ не гарантує згадки чи розміщення.

#

AI Readiness Score

AI Readiness Score узагальнює технічні сигнали, які впливають на те, чи можуть ШІ-краулери читати та розуміти вебсайт.

Це не обіцянка ранжування. Він допомагає командам швидко оцінити блокування краулерів, відсутні файли виявлення та прогалини у структурованих даних.

#

GEO (Generative Engine Optimization)

GEO описує оптимізацію контенту та технічних аспектів для відповідей у генеративних пошукових і ШІ-системах.

Сюди належать придатний для сканування контент, чіткі джерела, структуровані дані та точні твердження. GEO доповнює SEO, але не замінює його.

#

IndexNow

IndexNow — це протокол, за допомогою якого вебсайти можуть активно повідомляти пошукові системи про змінені URL.

Він пришвидшує сповіщення про нові чи оновлені сторінки, але не гарантує індексації. Для ШІ-видимості це додатковий сигнал актуальності.

#

ШІ-краулер

ШІ-краулер — це бот, який отримує вебконтент для ШІ-пошуку, навчання або відповідей у реальному часі.

Залежно від постачальника він виконує різні завдання та використовує власні імена User-Agent. Видимість починається з технічного розпізнавання цих ботів і чіткого керування ними.

#

sitemap.xml

sitemap.xml — це XML-файл, який перелічує важливі URL вебсайту для краулерів.

Вона допомагає пошуковим системам і системам, пов'язаним зі ШІ, швидше виявляти релевантні сторінки. Карта сайту не замінює внутрішні посилання, але доповнює технічну виявлюваність.

#

llms-full.txt

llms-full.txt — це довга форма llms.txt: один файл із повним текстом ключових сторінок, а не лише з посиланнями на них.

Корисно передусім для документації, коли система ШІ має прочитати весь матеріал за один раз. Для звичайного сайту компанії достатньо llms.txt.

#

AEO (оптимізація для відповідей)

AEO — це підготовка змісту до цитування всередині готової відповіді, а не до появи в переліку результатів.

Відмінність від класичного пошуку: клікати нема куди, є лише згадка. Винагороджуються чіткі, самодостатні та перевірювані твердження.

#

LLM (велика мовна модель)

LLM — це модель, навчена на дуже великих обсягах тексту, яка продовжує мову й таким чином відповідає, узагальнює або перекладає.

ChatGPT, Claude, Gemini і Perplexity побудовані на LLM. Те, що модель знає про сайт, походить або з навчання, або із запиту в момент питання.

#

RAG (генерація з пошуком)

RAG — це підхід, за якого система перед відповіддю дістає відповідні джерела й будує відповідь із них, а не з памʼяті.

Для власника сайту це вирішальний випадок: хто доступний і зрозумілий у момент запиту, той потрапляє у відповідь — незалежно від дати навчання.

#

Grounding (привʼязка до джерел)

Grounding означає привʼязку відповіді ШІ до перевірюваних джерел замість вільного формулювання.

Сайт допомагає привʼязці, коли числа, дати й відповідальні особи прямо вказані на сторінці — не всередині зображення й не за кліком.

#

Галюцинація

Галюцинація — це відповідь ШІ, яка звучить плавно й упевнено, але фактично хибна.

Прогалини її провокують: якщо даних на сайті бракує, модель домислює їх правдоподібно. Повні відомості — найдієвіший захист від хибних тверджень про власну компанію.

#

Цитування

Цитування — це поіменна згадка джерела у відповіді ШІ, зазвичай із посиланням на названу сторінку.

Це валюта помітності в ШІ: кого цитують, той зʼявляється — навіть без першого місця в переліку результатів. Цитують те, що сформульовано точно й самодостатньо.

#

Межа знань (knowledge cutoff)

Межа знань — це дата, до якої сягають навчальні дані моделі. Пізніше вона знає лише через запит.

Тому модель може описувати компанію застарілими даними. Доступність під час живого запиту це виправляє; блокування залишає стару картину.

#

Навчальні дані

Навчальні дані — це тексти, на яких навчалася модель. Вони незмінні від завершення навчання.

Чи є там власний сайт, ззовні перевірити не можна. Керувати можна лише доступом майбутніх сканерів — і тим, чи вдасться живий запит.

#

Токен

Токен — це найменша текстова одиниця, на які модель розбиває текст: зазвичай частина слова, а не ціле слово.

Модель може врахувати лише обмежену кількість токенів за раз. Тому довгі сторінки обрізають, і те, що стоїть найнижче, зникає першим.

#

Промпт

Промпт — це введення, яким людина звертається до системи ШІ: речення, з якого постає відповідь.

Промпти довші й розмовніші за пошукові запити: не «автосервіс Берн», а «який автосервіс у Берні ремонтує гібриди?». Зміст, що відповідає на цілі питання, цитують частіше.

#

Ембедінг

Ембедінг подає текст як послідовність чисел, завдяки чому змістову близькість між текстами можна виміряти.

Так система ШІ знаходить доречні уривки, навіть коли жодне слово не збігається дослівно. Чітке тематичне розмежування розділів помагає більше за щільність ключових слів.

#

schema.org

schema.org — це спільний словник, яким сайти машинозчитувано вказують, про що йдеться на сторінці: компанія, товар, рецепт, питання.

Без нього система має вгадувати зі суцільного тексту. З ним сторінка прямо каже: ось телефон, ось ціна, ось години роботи.

#

JSON-LD

JSON-LD — це звична сьогодні форма запису структурованих даних: блок у заголовку сторінки, що несе відомості, не змінюючи видимого тексту.

Перевага перед старішими форматами — відокремленість: розмітка стоїть в одному місці, а не розсіяна по коду. Google і великі системи ШІ її читають.

#

Сутність

Сутність — це однозначно визначена річ у світі: саме ця компанія, саме ця людина, саме це місце — незалежно від того, як її пишуть.

Для пошукових систем і ШІ це різниця між рядком символів і співрозмовником. Кого розпізнано як сутність, того не сплутають з однойменною компанією.

#

Граф знань

Граф знань — це мережа сутностей і їхніх звʼязків: ця компанія розташована в цьому місті, належить до тієї групи, пропонує цей товар.

Google і постачальники ШІ підтримують такі мережі. Хто в них відсутній, для них існує лише як текст; хто присутній, того називають у відповідях разом із його звʼязками.

#

sameAs

sameAs — це твердження у структурованих даних, яке каже: цей профіль на іншій платформі належить тій самій компанії або особі, що й ця сторінка.

Це заява про тотожність, і ставити її можна лише для профілів, якими ви справді володієте. Чужі чи вигадані записи — не хитрість, а хибне твердження.

#

Канонічне посилання

Канонічне посилання називає визначальну адресу сторінки, коли той самий вміст доступний за кількома адресами.

Без нього дія розпорошується між варіантами з www і без, із параметрами, з великими літерами. З ним усе зараховується на одну адресу — зокрема й для системи ШІ, що хоче назвати джерело.

#

hreflang

hreflang указує, яка мовна версія сторінки призначена для якої аудиторії, і повʼязує кожну версію з усіма іншими.

Без цієї вказівки пошукова система легко сприйме кілька перекладів як одну подвоєну сторінку. З нею кожна мова дістає власний шанс.

#

X-Robots-Tag

X-Robots-Tag — це вказівка в заголовку HTTP, якою керують індексацією та використанням навіть для файлів, що не є HTML.

У PDF чи зображення немає метаелемента всередині документа — заголовок тут єдине можливе місце. Він діє на додачу до robots.txt, а не замість нього.

#

noai і noimageai

noai і noimageai — це вказівки, якими сайт заявляє, що текст або зображення не слід використовувати для навчання ШІ.

Вони походять зі світу зображень і не є обовʼязковим стандартом — їх зважає лише частина постачальників. Як заява про намір вони мають сенс; як захист — недостатні.

#

Crawl-delay

Crawl-delay — це вказівка в robots.txt, що задає сканерові мінімальну паузу між двома зверненнями.

Google ігнорує її роками, Anthropic і деякі інші — шанують. Тому за надмірного навантаження варто спробувати її, перш ніж блокувати: гальмувати коштує часу, блокувати коштує помітності.

#

Перевірка сканерів

Перевірка сканерів — це з’ясування, чи відвідувач справді той бот, за якого себе видає: за IP-адресою, а не за ідентифікатором.

Рядок user-agent підробляють за секунду. Тому великі постачальники публікують свої діапазони адрес. Без такого звіряння будь-яка статистика візитів — лише набір тверджень.

#

E-E-A-T

E-E-A-T означає досвід, фаховість, авторитетність і надійність — чотири пункти, якими Google описує якість джерела.

Це не показник і не чинник ранжування, який можна налаштувати, а опис того, що вирізняє добре джерело: простежуване авторство, докази, вихідні дані, свіжість.

#

Формування на сервері

За формування на сервері сервер віддає готову сторінку; за формування на боці клієнта вміст спершу збирає JavaScript у браузері.

Сканери ШІ зазвичай не виконують JavaScript. Сторінка, що збирає вміст лише в браузері, доходить до них порожньою — це найчастіша непомітна причина браку видимості.

#

Pay-per-crawl

Pay-per-crawl означає підходи, за яких власник сайту бере плату за доступ сканера ШІ — технічно через стан HTTP 402.

Cloudflare запровадила це як послугу 2025 року. Чи виросте з цього ринок — питання відкрите; для більшості малих сайтів воно поки не практичне.

Перевірте свій вебсайт

Дізнайтеся, які сигнали ШІ працюють прямо зараз

Спершу запустіть безкоштовне сканування. З обліковим записом ви можете верифікувати домен, зберігати історію, генерувати файли та документувати візити краулерів із часом.