Ключове розрізнення

llms.txt проти robots.txt і sitemap.xml

Три файли лежать в корені сайту, усі три «для роботів» — і на цьому схожість закінчується. Плутанина між ними породжує найшкідливішу помилку в темі: спробу керувати доступом AI-ботів через llms.txt, який на це фізично не здатний.

Коротко в таблиці

robots.txtsitemap.xmlllms.txt
Питання, на яке відповідаєКуди боту можна?Які сторінки в мене є?З чого агенту почати?
ФорматДирективи User-agent / Allow / DisallowXML за схемою sitemaps.orgMarkdown
СтатусRFC 9309, 2022домовленість sitemaps.orgпропозиція llmstxt.org
РозташуванняЛише /robots.txtБудь-де; адреса вказується в robots.txtКорінь або будь-який підкаталог
ОбсягПравила для шляхівУсі індексовані URLКурований мінімум
Зовнішні посиланняНе передбаченозабороненодозволено
Керує доступомтакніні
Впливає на Google ПошукТакТакні, за заявою Google
Хто гарантовано читаєУсі великі краулериУсі пошукові системиКодові агенти, Lighthouse

llms.txt і robots.txt

Специфікація формулює різницю прямо:

«robots.txt lets automated tools know what access to a site is considered acceptable, such as for search indexing bots. llms.txt information is instead used on demand, when an agent needs information about a topic while assisting a user.»

«robots.txt повідомляє автоматизованим інструментам, який доступ до сайту вважається прийнятним — наприклад, для ботів пошукової індексації. Інформація з llms.txt натомість використовується на вимогу, коли агенту потрібні відомості з теми під час допомоги користувачу.» llmstxt.org

Практично це означає ось що:

Хочете заборонити AI використовувати ваш контент

Це задача robots.txt. Потрібні правила для конкретних токенів: GPTBot, ClaudeBot, CCBot, Google-Extended, Applebot-Extended та інших. У llms.txt немає жодної директиви заборони.

Перевірити robots.txt

Хочете, щоб агент швидше зрозумів ваш сайт

Це задача llms.txt. Він не змінює прав доступу — лише скорочує агенту шлях до потрібної сторінки, якщо доступ уже відкритий.

Як створити llms.txt

Вони працюють разом

Типова коректна конфігурація виглядає так:

# robots.txt

# Тренування моделей — забороняємо
User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

# Пошук із цитуванням — дозволяємо, звідси йдуть переходи
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Загальні правила
User-agent: *
Disallow: /wp-admin/
Disallow: /cart/

Sitemap: https://example.com/sitemap.xml

А llms.txt тим часом описує, що є цінного в дозволеній частині сайту. Один файл окреслює межі, другий — розставляє покажчики всередині них.

llms.txt і sitemap.xml

Специфікація перелічує три причини, чому sitemap не є замінником:

  1. У ньому зазвичай немає LLM-читабельних версій сторінок — тільки HTML-адреси.
  2. Він не містить посилань на зовнішні сайти, навіть коли вони потрібні для розуміння контексту. Формат sitemaps.org це прямо забороняє.
  3. Він охоплює документи, які в сумі не вміщаються в контекстне вікно, і містить багато зайвого для розуміння сайту.
Сценарійsitemap.xmlllms.txt
Інтернет-магазин на 40 000 товарівУсі 40 000 URLКатегорії, умови доставки, гарантія, контакти — 15 посилань
Документація бібліотекиУсі сторінки довідникаШвидкий старт, довідник API, приклади — у .md
Блог на 800 статейУсі 800 статейОпорні матеріали та рубрикатор

Чек-лист: який файл вам потрібен

Треба, щоб сайт індексувався в Google

sitemap.xml + robots.txt. llms.txt тут ні до чого.

Треба заборонити навчання моделей на вашому контенті

Тільки robots.txt із правилами для конкретних AI-токенів.

Треба, щоб ChatGPT або Perplexity цитували ваш сайт

Насамперед не блокуйте OAI-SearchBot, PerplexityBot і Claude-SearchBot у robots.txt. llms.txt може допомогти агенту зорієнтуватися, але гарантій не дає.

Треба, щоб кодовий агент правильно працював із вашим API

Ось тут llms.txt дає найбільше — разом із .md-версіями сторінок документації.

×

Треба підняти позиції в Google

llms.txt не впливає ніяк — це прямо написано в документації Google.