llms.txt проти robots.txt і sitemap.xml
Три файли лежать в корені сайту, усі три «для роботів» — і на цьому схожість закінчується.
Плутанина між ними породжує найшкідливішу помилку в темі: спробу керувати доступом AI-ботів
через llms.txt, який на це фізично не здатний.
Коротко в таблиці
robots.txt | sitemap.xml | llms.txt | |
|---|---|---|---|
| Питання, на яке відповідає | Куди боту можна? | Які сторінки в мене є? | З чого агенту почати? |
| Формат | Директиви User-agent / Allow / Disallow | XML за схемою sitemaps.org | Markdown |
| Статус | RFC 9309, 2022 | домовленість sitemaps.org | пропозиція llmstxt.org |
| Розташування | Лише /robots.txt | Будь-де; адреса вказується в robots.txt | Корінь або будь-який підкаталог |
| Обсяг | Правила для шляхів | Усі індексовані URL | Курований мінімум |
| Зовнішні посилання | Не передбачено | заборонено | дозволено |
| Керує доступом | так | ні | ні |
| Впливає на Google Пошук | Так | Так | ні, за заявою Google |
| Хто гарантовано читає | Усі великі краулери | Усі пошукові системи | Кодові агенти, Lighthouse |
llms.txt і robots.txt
Специфікація формулює різницю прямо:
«robots.txt lets automated tools know what access to a site is considered acceptable, such as for search indexing bots. llms.txt information is instead used on demand, when an agent needs information about a topic while assisting a user.»
«robots.txt повідомляє автоматизованим інструментам, який доступ до сайту вважається прийнятним — наприклад, для ботів пошукової індексації. Інформація з llms.txt натомість використовується на вимогу, коли агенту потрібні відомості з теми під час допомоги користувачу.» llmstxt.org
Практично це означає ось що:
Хочете заборонити AI використовувати ваш контент
Це задача robots.txt. Потрібні правила для конкретних токенів: GPTBot, ClaudeBot, CCBot, Google-Extended, Applebot-Extended та інших. У llms.txt немає жодної директиви заборони.
Хочете, щоб агент швидше зрозумів ваш сайт
Це задача llms.txt. Він не змінює прав доступу — лише скорочує агенту шлях до потрібної сторінки, якщо доступ уже відкритий.
Вони працюють разом
Типова коректна конфігурація виглядає так:
# robots.txt
# Тренування моделей — забороняємо
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
# Пошук із цитуванням — дозволяємо, звідси йдуть переходи
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Загальні правила
User-agent: *
Disallow: /wp-admin/
Disallow: /cart/
Sitemap: https://example.com/sitemap.xml
А llms.txt тим часом описує, що є цінного в дозволеній частині сайту.
Один файл окреслює межі, другий — розставляє покажчики всередині них.
llms.txt і sitemap.xml
Специфікація перелічує три причини, чому sitemap не є замінником:
- У ньому зазвичай немає LLM-читабельних версій сторінок — тільки HTML-адреси.
- Він не містить посилань на зовнішні сайти, навіть коли вони потрібні для розуміння контексту. Формат sitemaps.org це прямо забороняє.
- Він охоплює документи, які в сумі не вміщаються в контекстне вікно, і містить багато зайвого для розуміння сайту.
| Сценарій | sitemap.xml | llms.txt |
|---|---|---|
| Інтернет-магазин на 40 000 товарів | Усі 40 000 URL | Категорії, умови доставки, гарантія, контакти — 15 посилань |
| Документація бібліотеки | Усі сторінки довідника | Швидкий старт, довідник API, приклади — у .md |
| Блог на 800 статей | Усі 800 статей | Опорні матеріали та рубрикатор |
Чек-лист: який файл вам потрібен
Треба, щоб сайт індексувався в Google
sitemap.xml + robots.txt. llms.txt тут ні до чого.
Треба заборонити навчання моделей на вашому контенті
Тільки robots.txt із правилами для конкретних AI-токенів.
Треба, щоб ChatGPT або Perplexity цитували ваш сайт
Насамперед не блокуйте OAI-SearchBot, PerplexityBot і Claude-SearchBot у robots.txt. llms.txt може допомогти агенту зорієнтуватися, але гарантій не дає.
Треба, щоб кодовий агент правильно працював із вашим API
Ось тут llms.txt дає найбільше — разом із .md-версіями сторінок документації.
Треба підняти позиції в Google
llms.txt не впливає ніяк — це прямо написано в документації Google.