Чи блокує llms.txt AI-ботів?
Ні. У llms.txt немає жодної директиви заборони — у ньому фізично нічим щось блокувати. Щоб обмежити AI-ботів, потрібен robots.txt із правилами для конкретних user-agent (GPTBot, ClaudeBot, Google-Extended тощо).
Розгорнута відповідь
Ні, і це не питання інтерпретації. У форматі llms.txt фізично немає синтаксису,
яким можна було б щось заборонити. Файл складається з чотирьох типів елементів:
- заголовок H1 з назвою;
- блок-цитата з резюме;
- вільний текст без заголовків;
- секції H2 зі списками посилань.
Жодного аналога Disallow серед них не існує. Записати заборону нема чим.
Що робити, якщо мета — саме заборонити
Використовувати robots.txt із правилами для конкретних токенів. Приклад базової конфігурації:
# Тренування моделей
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Bytespider
Disallow: /
# Токени-перемикачі
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /Три речі, які варто знати перед блокуванням
-
Токени-перемикачі не блокують обхід.
Google-ExtendedіApplebot-Extendedне мають власного рядка user-agent. Заборона стосується лише використання вже зібраних даних для навчання; із пошуку Google чи Apple сайт при цьому не зникає. -
Тренування й пошук — різні речі. Заборона
GPTBotстосується навчання моделей. ЗаборонаOAI-SearchBot— це виключення сайту з пошуку ChatGPT, тобто відмова від переходів. Об’єднувати їх одним рішенням «заборонити все AI» зазвичай не варто. -
robots.txt виконується добровільно. Він працює для ботів, які його дотримуються.
Google прямо документує, що фетчери на запит користувача (
Google-Agent, фетчери NotebookLM) іGoogle-Safetyrobots.txt не перевіряють узагалі.
Повний перелік токенів із посиланнями на офіційну документацію власників — у довіднику AI-краулерів. Перевірити, що саме дозволяє ваш поточний файл, можна тестером: він враховує і токени-перемикачі, і винятки для груп.