Інструмент · правила RFC 9309
Тестер robots.txt для AI-ботів
llms.txt нічого не блокує — доступом ботів керує robots.txt. Цей тестер показує,
чи справді обраний AI-краулер може отримати вказану адресу, яке саме правило спрацювало і в якому рядку
воно стоїть.
Як це працює
Реалізовані правила
Тестер відтворює механіку Robots Exclusion Protocol так, як її описує RFC 9309 і документує Google. Нижче — правила, які реально впливають на результат.
Вибір групи
- Збіг токена бота з
User-agentперевіряється без урахування регістру. - Якщо збіглося кілька груп, їхні правила обʼєднуються в одну — це вимога RFC, а не «перша виграє».
- Якщо конкретної групи немає, застосовується група
User-agent: *. - Якщо немає ні того, ні іншого — обмежень немає, доступ відкритий.
Вибір правила
- Виграє найдовше правило, довжина вимірюється в октетах шляху.
- За однакової довжини виграє
Allow. - Підтримуються підстановки:
*— нуль або більше символів,$— кінець адреси. - Кінцевий
*ігнорується при вимірюванні довжини, як це робить Google:Disallow: /foo*за специфічністю дорівнюєDisallow: /foo. - Порожній
Disallow:не забороняє нічого.
Особливості конкретних ботів
Це те, чого немає в більшості тестерів. Ми враховуємо три категорії винятків:
| Категорія | Боти | Поведінка |
|---|---|---|
Ігнорують групу * |
AdsBot-Google, AdsBot-Google-Mobile, Mediapartners-Google, APIs-Google |
Виконують лише правила, адресовані їм особисто |
| Ігнорують robots.txt повністю | Google-Safety, Google-Agent, фетчери NotebookLM |
Тестер це прямо повідомляє замість того, щоб показати «дозволено» |
| Відкочуються до іншого агента | Googlebot-Image, Google-InspectionTool, ImagesiftBot та інші |
За відсутності власної групи застосовують правила Googlebot |
| Токени-перемикачі | Google-Extended, Applebot-Extended |
Не мають власного user-agent. Заборона стосується лише використання даних, не обходу |
Обмеження
- Розбір обмежений 512 КБ — це мінімальний обовʼязковий обсяг за RFC 9309.
- Директиви
Crawl-delay,Host,Clean-paramне входять до стандарту; тестер повідомляє про них, але не враховує. - Перевірка не гарантує поведінки бота: дотримання
robots.txtдобровільне. Недобросовісні краулери його просто ігнорують.
Джерела правил: RFC 9309 — Robots Exclusion Protocol, Google: robots.txt specification.