# Тестер robots.txt для AI-ботів

> Перевірте, чи дозволений доступ GPTBot, ClaudeBot, Google-Extended, PerplexityBot та іншим AI-краулерам до вашого URL. Реалізація правил RFC 9309.

Джерело: https://llms.com.ua/robots-tester/ · оновлено 2026-08-12 · llms.com.ua

---

`llms.txt` нічого не блокує — доступом ботів керує `robots.txt`. Цей тестер показує,
чи справді обраний AI-краулер може отримати вказану адресу, яке саме правило спрацювало і в якому рядку
воно стоїть.

Сайт

Бот (user-agent)

Будь-який бот (група User-agent: *)

GPTBot — OpenAI

OAI-AdsBot — OpenAI

ClaudeBot — Anthropic

GoogleOther — Google

CCBot — Common Crawl

meta-externalagent — Meta

meta-externalads — Meta

facebookexternalhit — Meta

Applebot — Apple

Amazonbot — Amazon

ImagesiftBot — Hive / ImageSift

Bytespider — ByteDance

cohere-ai — Cohere

PetalBot — Huawei / Petal Search

DeepSeekBot — DeepSeek

Diffbot — Diffbot

Omgilibot — Webz.io

Timpibot — Timpi

bedrockbot — Amazon

OAI-SearchBot — OpenAI

Claude-SearchBot — Anthropic

PerplexityBot — Perplexity

meta-webindexer — Meta

YouBot — You.com

ChatGPT-User — OpenAI

Claude-User — Anthropic

Google-Agent — Google

Google-GeminiNotebook — Google

Perplexity-User — Perplexity

meta-externalfetcher — Meta

DuckAssistBot — DuckDuckGo

MistralAI-User — Mistral AI

Google-Extended — Google

Applebot-Extended — Apple

Googlebot — Google

Google-CloudVertexBot — Google

Google-InspectionTool — Google

AdsBot-Google — Google

Mediapartners-Google — Google

Google-Safety — Google

bingbot — Microsoft

AhrefsBot — Ahrefs

SemrushBot — Semrush

Screaming Frog SEO Spider — Screaming Frog

YandexBot — Yandex

Перелік складено за офіційною документацією власників. Повний довідник із поясненнями —
[на окремій сторінці](https://llms.com.ua/crawlers/).

Вміст robots.txt

0 рядків

Можна редагувати вміст — це не змінює ваш сайт

Адреси для перевірки — по одній на рядок
/
/llms.txt
/blog/
/wp-admin/

## Реалізовані правила

Тестер відтворює механіку Robots Exclusion Protocol так, як її описує RFC 9309 і документує Google.
Нижче — правила, які реально впливають на результат.

### Вибір групи
- Збіг токена бота з `User-agent` перевіряється **без урахування регістру**.
- Якщо збіглося кілька груп, їхні правила **обʼєднуються в одну** — це вимога RFC, а не «перша виграє».
- Якщо конкретної групи немає, застосовується група `User-agent: *`.
- Якщо немає ні того, ні іншого — обмежень немає, доступ відкритий.

### Вибір правила
- Виграє **найдовше** правило, довжина вимірюється в октетах шляху.
- За однакової довжини **виграє `Allow`**.
- Підтримуються підстановки: `*` — нуль або більше символів, `$` — кінець адреси.
- Кінцевий `*` ігнорується при вимірюванні довжини, як це робить Google: `Disallow: /foo*` за специфічністю дорівнює `Disallow: /foo`.
- Порожній `Disallow:` не забороняє нічого.

### Особливості конкретних ботів

Це те, чого немає в більшості тестерів. Ми враховуємо три категорії винятків:

| Категорія | Боти | Поведінка |
| --- | --- | --- |
| Ігнорують групу * | AdsBot-Google, AdsBot-Google-Mobile, Mediapartners-Google, APIs-Google | Виконують лише правила, адресовані їм особисто |
| Ігнорують robots.txt повністю | Google-Safety, Google-Agent, фетчери NotebookLM | Тестер це прямо повідомляє замість того, щоб показати «дозволено» |
| Відкочуються до іншого агента | Googlebot-Image, Google-InspectionTool, ImagesiftBot та інші | За відсутності власної групи застосовують правила Googlebot |
| Токени-перемикачі | Google-Extended, Applebot-Extended | Не мають власного user-agent. Заборона стосується лише використання даних, не обходу |

**Коди відповіді сервера трактуються по-різному**Якщо `robots.txt` віддає **4xx**, і RFC 9309, і Google вважають, що обмежень немає. Якщо **5xx** — RFC вимагає вважати сайт повністю закритим, а Google натомість 12 годин не сканує сайт, потім до 30 днів користується кешованою версією. Ми показуємо код відповіді при завантаженні файлу й пояснюємо наслідки.

### Обмеження
- Розбір обмежений 512 КБ — це мінімальний обовʼязковий обсяг за RFC 9309.
- Директиви `Crawl-delay`, `Host`, `Clean-param` не входять до стандарту; тестер повідомляє про них, але не враховує.
- Перевірка не гарантує поведінки бота: дотримання `robots.txt` добровільне. Недобросовісні краулери його просто ігнорують.

Джерела правил: [RFC 9309 — Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html),
[Google: robots.txt specification](https://developers.google.com/search/docs/crawling-indexing/robots/robots_txt).

[ДовідникПовний перелік AI-краулерів](https://llms.com.ua/crawlers/)
[ІнструментВалідатор llms.txt](https://llms.com.ua/checker/)
[FAQЧи блокує llms.txt AI-ботів](https://llms.com.ua/faq/chy-blokuye-ai-botiv/)
