# Довідник AI-краулерів

> Повний перелік user-agent AI-ботів із посиланнями на офіційну документацію власників: GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot та інші.

Джерело: https://llms.com.ua/crawlers/ · оновлено 2026-08-12 · llms.com.ua

---

Токени `User-agent`, які використовують у `robots.txt`. Для кожного вказано власника,
призначення та посилання на офіційну документацію. Токени, для яких ми **не знайшли** первинного
джерела, позначені окремо — ми не видаємо їх за підтверджені.

**Три речі, які ламають більшість тестерів robots.txt**
- **Токени-перемикачі.** `Google-Extended` і `Applebot-Extended` не мають власного рядка user-agent. Заборонити їх — не те саме, що заборонити обхід: ви лише забороняєте використання вже зібраних даних для навчання. Із пошуку сайт не зникає.
- **Ігнорування групи «*».** `AdsBot-Google`, `Mediapartners-Google` та `APIs-Google` не виконують правил із загальної групи. Тестер, який каже «заблоковано через `User-agent: *`», у цьому випадку помиляється.
- **Відкат до іншого агента.** `Googlebot-Image`, `Google-InspectionTool` та інші відповідають також групі `Googlebot`. `ImagesiftBot`, за документацією власника, за відсутності власних правил застосовує правила `Googlebot`.

Ці три особливості враховані в нашому [тестері robots.txt](https://llms.com.ua/robots-tester/).

## OpenAI

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| GPTBot | Краулер | Збір даних для тренування генеративних моделей OpenAI. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot | дотримується | документація IP-діапазони |
| OAI-SearchBot | Пошук і відповіді | Індексація сайтів для показу у результатах пошуку ChatGPT. Не використовується для тренування. Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot | дотримується | документація IP-діапазони |
| ChatGPT-User | Запит користувача | Завантаження сторінки у відповідь на дію користувача в ChatGPT або Custom GPT. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot | дотримується | документація IP-діапазони |
| OAI-AdsBot | Краулер | Перевірка безпеки сторінок, поданих як реклама в ChatGPT. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-AdsBot/1.0; +https://openai.com/adsbot | дотримується | документація IP-діапазони |

## Anthropic

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| ClaudeBot | Краулер | Збір публічних даних для розробки моделей Claude. | дотримується | документація IP-діапазони |
| Claude-User | Запит користувача | Завантаження сторінки на запит користувача Claude. | дотримується | документація IP-діапазони |
| Claude-SearchBot | Пошук і відповіді | Обхід вебу для покращення якості пошукових результатів у Claude. | дотримується | документація IP-діапазони |
| anthropic-ai застарілий | Краулер | Застарілий токен. Відсутній у поточній документації Anthropic, але досі трапляється у старих robots.txt. | дотримується | не підтверджено |
| Claude-Web застарілий | Краулер | Застарілий токен. Відсутній у поточній документації Anthropic. | дотримується | не підтверджено |

## Google

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| Googlebot | Краулер | Основний краулер Google Пошуку. Заборона Googlebot виключає сайт із органічної видачі. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Googlebot/2.1; +http://www.google.com/bot.html) Chrome/W.X.Y.Z Safari/537.36 | дотримується | документація |
| Google-Extended | Токен-перемикач | Токен-перемикач: керує тим, чи можна використовувати контент сайту для тренування майбутніх поколінь моделей Gemini. Власного рядка user-agent не має — обхід виконують звичайні краулери Google. | дотримується | документація |
| GoogleOther | Краулер | Загальний краулер для внутрішніх дослідницьких і продуктових задач Google. Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) [Chrome/W.X.Y.Z] Mobile Safari/537.36 (compatible; GoogleOther) | дотримується | документація |
| Google-CloudVertexBot | Краулер | Обхід на замовлення власників сайтів для побудови агентів Vertex AI. | дотримується | документація |
| Google-Agent | Запит користувача | Агенти Google, які виконують дії у вебі на запит користувача. Додано в документацію 20 березня 2026 року. Належить до категорії фетчерів на запит користувача, які не перевіряють robots.txt. | ігнорує | документація |
| Google-GeminiNotebook | Запит користувача | Завантаження джерел для NotebookLM на запит користувача. Із 16 липня 2026 року замінив токен Google-NotebookLM, який лишається підтриманим для зворотної сумісності. | ігнорує | документація |
| Google-NotebookLM застарілий | Запит користувача | Попередня назва токена Google-GeminiNotebook. Досі підтримується. | ігнорує | документація |
| Google-InspectionTool | Краулер | Інструменти перевірки в Search Console. Також відповідає групі Googlebot. Mozilla/5.0 (compatible; Google-InspectionTool/1.0) | дотримується | документація |
| AdsBot-Google | Краулер | Перевірка якості цільових сторінок Google Ads. Ігнорує групу User-agent: * — потрібне окреме правило. AdsBot-Google (+http://www.google.com/adsbot.html) | ігнорує «*» | документація |
| Mediapartners-Google | Краулер | Google AdSense. Ігнорує групу User-agent: *. | ігнорує «*» | документація |
| Google-Safety | Краулер | Пошук зловмисного контенту. Повністю ігнорує robots.txt. | ігнорує | документація |

## Perplexity

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| PerplexityBot | Пошук і відповіді | Індексація сайтів для показу з посиланнями у відповідях Perplexity. За заявою компанії, не використовується для тренування базових моделей. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot) | дотримується | документація IP-діапазони |
| Perplexity-User | Запит користувача | Завантаження сторінки на запит користувача Perplexity. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user) | дотримується | документація IP-діапазони |

## Common Crawl

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| CCBot | Краулер | Некомерційний архів вебу. Його дампи історично використовували для тренування великої частини мовних моделей. CCBot/2.0 (https://commoncrawl.org/faq/) | дотримується | документація |

## Meta

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| meta-externalagent | Краулер | Обхід вебу для тренування базових моделей та індексації контенту. | дотримується | документація |
| meta-webindexer | Пошук і відповіді | Покращення якості пошукових результатів Meta AI. meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) | дотримується | документація |
| meta-externalfetcher | Запит користувача | Завантаження окремих посилань на запит користувача. | дотримується | документація |
| meta-externalads | Краулер | Обхід для рекламних і бізнес-продуктів Meta. | дотримується | документація |
| facebookexternalhit | Краулер | Формування прев’ю посилань, якими діляться у застосунках Meta. facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) | дотримується | документація |

## Apple

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| Applebot | Краулер | Обхід для Spotlight, Siri та Safari. | дотримується | документація |
| Applebot-Extended | Токен-перемикач | Токен-перемикач: керує використанням уже зібраних даних у генеративних функціях Apple Intelligence. Власного user-agent не має. Заборона не виключає сайт із пошуку Apple. | дотримується | документація |

## Amazon

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| Amazonbot | Краулер | Покращення продуктів Amazon; може використовуватись для тренування AI-моделей Amazon. Не підтримує crawl-delay. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amazonbot/0.1) Chrome/W.X.Y.Z Safari/537.36 | дотримується | документація |
| bedrockbot | Краулер | Токен, повʼязаний із Amazon Bedrock. Офіційного опису на сторінці Amazonbot немає. | дотримується | не підтверджено |

## DuckDuckGo

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| DuckAssistBot | Запит користувача | Завантаження сторінок у реальному часі для відповідей DuckAssist із цитуванням джерел. За заявою DuckDuckGo, дані не використовуються для тренування моделей. Зміни в robots.txt застосовуються протягом 72 годин. DuckAssistBot/1.2; (+http://duckduckgo.com/duckassistbot.html) | дотримується | документація |

## Hive / ImageSift

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| ImagesiftBot | Краулер | Збір публічно доступних зображень. Особливість: якщо в robots.txt немає власного правила, бот застосовує правила для Googlebot. Mozilla/5.0 (compatible; ImagesiftBot; +imagesift.com) | дотримується | документація |

## Microsoft

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| bingbot | Краулер | Основний краулер Bing. Документація Bing Webmaster Tools відкривається лише з увімкненим JavaScript, тому дослівне формулювання ми не цитуємо. | дотримується | не підтверджено |

## ByteDance

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| Bytespider | Краулер | Краулер ByteDance. Офіційної сторінки з описом ми не знайшли. | дотримується | не підтверджено |

## Mistral AI

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| MistralAI-User | Запит користувача | Фетчер на запит користувача. У документації Mistral сторінки про краулерів немає. | дотримується | не підтверджено |

## Cohere

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| cohere-ai | Краулер | Токен зустрічається в robots.txt багатьох сайтів; офіційного опису від Cohere ми не знайшли. | дотримується | не підтверджено |

## You.com

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| YouBot | Пошук і відповіді | Краулер You.com. Офіційна сторінка about.you.com/youbot повертає 404. | дотримується | не підтверджено |

## Huawei / Petal Search

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| PetalBot | Краулер | Краулер пошуку Petal. Офіційна сторінка була недоступна на момент перевірки. | дотримується | не підтверджено |

## DeepSeek

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| DeepSeekBot | Краулер | Токен фігурує у звітах про трафік ботів; офіційного опису ми не знайшли. | дотримується | не підтверджено |

## Diffbot

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| Diffbot | Краулер | Комерційний вилучувач структурованих даних зі сторінок. | дотримується | не підтверджено |

## Webz.io

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| Omgilibot | Краулер | Збір даних для продажу датасетів, у тому числі для навчання моделей. | дотримується | не підтверджено |

## Timpi

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| Timpibot | Краулер | Краулер децентралізованого пошукового індексу Timpi. | дотримується | не підтверджено |

## Ahrefs

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| AhrefsBot | SEO / аналітика | Краулер SEO-сервісу Ahrefs. Не має стосунку до AI-систем. | дотримується | не підтверджено |

## Semrush

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| SemrushBot | SEO / аналітика | Краулер SEO-сервісу Semrush. | дотримується | не підтверджено |

## Screaming Frog

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| Screaming Frog SEO Spider | SEO / аналітика | Десктопний SEO-краулер для технічного аудиту. | дотримується | не підтверджено |

## Yandex

| User-agent | Тип | Призначення | robots.txt | Джерело |
| --- | --- | --- | --- | --- |
| YandexBot | Краулер | Основний краулер пошуку Yandex. | дотримується | не підтверджено |

## Як заборонити AI-ботам доступ

Ще раз, бо це найпоширеніша плутанина: **`llms.txt` нічого не блокує**. Єдиний
робочий інструмент — `robots.txt`, і працює він лише для ботів, які його дотримуються.

_Приклад: закрити тренування, лишити пошук_

```
# Заборонити збір даних для тренування моделей
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: meta-externalagent
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Bytespider
Disallow: /

# Токени-перемикачі: не блокують обхід, лише використання даних
User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# Пошук і відповіді з цитуванням лишаємо відкритими,
# бо саме звідси приходять переходи на сайт
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /
```

**Подумайте, що саме ви блокуєте**Заборона `GPTBot` стосується тренування моделей. Заборона `OAI-SearchBot` — це вже виключення сайту з пошуку ChatGPT, тобто відмова від потенційних переходів. Це різні рішення з різними наслідками, і об’єднувати їх одним правилом «заборонити все AI» зазвичай не варто.

[Перевірити свій robots.txt](https://llms.com.ua/robots-tester/)

## Обмеження цього довідника
- Для токенів Bing ми **не** наводимо дослівних формулювань: сторінка документації Bing Webmaster Tools рендериться лише з увімкненим JavaScript, і серверна відповідь не містить даних про краулерів.
- Токени `anthropic-ai` та `Claude-Web` відсутні в поточній документації Anthropic. Ми лишили їх у переліку, бо вони досі трапляються у старих `robots.txt`, але позначили як застарілі.
- `FacebookBot` прибрано: у поточній документації Meta його немає, натомість зʼявилися `meta-webindexer` та `meta-externalads`.
- Перелік не претендує на вичерпність. Нових токенів зʼявляється кілька на квартал.

[ІнструментТестер robots.txt для AI-ботів](https://llms.com.ua/robots-tester/)
[ПоясненняРізниця між llms.txt і robots.txt](https://llms.com.ua/vs-robots-sitemap/)
