Довідник · перевірено 12 серпня 2026
Довідник AI-краулерів
Токени User-agent, які використовують у robots.txt. Для кожного вказано власника,
призначення та посилання на офіційну документацію. Токени, для яких ми не знайшли первинного
джерела, позначені окремо — ми не видаємо їх за підтверджені.
Ці три особливості враховані в нашому тестері robots.txt.
OpenAI
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
GPTBot
|
Краулер | Збір даних для тренування генеративних моделей OpenAI. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot |
дотримується |
документація
IP-діапазони |
OAI-SearchBot
|
Пошук і відповіді | Індексація сайтів для показу у результатах пошуку ChatGPT. Не використовується для тренування. Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot |
дотримується |
документація
IP-діапазони |
ChatGPT-User
|
Запит користувача | Завантаження сторінки у відповідь на дію користувача в ChatGPT або Custom GPT. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot |
дотримується |
документація
IP-діапазони |
OAI-AdsBot
|
Краулер | Перевірка безпеки сторінок, поданих як реклама в ChatGPT. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-AdsBot/1.0; +https://openai.com/adsbot |
дотримується |
документація
IP-діапазони |
Anthropic
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
ClaudeBot
|
Краулер | Збір публічних даних для розробки моделей Claude. | дотримується |
документація
IP-діапазони |
Claude-User
|
Запит користувача | Завантаження сторінки на запит користувача Claude. | дотримується |
документація
IP-діапазони |
Claude-SearchBot
|
Пошук і відповіді | Обхід вебу для покращення якості пошукових результатів у Claude. | дотримується |
документація
IP-діапазони |
anthropic-ai
застарілий |
Краулер | Застарілий токен. Відсутній у поточній документації Anthropic, але досі трапляється у старих robots.txt. | дотримується | не підтверджено |
Claude-Web
застарілий |
Краулер | Застарілий токен. Відсутній у поточній документації Anthropic. | дотримується | не підтверджено |
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
Googlebot
|
Краулер | Основний краулер Google Пошуку. Заборона Googlebot виключає сайт із органічної видачі. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Googlebot/2.1; +http://www.google.com/bot.html) Chrome/W.X.Y.Z Safari/537.36 |
дотримується | документація |
Google-Extended
|
Токен-перемикач | Токен-перемикач: керує тим, чи можна використовувати контент сайту для тренування майбутніх поколінь моделей Gemini. Власного рядка user-agent не має — обхід виконують звичайні краулери Google. | дотримується | документація |
GoogleOther
|
Краулер | Загальний краулер для внутрішніх дослідницьких і продуктових задач Google. Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) [Chrome/W.X.Y.Z] Mobile Safari/537.36 (compatible; GoogleOther) |
дотримується | документація |
Google-CloudVertexBot
|
Краулер | Обхід на замовлення власників сайтів для побудови агентів Vertex AI. | дотримується | документація |
Google-Agent
|
Запит користувача | Агенти Google, які виконують дії у вебі на запит користувача. Додано в документацію 20 березня 2026 року. Належить до категорії фетчерів на запит користувача, які не перевіряють robots.txt. | ігнорує | документація |
Google-GeminiNotebook
|
Запит користувача | Завантаження джерел для NotebookLM на запит користувача. Із 16 липня 2026 року замінив токен Google-NotebookLM, який лишається підтриманим для зворотної сумісності. | ігнорує | документація |
Google-NotebookLM
застарілий |
Запит користувача | Попередня назва токена Google-GeminiNotebook. Досі підтримується. | ігнорує | документація |
Google-InspectionTool
|
Краулер | Інструменти перевірки в Search Console. Також відповідає групі Googlebot. Mozilla/5.0 (compatible; Google-InspectionTool/1.0) |
дотримується | документація |
AdsBot-Google
|
Краулер | Перевірка якості цільових сторінок Google Ads. Ігнорує групу User-agent: * — потрібне окреме правило. AdsBot-Google (+http://www.google.com/adsbot.html) |
ігнорує «*» | документація |
Mediapartners-Google
|
Краулер | Google AdSense. Ігнорує групу User-agent: *. | ігнорує «*» | документація |
Google-Safety
|
Краулер | Пошук зловмисного контенту. Повністю ігнорує robots.txt. | ігнорує | документація |
Perplexity
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
PerplexityBot
|
Пошук і відповіді | Індексація сайтів для показу з посиланнями у відповідях Perplexity. За заявою компанії, не використовується для тренування базових моделей. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot) |
дотримується |
документація
IP-діапазони |
Perplexity-User
|
Запит користувача | Завантаження сторінки на запит користувача Perplexity. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user) |
дотримується |
документація
IP-діапазони |
Common Crawl
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
CCBot
|
Краулер | Некомерційний архів вебу. Його дампи історично використовували для тренування великої частини мовних моделей. CCBot/2.0 (https://commoncrawl.org/faq/) |
дотримується | документація |
Meta
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
meta-externalagent
|
Краулер | Обхід вебу для тренування базових моделей та індексації контенту. | дотримується | документація |
meta-webindexer
|
Пошук і відповіді | Покращення якості пошукових результатів Meta AI. meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler) |
дотримується | документація |
meta-externalfetcher
|
Запит користувача | Завантаження окремих посилань на запит користувача. | дотримується | документація |
meta-externalads
|
Краулер | Обхід для рекламних і бізнес-продуктів Meta. | дотримується | документація |
facebookexternalhit
|
Краулер | Формування прев’ю посилань, якими діляться у застосунках Meta. facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php) |
дотримується | документація |
Apple
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
Applebot
|
Краулер | Обхід для Spotlight, Siri та Safari. | дотримується | документація |
Applebot-Extended
|
Токен-перемикач | Токен-перемикач: керує використанням уже зібраних даних у генеративних функціях Apple Intelligence. Власного user-agent не має. Заборона не виключає сайт із пошуку Apple. | дотримується | документація |
Amazon
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
Amazonbot
|
Краулер | Покращення продуктів Amazon; може використовуватись для тренування AI-моделей Amazon. Не підтримує crawl-delay. Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amazonbot/0.1) Chrome/W.X.Y.Z Safari/537.36 |
дотримується | документація |
bedrockbot
|
Краулер | Токен, повʼязаний із Amazon Bedrock. Офіційного опису на сторінці Amazonbot немає. | дотримується | не підтверджено |
DuckDuckGo
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
DuckAssistBot
|
Запит користувача | Завантаження сторінок у реальному часі для відповідей DuckAssist із цитуванням джерел. За заявою DuckDuckGo, дані не використовуються для тренування моделей. Зміни в robots.txt застосовуються протягом 72 годин. DuckAssistBot/1.2; (+http://duckduckgo.com/duckassistbot.html) |
дотримується | документація |
Hive / ImageSift
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
ImagesiftBot
|
Краулер | Збір публічно доступних зображень. Особливість: якщо в robots.txt немає власного правила, бот застосовує правила для Googlebot. Mozilla/5.0 (compatible; ImagesiftBot; +imagesift.com) |
дотримується | документація |
Microsoft
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
bingbot
|
Краулер | Основний краулер Bing. Документація Bing Webmaster Tools відкривається лише з увімкненим JavaScript, тому дослівне формулювання ми не цитуємо. | дотримується | не підтверджено |
ByteDance
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
Bytespider
|
Краулер | Краулер ByteDance. Офіційної сторінки з описом ми не знайшли. | дотримується | не підтверджено |
Mistral AI
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
MistralAI-User
|
Запит користувача | Фетчер на запит користувача. У документації Mistral сторінки про краулерів немає. | дотримується | не підтверджено |
Cohere
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
cohere-ai
|
Краулер | Токен зустрічається в robots.txt багатьох сайтів; офіційного опису від Cohere ми не знайшли. | дотримується | не підтверджено |
You.com
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
YouBot
|
Пошук і відповіді | Краулер You.com. Офіційна сторінка about.you.com/youbot повертає 404. | дотримується | не підтверджено |
Huawei / Petal Search
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
PetalBot
|
Краулер | Краулер пошуку Petal. Офіційна сторінка була недоступна на момент перевірки. | дотримується | не підтверджено |
DeepSeek
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
DeepSeekBot
|
Краулер | Токен фігурує у звітах про трафік ботів; офіційного опису ми не знайшли. | дотримується | не підтверджено |
Diffbot
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
Diffbot
|
Краулер | Комерційний вилучувач структурованих даних зі сторінок. | дотримується | не підтверджено |
Webz.io
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
Omgilibot
|
Краулер | Збір даних для продажу датасетів, у тому числі для навчання моделей. | дотримується | не підтверджено |
Timpi
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
Timpibot
|
Краулер | Краулер децентралізованого пошукового індексу Timpi. | дотримується | не підтверджено |
Ahrefs
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
AhrefsBot
|
SEO / аналітика | Краулер SEO-сервісу Ahrefs. Не має стосунку до AI-систем. | дотримується | не підтверджено |
Semrush
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
SemrushBot
|
SEO / аналітика | Краулер SEO-сервісу Semrush. | дотримується | не підтверджено |
Screaming Frog
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
Screaming Frog SEO Spider
|
SEO / аналітика | Десктопний SEO-краулер для технічного аудиту. | дотримується | не підтверджено |
Yandex
| User-agent | Тип | Призначення | robots.txt | Джерело |
|---|---|---|---|---|
YandexBot
|
Краулер | Основний краулер пошуку Yandex. | дотримується | не підтверджено |
Як заборонити AI-ботам доступ
Ще раз, бо це найпоширеніша плутанина: llms.txt нічого не блокує. Єдиний
робочий інструмент — robots.txt, і працює він лише для ботів, які його дотримуються.
# Заборонити збір даних для тренування моделей
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Bytespider
Disallow: /
# Токени-перемикачі: не блокують обхід, лише використання даних
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
# Пошук і відповіді з цитуванням лишаємо відкритими,
# бо саме звідси приходять переходи на сайт
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /Обмеження цього довідника
- Для токенів Bing ми не наводимо дослівних формулювань: сторінка документації Bing Webmaster Tools рендериться лише з увімкненим JavaScript, і серверна відповідь не містить даних про краулерів.
- Токени
anthropic-aiтаClaude-Webвідсутні в поточній документації Anthropic. Ми лишили їх у переліку, бо вони досі трапляються у старихrobots.txt, але позначили як застарілі. FacebookBotприбрано: у поточній документації Meta його немає, натомість зʼявилисяmeta-webindexerтаmeta-externalads.- Перелік не претендує на вичерпність. Нових токенів зʼявляється кілька на квартал.