Довідник · перевірено 12 серпня 2026

Довідник AI-краулерів

Токени User-agent, які використовують у robots.txt. Для кожного вказано власника, призначення та посилання на офіційну документацію. Токени, для яких ми не знайшли первинного джерела, позначені окремо — ми не видаємо їх за підтверджені.

Ці три особливості враховані в нашому тестері robots.txt.

OpenAI

User-agent Тип Призначення robots.txt Джерело
GPTBot Краулер Збір даних для тренування генеративних моделей OpenAI.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot
дотримується документація
IP-діапазони
OAI-SearchBot Пошук і відповіді Індексація сайтів для показу у результатах пошуку ChatGPT. Не використовується для тренування.
Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/131.0.0.0 Safari/537.36; compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot
дотримується документація
IP-діапазони
ChatGPT-User Запит користувача Завантаження сторінки у відповідь на дію користувача в ChatGPT або Custom GPT.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot
дотримується документація
IP-діапазони
OAI-AdsBot Краулер Перевірка безпеки сторінок, поданих як реклама в ChatGPT.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; OAI-AdsBot/1.0; +https://openai.com/adsbot
дотримується документація
IP-діапазони

Anthropic

User-agent Тип Призначення robots.txt Джерело
ClaudeBot Краулер Збір публічних даних для розробки моделей Claude. дотримується документація
IP-діапазони
Claude-User Запит користувача Завантаження сторінки на запит користувача Claude. дотримується документація
IP-діапазони
Claude-SearchBot Пошук і відповіді Обхід вебу для покращення якості пошукових результатів у Claude. дотримується документація
IP-діапазони
anthropic-ai
застарілий
Краулер Застарілий токен. Відсутній у поточній документації Anthropic, але досі трапляється у старих robots.txt. дотримується не підтверджено
Claude-Web
застарілий
Краулер Застарілий токен. Відсутній у поточній документації Anthropic. дотримується не підтверджено

Google

User-agent Тип Призначення robots.txt Джерело
Googlebot Краулер Основний краулер Google Пошуку. Заборона Googlebot виключає сайт із органічної видачі.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Googlebot/2.1; +http://www.google.com/bot.html) Chrome/W.X.Y.Z Safari/537.36
дотримується документація
Google-Extended Токен-перемикач Токен-перемикач: керує тим, чи можна використовувати контент сайту для тренування майбутніх поколінь моделей Gemini. Власного рядка user-agent не має — обхід виконують звичайні краулери Google. дотримується документація
GoogleOther Краулер Загальний краулер для внутрішніх дослідницьких і продуктових задач Google.
Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) [Chrome/W.X.Y.Z] Mobile Safari/537.36 (compatible; GoogleOther)
дотримується документація
Google-CloudVertexBot Краулер Обхід на замовлення власників сайтів для побудови агентів Vertex AI. дотримується документація
Google-Agent Запит користувача Агенти Google, які виконують дії у вебі на запит користувача. Додано в документацію 20 березня 2026 року. Належить до категорії фетчерів на запит користувача, які не перевіряють robots.txt. ігнорує документація
Google-GeminiNotebook Запит користувача Завантаження джерел для NotebookLM на запит користувача. Із 16 липня 2026 року замінив токен Google-NotebookLM, який лишається підтриманим для зворотної сумісності. ігнорує документація
Google-NotebookLM
застарілий
Запит користувача Попередня назва токена Google-GeminiNotebook. Досі підтримується. ігнорує документація
Google-InspectionTool Краулер Інструменти перевірки в Search Console. Також відповідає групі Googlebot.
Mozilla/5.0 (compatible; Google-InspectionTool/1.0)
дотримується документація
AdsBot-Google Краулер Перевірка якості цільових сторінок Google Ads. Ігнорує групу User-agent: * — потрібне окреме правило.
AdsBot-Google (+http://www.google.com/adsbot.html)
ігнорує «*» документація
Mediapartners-Google Краулер Google AdSense. Ігнорує групу User-agent: *. ігнорує «*» документація
Google-Safety Краулер Пошук зловмисного контенту. Повністю ігнорує robots.txt. ігнорує документація

Perplexity

User-agent Тип Призначення robots.txt Джерело
PerplexityBot Пошук і відповіді Індексація сайтів для показу з посиланнями у відповідях Perplexity. За заявою компанії, не використовується для тренування базових моделей.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)
дотримується документація
IP-діапазони
Perplexity-User Запит користувача Завантаження сторінки на запит користувача Perplexity.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user)
дотримується документація
IP-діапазони

Common Crawl

User-agent Тип Призначення robots.txt Джерело
CCBot Краулер Некомерційний архів вебу. Його дампи історично використовували для тренування великої частини мовних моделей.
CCBot/2.0 (https://commoncrawl.org/faq/)
дотримується документація

Meta

User-agent Тип Призначення robots.txt Джерело
meta-externalagent Краулер Обхід вебу для тренування базових моделей та індексації контенту. дотримується документація
meta-webindexer Пошук і відповіді Покращення якості пошукових результатів Meta AI.
meta-webindexer/1.1 (+https://developers.facebook.com/docs/sharing/webmasters/crawler)
дотримується документація
meta-externalfetcher Запит користувача Завантаження окремих посилань на запит користувача. дотримується документація
meta-externalads Краулер Обхід для рекламних і бізнес-продуктів Meta. дотримується документація
facebookexternalhit Краулер Формування прев’ю посилань, якими діляться у застосунках Meta.
facebookexternalhit/1.1 (+http://www.facebook.com/externalhit_uatext.php)
дотримується документація

Apple

User-agent Тип Призначення robots.txt Джерело
Applebot Краулер Обхід для Spotlight, Siri та Safari. дотримується документація
Applebot-Extended Токен-перемикач Токен-перемикач: керує використанням уже зібраних даних у генеративних функціях Apple Intelligence. Власного user-agent не має. Заборона не виключає сайт із пошуку Apple. дотримується документація

Amazon

User-agent Тип Призначення robots.txt Джерело
Amazonbot Краулер Покращення продуктів Amazon; може використовуватись для тренування AI-моделей Amazon. Не підтримує crawl-delay.
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Amazonbot/0.1) Chrome/W.X.Y.Z Safari/537.36
дотримується документація
bedrockbot Краулер Токен, повʼязаний із Amazon Bedrock. Офіційного опису на сторінці Amazonbot немає. дотримується не підтверджено

DuckDuckGo

User-agent Тип Призначення robots.txt Джерело
DuckAssistBot Запит користувача Завантаження сторінок у реальному часі для відповідей DuckAssist із цитуванням джерел. За заявою DuckDuckGo, дані не використовуються для тренування моделей. Зміни в robots.txt застосовуються протягом 72 годин.
DuckAssistBot/1.2; (+http://duckduckgo.com/duckassistbot.html)
дотримується документація

Hive / ImageSift

User-agent Тип Призначення robots.txt Джерело
ImagesiftBot Краулер Збір публічно доступних зображень. Особливість: якщо в robots.txt немає власного правила, бот застосовує правила для Googlebot.
Mozilla/5.0 (compatible; ImagesiftBot; +imagesift.com)
дотримується документація

Microsoft

User-agent Тип Призначення robots.txt Джерело
bingbot Краулер Основний краулер Bing. Документація Bing Webmaster Tools відкривається лише з увімкненим JavaScript, тому дослівне формулювання ми не цитуємо. дотримується не підтверджено

ByteDance

User-agent Тип Призначення robots.txt Джерело
Bytespider Краулер Краулер ByteDance. Офіційної сторінки з описом ми не знайшли. дотримується не підтверджено

Mistral AI

User-agent Тип Призначення robots.txt Джерело
MistralAI-User Запит користувача Фетчер на запит користувача. У документації Mistral сторінки про краулерів немає. дотримується не підтверджено

Cohere

User-agent Тип Призначення robots.txt Джерело
cohere-ai Краулер Токен зустрічається в robots.txt багатьох сайтів; офіційного опису від Cohere ми не знайшли. дотримується не підтверджено

You.com

User-agent Тип Призначення robots.txt Джерело
YouBot Пошук і відповіді Краулер You.com. Офіційна сторінка about.you.com/youbot повертає 404. дотримується не підтверджено
User-agent Тип Призначення robots.txt Джерело
PetalBot Краулер Краулер пошуку Petal. Офіційна сторінка була недоступна на момент перевірки. дотримується не підтверджено

DeepSeek

User-agent Тип Призначення robots.txt Джерело
DeepSeekBot Краулер Токен фігурує у звітах про трафік ботів; офіційного опису ми не знайшли. дотримується не підтверджено

Diffbot

User-agent Тип Призначення robots.txt Джерело
Diffbot Краулер Комерційний вилучувач структурованих даних зі сторінок. дотримується не підтверджено

Webz.io

User-agent Тип Призначення robots.txt Джерело
Omgilibot Краулер Збір даних для продажу датасетів, у тому числі для навчання моделей. дотримується не підтверджено

Timpi

User-agent Тип Призначення robots.txt Джерело
Timpibot Краулер Краулер децентралізованого пошукового індексу Timpi. дотримується не підтверджено

Ahrefs

User-agent Тип Призначення robots.txt Джерело
AhrefsBot SEO / аналітика Краулер SEO-сервісу Ahrefs. Не має стосунку до AI-систем. дотримується не підтверджено

Semrush

User-agent Тип Призначення robots.txt Джерело
SemrushBot SEO / аналітика Краулер SEO-сервісу Semrush. дотримується не підтверджено

Screaming Frog

User-agent Тип Призначення robots.txt Джерело
Screaming Frog SEO Spider SEO / аналітика Десктопний SEO-краулер для технічного аудиту. дотримується не підтверджено

Yandex

User-agent Тип Призначення robots.txt Джерело
YandexBot Краулер Основний краулер пошуку Yandex. дотримується не підтверджено

Як заборонити AI-ботам доступ

Ще раз, бо це найпоширеніша плутанина: llms.txt нічого не блокує. Єдиний робочий інструмент — robots.txt, і працює він лише для ботів, які його дотримуються.

Приклад: закрити тренування, лишити пошук
# Заборонити збір даних для тренування моделей
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: meta-externalagent
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Bytespider
Disallow: /

# Токени-перемикачі: не блокують обхід, лише використання даних
User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# Пошук і відповіді з цитуванням лишаємо відкритими,
# бо саме звідси приходять переходи на сайт
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

Перевірити свій robots.txt

Обмеження цього довідника

  • Для токенів Bing ми не наводимо дослівних формулювань: сторінка документації Bing Webmaster Tools рендериться лише з увімкненим JavaScript, і серверна відповідь не містить даних про краулерів.
  • Токени anthropic-ai та Claude-Web відсутні в поточній документації Anthropic. Ми лишили їх у переліку, бо вони досі трапляються у старих robots.txt, але позначили як застарілі.
  • FacebookBot прибрано: у поточній документації Meta його немає, натомість зʼявилися meta-webindexer та meta-externalads.
  • Перелік не претендує на вичерпність. Нових токенів зʼявляється кілька на квартал.