Что такое ИИ-краулеры

ИИ-краулеры — роботы компаний, которые делают языковые модели и ИИ-ассистентов. Технически они делают то же, что и поисковые боты при краулинге, — скачивают страницы. Разница в том, что происходит с контентом дальше: он может уйти в обучающий датасет, в индекс ИИ-поиска или сразу в ответ человеку, который задал вопрос. Поэтому одного правила «пускать или не пускать ИИ» мало — решение принимают по каждому типу отдельно.

Три типа ИИ-ботов

Назначение OpenAI Anthropic Perplexity Google
Обучение моделей GPTBot ClaudeBot не заявлен Google-Extended (токен в robots.txt)
Индекс ИИ-поиска OAI-SearchBot Claude-SearchBot PerplexityBot —
Запрос пользователя ChatGPT-User Claude-User Perplexity-User Google-Agent

Имена даны по документации компаний на сентябрь 2026 года. Google-Extended отличается от остальных: это токен, а не отдельный бот. Обход ведут обычные роботы Google, а токен решает, можно ли использовать контент для обучения Gemini и для grounding. Пользовательских фетчеров точнее относить к агентному трафику: их приводит конкретный запрос человека.

Сколько берут и сколько возвращают

Cloudflare сравнивает, сколько раз бот компании обращается к сайтам и сколько переходов её продукт приводит обратно. По данным за июль 2025 года соотношение было таким:

Компания Запросов краулера на один переход
Anthropic 38 065
OpenAI 1 091
Perplexity 194
Google 5,4

За 12 месяцев до июля 2025 года 80% обхода ИИ-ботов приходилось на обучение, 18% — на поиск и 2% — на действия по запросу пользователей.

Пример robots.txt для магазина

Вариант для магазина, которому нужны ссылки в ИИ-ответах (GEO), но не нужно отдавать контент на обучение моделей: закрыть обучение, открыть ИИ-поиск.

# Обучение моделей — закрыто
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Disallow: /

# ИИ-поиск — открыт, кроме служебных разделов
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Disallow: /cart/
Disallow: /checkout/
Allow: /

# Ответы YandexGPT и Поиска с Алисой — отдельное решение
User-agent: YandexAdditional
Allow: /

Важно: закрывая Google-Extended, вы отказываетесь и от grounding в Gemini, а не только от обучения. Решение стоит принимать осознанно.

Чек-лист

  • Найдите ИИ-ботов в логах сервера и сверьте их IP с опубликованными списками компаний: имя в User-Agent подделать легко, а подписи Web Bot Auth пока есть не у всех.
  • Решайте по типам: обучение, поиск и пользовательские запросы — разные вопросы для бизнеса.
  • Помните, что пользовательские фетчеры могут не соблюдать robots.txt: если их нужно ограничить, это делается на уровне CDN или WAF.
  • После правок robots.txt перепроверьте его синтаксис и дайте ботам время: OpenAI называет срок около 24 часов.