Что такое ИИ-краулеры
ИИ-краулеры — роботы компаний, которые делают языковые модели и ИИ-ассистентов. Технически они делают то же, что и поисковые боты при краулинге, — скачивают страницы. Разница в том, что происходит с контентом дальше: он может уйти в обучающий датасет, в индекс ИИ-поиска или сразу в ответ человеку, который задал вопрос. Поэтому одного правила «пускать или не пускать ИИ» мало — решение принимают по каждому типу отдельно.
Три типа ИИ-ботов
| Назначение | OpenAI | Anthropic | Perplexity | |
|---|---|---|---|---|
| Обучение моделей | GPTBot | ClaudeBot | не заявлен | Google-Extended (токен в robots.txt) |
| Индекс ИИ-поиска | OAI-SearchBot | Claude-SearchBot | PerplexityBot | — |
| Запрос пользователя | ChatGPT-User | Claude-User | Perplexity-User | Google-Agent |
Имена даны по документации компаний на сентябрь 2026 года. Google-Extended отличается от остальных: это токен, а не отдельный бот. Обход ведут обычные роботы Google, а токен решает, можно ли использовать контент для обучения Gemini и для grounding. Пользовательских фетчеров точнее относить к агентному трафику: их приводит конкретный запрос человека.
Сколько берут и сколько возвращают
Cloudflare сравнивает, сколько раз бот компании обращается к сайтам и сколько переходов её продукт приводит обратно. По данным за июль 2025 года соотношение было таким:
| Компания | Запросов краулера на один переход |
|---|---|
| Anthropic | 38 065 |
| OpenAI | 1 091 |
| Perplexity | 194 |
| 5,4 |
За 12 месяцев до июля 2025 года 80% обхода ИИ-ботов приходилось на обучение, 18% — на поиск и 2% — на действия по запросу пользователей.
Пример robots.txt для магазина
Вариант для магазина, которому нужны ссылки в ИИ-ответах (GEO), но не нужно отдавать контент на обучение моделей: закрыть обучение, открыть ИИ-поиск.
# Обучение моделей — закрыто
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Disallow: /
# ИИ-поиск — открыт, кроме служебных разделов
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Disallow: /cart/
Disallow: /checkout/
Allow: /
# Ответы YandexGPT и Поиска с Алисой — отдельное решение
User-agent: YandexAdditional
Allow: /
Важно: закрывая Google-Extended, вы отказываетесь и от grounding в Gemini, а не только от обучения. Решение стоит принимать осознанно.
Чек-лист
- Найдите ИИ-ботов в логах сервера и сверьте их IP с опубликованными списками компаний: имя в User-Agent подделать легко, а подписи Web Bot Auth пока есть не у всех.
- Решайте по типам: обучение, поиск и пользовательские запросы — разные вопросы для бизнеса.
- Помните, что пользовательские фетчеры могут не соблюдать robots.txt: если их нужно ограничить, это делается на уровне CDN или WAF.
- После правок robots.txt перепроверьте его синтаксис и дайте ботам время: OpenAI называет срок около 24 часов.