ИИ-краулеры в robots.txt: кого пускать, а кого блокировать в 2026 году
ИИ-краулеры в robots.txt делятся на две категории: роботы для сбора обучающих датасетов и поисковые агенты реального времени. Чтобы сайт цитировался в ответах ChatGPT, Perplexity и Claude, необходимо открыть доступ поисковым краулерам OAI-SearchBot и PerplexityBot. Закрывать стоит только ботов фонового парсинга, если компания защищает контент от бесконтрольного обучения моделей.
- Два типа роботов: обучение моделей против поисковых агентов
- Справочник краулеров: роли ботов и последствия их отключения
- Как разрешить gptbot и поисковые агенты: рабочий шаблон robots.txt
- OAI-SearchBot и ChatGPT-User: почему их нельзя закрывать
- PerplexityBot и ClaudeBot: специфика работы с альтернативными системами
- Позиция Google и Яндекса: Google-Extended и краулер Нейро
- Скрытая преграда: блокировка ИИ-ботов фаерволом WAF хостинга
- Как проверить реальные заходы ИИ-краулеров через логи сервера
Два типа роботов: обучение моделей против поисковых агентов
ИИ-краулер - это сетевой робот, который скачивает веб-страницы для обучения нейросетей или формирования ссылочных ответов в генеративных системах. Главная ошибка вебмастеров - блокировать всех ботов одной директивой Disallow: /.
Боты обучения моделей парсят терабайты страниц для предварительного этапа pre-training. Боты реального времени заходят на страницу прямо во время запроса пользователя или обновляют индекс генеративного поиска.
Если заблокировать агентов реального времени, домен полностью исчезает из поля зрения ассистентов. Пользователь видит ссылки на конкурентов, а веб-ресурс теряет целевые переходы из диалоговых интерфейсов.
Справочник краулеров: роли ботов и последствия их отключения
Поисковые лаборатории разделили роботов по назначениям, выделив для каждого уникальные имена в строке заголовка браузера. ИИ боты robots txt воспринимают по стандарту RFC 9309, поэтому вебмастер может гибко разграничивать права доступа.
| Краулер | Владелец | Основная задача | Что произойдет при запрете |
|---|---|---|---|
| GPTBot | OpenAI | Сбор данных для обучения базовых моделей GPT | Материалы сайта не войдут в обучающие датасеты следующих поколений моделей |
| OAI-SearchBot | OpenAI | Индексация контента для поисковых ответов ChatGPT Search | Сайт пропадет из поисковой выдачи ChatGPT и перестанет получать клики |
| ChatGPT-User | OpenAI | Просмотр страницы по прямому запросу пользователя в диалоге | ChatGPT не сможет открыть ссылку, отправленную пользователем в чат |
| ClaudeBot | Anthropic | Сбор обучающих данных для моделей семейства Claude | Контент исключается из обучения Claude, снижается глубина понимания бренда моделью |
| Claude-SearchBot | Anthropic | Поисковый краулер для выдачи актуальных источников в Claude | Claude перестает ссылаться на веб-ресурс при ответе на свежие запросы |
| PerplexityBot | Perplexity AI | Поисковый обход страниц для генеративного поиска | Полное исчезновение страниц из цитат и сниппетов в Perplexity |
| Google-Extended | Обучение Gemini и Vertex AI без влияния на поиск | Googlebot продолжает индексировать сайт, но контент не идет на тренировку Gemini | |
| YandexBot | Яндекс | Классический и генеративный поиск, включая сервис «Нейро» | Сайт выпадает из стандартного поиска Яндекса и быстрых ответов «Нейро» |
Такое разделение позволяет сохранить ссылочный трафик из поисковых систем нового типа, защитив при этом оригинальный контент от утилитарного поглощения моделями.
Как разрешить gptbot и поисковые агенты: рабочий шаблон robots.txt
Разрешающие правила должны стоять выше общих запретов или адресоваться конкретному боту в персональной секции файла. Корректный файл gptbot robots txt обрабатывает наравне с обычными краулерами.
Сбалансированная конфигурация для генеративного SEO
Ниже представлен проверенный шаблон. В нем закрыты боты обучения весов, но открыты все роботы, которые генерируют реальные ссылки:
User-agent: Googlebot
Allow: /
User-agent: YandexBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /Если вы хотите понять, как разрешить gptbot полностью, достаточно заменить запрещающую директиву в его блоке на директиву Allow: /.
Команда FABRIQ настраивает правила сканирования индивидуально под бизнес-цели каждого клиента, чтобы не отдавать ценные данные даром, но занимать верхние позиции в AI-выдаче.
OAI-SearchBot и ChatGPT-User: почему их нельзя закрывать
Строка User-agent gptbot относится исключительно к общему сборщику данных OpenAI. Для работы поиска компания использует отдельный агент oai-searchbot, запущенный для наполнения поискового индекса ChatGPT.
OAI-SearchBot не использует найденные материалы для подстройки весов моделей. Робот берет выжимку текста, формирует атрибуцию и ставит кликабельную ссылку на первоисточник.
ChatGPT-User запускается только в момент, когда живой человек в чате просит: «Прочитай статью по этой ссылке и сделай саммари». Если этот юзер-агент заблокирован, пользователь получает сообщение об ошибке доступа к сайту.
Блокировка этих двух сущностей отсекает площадку от миллионной аудитории поискового сервиса OpenAI без какой-либо практической выгоды для безопасности контента.
PerplexityBot и ClaudeBot: специфика работы с альтернативными системами
Поисковая система Perplexity построена вокруг непрерывного сбора данных через perplexitybot. Краулер проверяет свежесть прайс-листов, новостей, экспертных колонок и продуктовых каталогов.
Если perplexitybot заблокирован, система пытается брать старые сниппеты из сторонних индексов либо просто отдает трафик конкурентам, у которых доступ открыт.
Компания Anthropic ввела разделение на claudebot и поискового агента Claude-SearchBot. Если компания стремится к цитированию внутри экосистемы Anthropic, блокировать Claude-SearchBot нельзя.
Оптимальная стратегия в отношении Anthropic - блокировать обучающего claudebot при дефиците серверных мощностей, сохраняя свободный доступ для поисковых служб платформы.
Позиция Google и Яндекса: Google-Extended и краулер Нейро
Яндекс не стал плодить отдельных роботов для сервиса «Нейро». Обучение модели и генерация ответов происходят на базе данных, которые находит стандартный YandexBot.
Попытка заблокировать краулер Яндекса в надежде скрыть сайт от «Нейро» приведет к моментальной пессимизации и исключению домена из органической выдачи классического поиска.
Google пошел по пути предоставления выбора. Токен Google-Extended позволяет исключить сайт из обучения моделей Gemini без потери позиций в поисковой выдаче и блоках AI Overviews.
AI Overviews генерируются на базе основного индекса Googlebot, поэтому блокировка Google-Extended безопасна для органического трафика сайта.
Скрытая преграда: блокировка ИИ-ботов фаерволом WAF хостинга
WAF - это защитный экран веб-приложения, который фильтрует входящий трафик до того, как запрос дойдет до веб-сервера и файла robots.txt. В этом кроется самая частая техническая проблема.
Сервисы защиты от DDoS-атак, такие как Cloudflare, Fastly или встроенные модули хостингов, часто содержат встроенные списки AI Scrapers. По умолчанию эти экраны отвечают ботам кодом 403 Forbidden.
Владелец сайта прописывает Allow в robots.txt, но краулеры OpenAI или Anthropic все равно не могут получить доступ к страницам из-за блокировки на сетевом периметре.
Для решения проблемы необходимо зайти в панель управления защитой хостинга, открыть правила фаервола и добавить доверенных ИИ-краулеров в список исключений Managed Rules.
Как проверить реальные заходы ИИ-краулеров через логи сервера
Единственный достоверный способ убедиться в доступности сайта для нейросетей - анализ сырых access-логов веб-сервера Nginx или Apache. Сторонние сервисы аналитики часто не фиксируют невыполняемые JavaScript-запросы ботов.
Для быстрой фильтрации обращений краулеров на сервере Linux применяется стандартная консольная команда grep в терминале:
grep -Ei "gptbot|oai-searchbot|perplexitybot|claudebot" /var/log/nginx/access.logВ выводе логов критически важно отслеживать HTTP-код ответа сервера. Код 200 означает успешное скачивание страницы роботом, код 301 показывает перенаправление, а коды 403 и 429 свидетельствуют о проблемах с фаерволом или лимитами запросов.
Многие боты публикуют свои диапазоны IP-адресов в официальной документации. Рекомендуется периодически сверять IP-адреса из логов с открытыми списками OpenAI и Perplexity, чтобы отсекать спам-парсеров, маскирующихся под известных ИИ-агентов.
- ИИ-краулеры разделены на роботов обучения и роботов генеративного поиска: их блокировка приводит к разным последствиям.
- OAI-SearchBot и PerplexityBot необходимы для попадания сайта в ответы диалоговых систем и должны быть открыты в robots.txt.
- Отключение Google-Extended защищает материалы от использования в обучении Gemini без вреда для обычного SEO.
- Частая причина отсутствия сайта в ответах ИИ - скрытая блокировка ботов фаерволом WAF хостинга с кодом 403.
- Проверять корректность работы поисковых ИИ-агентов необходимо по серверным логам запросов и официальным диапазонам IP.
Частые вопросы
Что будет, если полностью заблокировать GPTBot в robots.txt?
Сайт перестанет использоваться для тренировки будущих моделей OpenAI. При этом ресурс сохранит шансы на цитирование в ChatGPT Search, если для краулера OAI-SearchBot оставлен открытый доступ.
Влияет ли блокировка Google-Extended на позиции сайта в обычном поиске Google?
Нет, блокировка Google-Extended не влияет на ранжирование в основном поиске. Токен запрещает использование контента только для обучения моделей Gemini и сопутствующих сервисов искусственного интеллекта.
Как отличить официального PerplexityBot от вредоносного скрапера?
Настоящий PerplexityBot осуществляет запросы со строго определенных IP-адресов, опубликованных в документации Perplexity. Также проверить подлинность можно с помощью обратного DNS-запроса к хосту бота.
Нужно ли создавать отдельный файл llms.txt, если уже настроен robots.txt?
Файл llms.txt является полезным дополнением, предлагающим сжатую текстовую версию структуры проекта специально для языковых моделей. Однако стандартным механизмом контроля доступа остается robots.txt.
Почему в Google Analytics нет визитов от краулеров OAI-SearchBot и PerplexityBot?
Большинство роботов скачивают чистый HTML-код и не запускают клиентские скрипты, включая счетчики Google Analytics или Яндекс Метрики. Реальные визиты роботов видны только в серверных логах хостинга.
Источники
- OpenAI, «Overview of OpenAI crawlers» (GPTBot, OAI-SearchBot)
- Perplexity Help Center, «PerplexityBot»
- Google Search Central, «AI features and your website»
- Яндекс Вебмастер, справка по индексированию и разметке
Хотите, чтобы нейросети называли ваш бренд?
Сделаем бесплатный аудит AI-видимости: покажем, кого ChatGPT и Алиса рекомендуют в вашей нише сейчас и что нужно, чтобы там появились вы.
Написать в TelegramУслуги GEO-оптимизацииa@fbrq.pro