Главная / Блог / ИИ-краулеры в robots.txt

ИИ-краулеры в robots.txt: кого пускать, а кого блокировать в 2026 году

Автор: команда FABRIQ · 16 сентября 2026 · 5 мин чтения
ИИ-краулеры в robots.txt: кого пускать, а кого блокировать в 2026 году

ИИ-краулеры в robots.txt делятся на две категории: роботы для сбора обучающих датасетов и поисковые агенты реального времени. Чтобы сайт цитировался в ответах ChatGPT, Perplexity и Claude, необходимо открыть доступ поисковым краулерам OAI-SearchBot и PerplexityBot. Закрывать стоит только ботов фонового парсинга, если компания защищает контент от бесконтрольного обучения моделей.

Два типа роботов: обучение моделей против поисковых агентов

ИИ-краулер - это сетевой робот, который скачивает веб-страницы для обучения нейросетей или формирования ссылочных ответов в генеративных системах. Главная ошибка вебмастеров - блокировать всех ботов одной директивой Disallow: /.

Боты обучения моделей парсят терабайты страниц для предварительного этапа pre-training. Боты реального времени заходят на страницу прямо во время запроса пользователя или обновляют индекс генеративного поиска.

Если заблокировать агентов реального времени, домен полностью исчезает из поля зрения ассистентов. Пользователь видит ссылки на конкурентов, а веб-ресурс теряет целевые переходы из диалоговых интерфейсов.

Справочник краулеров: роли ботов и последствия их отключения

Поисковые лаборатории разделили роботов по назначениям, выделив для каждого уникальные имена в строке заголовка браузера. ИИ боты robots txt воспринимают по стандарту RFC 9309, поэтому вебмастер может гибко разграничивать права доступа.

КраулерВладелецОсновная задачаЧто произойдет при запрете
GPTBotOpenAIСбор данных для обучения базовых моделей GPTМатериалы сайта не войдут в обучающие датасеты следующих поколений моделей
OAI-SearchBotOpenAIИндексация контента для поисковых ответов ChatGPT SearchСайт пропадет из поисковой выдачи ChatGPT и перестанет получать клики
ChatGPT-UserOpenAIПросмотр страницы по прямому запросу пользователя в диалогеChatGPT не сможет открыть ссылку, отправленную пользователем в чат
ClaudeBotAnthropicСбор обучающих данных для моделей семейства ClaudeКонтент исключается из обучения Claude, снижается глубина понимания бренда моделью
Claude-SearchBotAnthropicПоисковый краулер для выдачи актуальных источников в ClaudeClaude перестает ссылаться на веб-ресурс при ответе на свежие запросы
PerplexityBotPerplexity AIПоисковый обход страниц для генеративного поискаПолное исчезновение страниц из цитат и сниппетов в Perplexity
Google-ExtendedGoogleОбучение Gemini и Vertex AI без влияния на поискGooglebot продолжает индексировать сайт, но контент не идет на тренировку Gemini
YandexBotЯндексКлассический и генеративный поиск, включая сервис «Нейро»Сайт выпадает из стандартного поиска Яндекса и быстрых ответов «Нейро»

Такое разделение позволяет сохранить ссылочный трафик из поисковых систем нового типа, защитив при этом оригинальный контент от утилитарного поглощения моделями.

Как разрешить gptbot и поисковые агенты: рабочий шаблон robots.txt

Разрешающие правила должны стоять выше общих запретов или адресоваться конкретному боту в персональной секции файла. Корректный файл gptbot robots txt обрабатывает наравне с обычными краулерами.

Сбалансированная конфигурация для генеративного SEO

Ниже представлен проверенный шаблон. В нем закрыты боты обучения весов, но открыты все роботы, которые генерируют реальные ссылки:

User-agent: Googlebot
Allow: /

User-agent: YandexBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Если вы хотите понять, как разрешить gptbot полностью, достаточно заменить запрещающую директиву в его блоке на директиву Allow: /.

Команда FABRIQ настраивает правила сканирования индивидуально под бизнес-цели каждого клиента, чтобы не отдавать ценные данные даром, но занимать верхние позиции в AI-выдаче.

OAI-SearchBot и ChatGPT-User: почему их нельзя закрывать

Строка User-agent gptbot относится исключительно к общему сборщику данных OpenAI. Для работы поиска компания использует отдельный агент oai-searchbot, запущенный для наполнения поискового индекса ChatGPT.

OAI-SearchBot не использует найденные материалы для подстройки весов моделей. Робот берет выжимку текста, формирует атрибуцию и ставит кликабельную ссылку на первоисточник.

ChatGPT-User запускается только в момент, когда живой человек в чате просит: «Прочитай статью по этой ссылке и сделай саммари». Если этот юзер-агент заблокирован, пользователь получает сообщение об ошибке доступа к сайту.

Блокировка этих двух сущностей отсекает площадку от миллионной аудитории поискового сервиса OpenAI без какой-либо практической выгоды для безопасности контента.

PerplexityBot и ClaudeBot: специфика работы с альтернативными системами

Поисковая система Perplexity построена вокруг непрерывного сбора данных через perplexitybot. Краулер проверяет свежесть прайс-листов, новостей, экспертных колонок и продуктовых каталогов.

Если perplexitybot заблокирован, система пытается брать старые сниппеты из сторонних индексов либо просто отдает трафик конкурентам, у которых доступ открыт.

Компания Anthropic ввела разделение на claudebot и поискового агента Claude-SearchBot. Если компания стремится к цитированию внутри экосистемы Anthropic, блокировать Claude-SearchBot нельзя.

Оптимальная стратегия в отношении Anthropic - блокировать обучающего claudebot при дефиците серверных мощностей, сохраняя свободный доступ для поисковых служб платформы.

Позиция Google и Яндекса: Google-Extended и краулер Нейро

Яндекс не стал плодить отдельных роботов для сервиса «Нейро». Обучение модели и генерация ответов происходят на базе данных, которые находит стандартный YandexBot.

Попытка заблокировать краулер Яндекса в надежде скрыть сайт от «Нейро» приведет к моментальной пессимизации и исключению домена из органической выдачи классического поиска.

Google пошел по пути предоставления выбора. Токен Google-Extended позволяет исключить сайт из обучения моделей Gemini без потери позиций в поисковой выдаче и блоках AI Overviews.

AI Overviews генерируются на базе основного индекса Googlebot, поэтому блокировка Google-Extended безопасна для органического трафика сайта.

Скрытая преграда: блокировка ИИ-ботов фаерволом WAF хостинга

WAF - это защитный экран веб-приложения, который фильтрует входящий трафик до того, как запрос дойдет до веб-сервера и файла robots.txt. В этом кроется самая частая техническая проблема.

Сервисы защиты от DDoS-атак, такие как Cloudflare, Fastly или встроенные модули хостингов, часто содержат встроенные списки AI Scrapers. По умолчанию эти экраны отвечают ботам кодом 403 Forbidden.

Владелец сайта прописывает Allow в robots.txt, но краулеры OpenAI или Anthropic все равно не могут получить доступ к страницам из-за блокировки на сетевом периметре.

Для решения проблемы необходимо зайти в панель управления защитой хостинга, открыть правила фаервола и добавить доверенных ИИ-краулеров в список исключений Managed Rules.

Как проверить реальные заходы ИИ-краулеров через логи сервера

Единственный достоверный способ убедиться в доступности сайта для нейросетей - анализ сырых access-логов веб-сервера Nginx или Apache. Сторонние сервисы аналитики часто не фиксируют невыполняемые JavaScript-запросы ботов.

Для быстрой фильтрации обращений краулеров на сервере Linux применяется стандартная консольная команда grep в терминале:

grep -Ei "gptbot|oai-searchbot|perplexitybot|claudebot" /var/log/nginx/access.log

В выводе логов критически важно отслеживать HTTP-код ответа сервера. Код 200 означает успешное скачивание страницы роботом, код 301 показывает перенаправление, а коды 403 и 429 свидетельствуют о проблемах с фаерволом или лимитами запросов.

Многие боты публикуют свои диапазоны IP-адресов в официальной документации. Рекомендуется периодически сверять IP-адреса из логов с открытыми списками OpenAI и Perplexity, чтобы отсекать спам-парсеров, маскирующихся под известных ИИ-агентов.

Главное
  • ИИ-краулеры разделены на роботов обучения и роботов генеративного поиска: их блокировка приводит к разным последствиям.
  • OAI-SearchBot и PerplexityBot необходимы для попадания сайта в ответы диалоговых систем и должны быть открыты в robots.txt.
  • Отключение Google-Extended защищает материалы от использования в обучении Gemini без вреда для обычного SEO.
  • Частая причина отсутствия сайта в ответах ИИ - скрытая блокировка ботов фаерволом WAF хостинга с кодом 403.
  • Проверять корректность работы поисковых ИИ-агентов необходимо по серверным логам запросов и официальным диапазонам IP.

Частые вопросы

Что будет, если полностью заблокировать GPTBot в robots.txt?

Сайт перестанет использоваться для тренировки будущих моделей OpenAI. При этом ресурс сохранит шансы на цитирование в ChatGPT Search, если для краулера OAI-SearchBot оставлен открытый доступ.

Влияет ли блокировка Google-Extended на позиции сайта в обычном поиске Google?

Нет, блокировка Google-Extended не влияет на ранжирование в основном поиске. Токен запрещает использование контента только для обучения моделей Gemini и сопутствующих сервисов искусственного интеллекта.

Как отличить официального PerplexityBot от вредоносного скрапера?

Настоящий PerplexityBot осуществляет запросы со строго определенных IP-адресов, опубликованных в документации Perplexity. Также проверить подлинность можно с помощью обратного DNS-запроса к хосту бота.

Нужно ли создавать отдельный файл llms.txt, если уже настроен robots.txt?

Файл llms.txt является полезным дополнением, предлагающим сжатую текстовую версию структуры проекта специально для языковых моделей. Однако стандартным механизмом контроля доступа остается robots.txt.

Почему в Google Analytics нет визитов от краулеров OAI-SearchBot и PerplexityBot?

Большинство роботов скачивают чистый HTML-код и не запускают клиентские скрипты, включая счетчики Google Analytics или Яндекс Метрики. Реальные визиты роботов видны только в серверных логах хостинга.

Источники

F

Команда FABRIQ: агентство GEO и AI SEO. Выводим бренды в ответы ChatGPT, YandexGPT, Алисы и Perplexity, ведём собственный контент-завод. Материал проверен по документации OpenAI, Google, Яндекса и спецификациям, указанным в источниках.

Хотите, чтобы нейросети называли ваш бренд?

Сделаем бесплатный аудит AI-видимости: покажем, кого ChatGPT и Алиса рекомендуют в вашей нише сейчас и что нужно, чтобы там появились вы.

Написать в TelegramУслуги GEO-оптимизацииa@fbrq.pro
Продвижение сайта
Заказать GEO
*обязательные поля для заполнения
*
Made on
Tilda