Перейти к содержанию
понедельник, 27 июля 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Невидимый сайт для ИИ: почему robots.txt блокирует GPTBot и PerplexityBot, а SEO-специалисты об этом не знают

SEO specialist shocked by robots.txt blocking AI bots.
Generated by Sourceful Riverflow (RouterAI)

Половина российских сайтов невидима для ChatGPT, Perplexity и других AI-помощников из-за устаревших правил robots.txt. Эта проблема не обнаруживается стандартными SEO-инструментами, но критически влияет на попадание контента в ответы генеративных моделей. В 2026 году настройка доступов для AI-краулеров становится обязательной частью веб-оптимизации.

Типичная ситуация: сайт находится в топ-3 Google по ключевому запросу, но ChatGPT не упоминает компанию в своём ответе. При проверке логов выясняется, что в robots.txt висит глобальный Disallow для всех user-agent, кроме Googlebot и YandexBot. GPTBot, ClaudeBot и PerplexityBot получают 403 на первом же запросе, хотя Search Console и Яндекс.Вебмастер показывают зелёный свет. Это классический пример того, как классическая SEO-индексация и доступ для ИИ-ботов оказались двумя разными процессами, и второй практически никогда не входит в стандартный чеклист вебмастеров. За последние два года количество AI-краулеров выросло в разы, а старые robots.txt, написанные при запуске сайта, не учитывают новые user-agent, что приводит к массовой невидимости контента для генеративных моделей.

AI-краулеры делятся на два принципиально разных типа. Первый — краулеры для обучения моделей: GPTBot от OpenAI, ClaudeBot от Anthropic, CCBot от Common Crawl. Они собирают массивы текстов на будущее, заходят редко (например, GPTBot может появляться раз в месяц), и результат их работы не виден сразу. Второй тип — краулеры реального времени: OAI-SearchBot, PerplexityBot, ChatGPT-User. Они заходят на страницу в момент, когда пользователь задаёт вопрос модели, забирают контент и формируют ответ прямо сейчас — поэтому каждый такой запрос критичен. Если у такого бота нет доступа, модель либо не найдёт страницу, либо процитирует конкурента с открытым доступом. Список актуальных AI-ботов на конец июля 2026 года включает GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, anthropic-ai, PerplexityBot, Google-Extended, YandexAI, GigaChat, Applebot-Extended и CCBot. При этом многие сайты правят robots.txt один раз при запуске и не обновляют его под новые user-agent, а некоторые даже блокируют всех неизвестных ботов глобальным Disallow, считая их спам-парсерами.

Технически настройка доступа для AI-ботов требует больше, чем просто разрешить в robots.txt. Базовое правило — открыть каждого нужного бота точечно, блокируя только закрытые разделы вроде личного кабинета. Запросы выглядят как User-agent: GPTBot Allow: / и так далее. Однако файл robots.txt — лишь первый слой. Content-Security-Policy на уровне прокси или CDN может жёстко блокировать легитимных ботов по IP или user-agent, даже если robots.txt разрешает. Вторая проблема — JS-рендер без SSR: часть ботов реального времени, такие как Perplexity-User и OAI-SearchBot, не исполняют JavaScript, поэтому если контент подгружается клиентским кодом после первого ответа сервера, модель видит пустой каркас. Кроме того, бесконечный скролл с intersection observer без прогрессивной загрузки оставляет бота только с первым экраном. Комбинация этих факторов и создаёт ситуацию, когда сайт в индексе Google и Яндекса (эти боты умеют рендерить JS и терпимее к CSP), но невидим для более простых агентов реального времени. Отдельно стоит упомянуть кейс с переименованием NotebookLM в Google-GeminiNotebook в 2026 году: многие старые robots.txt, WAF и системы аналитики содержат устаревший user-agent, и правило не срабатывает — его нужно срочно обновить, иначе бот потеряется.

Примечательно, что в SEO-сообществе долгое время не обращали внимания на AI-краулеры, потому что классическая индексация оставалась в порядке. Исторически robots.txt настраивали только для Googlebot и YandexBot, а остальных ботов либо не упоминали, либо блокировали глобально, считая, что это спам-парсеры. Однако с 2024–2025 годов AI-поиск стал значимым каналом трафика: Perplexity, ChatGPT Search и AI Overviews от Google показывают контент миллионам пользователей. Яндекс запустил YandexAI для ответов Алисы, Сбер — GigaChat. Игнорирование этих ботов означает потерю аудитории и рекламных возможностей. Конкуренты уже активно оптимизируют доступ: кто первым разрешил PerplexityBot, тот получает цитаты в ответах, а кто не обновил robots.txt — остаётся невидимым. При этом стандартные SEO-инструменты (типа Screaming Frog или Netpeak Spider) до сих пор не проверяют доступ для AI-ботов, что усугубляет проблему.

Для российского рынка эта проблема стоит особенно остро. Многие сайты используют устаревшие шаблоны robots.txt, скопированные из проектов двухлетней давности, где нет OAI-SearchBot, Google-Extended и YandexAI. Кроме того, российские CDN, такие как DDoS-Guard или QIWI, часто включают защиту от парсеров по эвристике, которая блокирует легитимные AI-боты вместе со спамом. Правило живёт на уровне CDN, и его не проверяют при обычном SEO-аудите. Реакция отрасли постепенно меняется: крупные SEO-конференции в Москве и Санкт-Петербурге начали включать доклады по AI-краулерам, а в блогах Яндекса и Сбера появляются инструкции по настройке доступов. Однако до массового принятия ещё далеко — многие владельцы сайтов даже не знают о существовании таких ботов, а те, кто знает, часто не могут отличить легитимного краулера от настоящего парсера. Например, в конце 2025 года появился бот со схожим именем, имитирующий PerplexityBot, что вызвало волну ложных блокировок.

Проверить свой сайт на доступность для AI-краулеров можно без специального ПО. Первый шаг — grep по access-логам сервера за последние две недели: команда grep -E "GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot" access.log | awk '{print $9}' | sort | uniq -c покажет, какие коды ответов (200, 403, 404) получил каждый бот. Второй шаг — тестовый запрос с подменой user-agent: curl -A "GPTBot" -I https://example.com/ отдаст HTTP-заголовки и статус. Если бот получает 403 или редирект на логин, robots.txt или WAF блокирует его. Также полезно проверить, не переименованы ли боты: например, Google-GeminiNotobook вместо старого NotebookLM. Сравнивая простоту решения с его важностью, можно сказать, что открыть robots.txt для AI-краулеров — задача на пять минут, которая может кардинально изменить видимость бренда в ответах ChatGPT, Алисы или GigaChat. Альтернативы — использование структурированных данных, API прямого доступа или партнёрские интеграции — сложнее и требуют времени.

Базовый же доступ через robots.txt является фундаментом, но его нужно дополнять контролем на уровне CSP и SSR. Перспективы: количество AI-ботов будет только расти, а значит, регулярная актуализация списка user-agent и проверка через логи сервера и curl с подменой заголовка станут рутиной. Открытым остаётся вопрос баланса: как не открыть сайт для дешёвого парсинга со стороны недобросовестных агрегаторов, при этом дать доступ ключевым AI-поисковикам. В ближайшие год-два рынок, скорее всего, придёт к стандартизированному списку легитимных ботов и механизмам их верификации, например через цифровые подписи запросов, но пока каждый вебмастер должен самостоятельно разбираться в логиках GPTBot, PerplexityBot и их коллег. Тем не менее, первые шаги — обновить robots.txt и проверить логи — уже сегодня дадут ощутимый эффект и выведут сайт из невидимости для искусственного интеллекта.

Читайте также