Перейти к содержанию
среда, 19 августа 2026 г.

ИИ Вестник

Главные новости о развитии искусственного интеллекта в России

Секретный поисковый робот ChatGPT: как нейросеть выбирает источники и почему ваш сайт может быть проигнорирован

Источник: Все публикации в потоке Разработка
A robotic dog scanning a frozen text fragment on a glowing screen.
Generated by Sourceful Riverflow (RouterAI)

Исследование внутренних логов ChatGPT раскрыло механизм работы его поискового робота: нейросеть использует собственный индекс, который хранит лишь фрагмент текста в 200 символов. Этот фрагмент, взятый с начала страницы, становится решающим фактором при формировании ответа.

Анализ почти 1,9 миллиона источников, собранных ChatGPT при ответах на вопросы, показал, что у модели есть собственный поисковый робот, обеспечивающий 97% всех ссылок. Исследователи, накопившие базу из более чем миллиона ответов нейросетей, обнаружили, что робот, названный labrador, хранит о каждой странице лишь замороженный фрагмент текста длиной ровно 200 символов, который и определяет, попадет ли сайт в ответ. Остальные три процента источников докупаются у сторонних сервисов, таких как Oxylabs и Serp, что особенно заметно на площадках, блокирующих автоматических ботов.

Механика процесса выглядит следующим образом: пользователь задает вопрос, модель самостоятельно формирует поисковый запрос и отправляет его во внутренний поиск, получая не страницы, а карточки с адресом, заголовком и описанием. Эти карточки, содержащие около 200 символов, являются единственным источником информации для модели, которая на их основе решает, какие ссылки включить в ответ. В служебном потоке данных, который передается браузеру, исследователи обнаружили метки, позволяющие точно сопоставить использованные карточки с текстом ответа, что дало возможность детально изучить поведение робота.

Сравнение двух каналов получения ответов — официального API и браузерной версии — выявило принципиальную разницу: в API видны только голые ссылки, тогда как в браузерном потоке содержатся полные карточки с заголовками и описаниями. Именно браузерный канал стал основой для анатомического анализа, который показал, что labrador обходит открытый интернет самостоятельно, снимая H1-заголовки и обрезая описания на полуслове. В то же время покупные конвейеры, такие как bright, предоставляют сниппеты, начинающиеся с даты в формате «Dec 10, 2025» и заканчивающиеся словами «Read more», что характерно для готовых результатов из чужих поисковых систем.

Ключевое открытие заключается в том, что описание, которое ChatGPT хранит о странице, начинается с верхнего регистра — это снятый со страницы H1-заголовок, часто с хлебными крошками, а не адаптированный сниппет. Робот не обрезает заголовки, которые могут достигать 1124 знаков, и знает дату публикации для половины страниц, что свидетельствует о полноценном индексировании. При этом охват labrador составляет 12 тысяч различных сайтов, включая мелкие региональные магазины, тогда как покупная выдача ограничивается тремя сотнями крупных площадок.

Практическое значение для владельцев сайтов огромно: если ваш контент не попадает в первые 200 символов страницы в виде H1-заголовка и начала текста, ChatGPT может проигнорировать его даже при высоком качестве материала. Покупные сервисы, которые ChatGPT использует для закрытых площадок, предоставляют стандартные сниппеты, но их доля крайне мала. Исследователи отмечают, что поведение labrador напоминает классический поисковый робот, но с уникальной особенностью — он не использует мета-описания, а полагается исключительно на видимый текст страницы.

Для российского рынка это означает необходимость пересмотра подходов к SEO-оптимизации с учетом требований нейросетевых поисков. Вместо традиционных мета-тегов и сниппетов, которые часто игнорируются, важно обеспечить, чтобы первые символы страницы содержали ключевую информацию. Открытым остается вопрос, как часто labrador обновляет свой индекс и можно ли повлиять на включение сайта в его базу, но уже сейчас ясно, что старые методы оптимизации под поисковики не работают с ИИ-ассистентами.

Дальнейшие исследования должны показать, как реагирует ChatGPT на изменения в структуре сайтов и можно ли обмануть его робота, размещая в начале страницы специальные тексты. Однако уже сейчас очевидно, что нейросетевые поисковые системы формируют новый стандарт индексации, где решающую роль играет не релевантность всего документа, а его начальный фрагмент. Это ставит перед веб-мастерами новые вызовы и открывает возможности для экспериментов с контентом, который будет оптимизирован под восприятие искусственного интеллекта.

Читайте также