ChatGPT тайно создал собственный поисковый индекс

ChatGPT тайно создал собственный поисковый индекс

Два года в SEO-сообществе бытовал простой стереотип: «ChatGPT не имеет своего поискового индекса, он просто парсит Bing и Google в реальном времени».

Это заблуждение.

Если ваша стратегия продвижения в нейросетях (GEO / AI Search Optimization) ограничивается оптимизацией под Bing Webmaster Tools, вы упускаете большую часть системы. OpenAI не просто парсит поисковики - компании удалось построить собственный полноценный индекс Labrador и гибридную инфраструктуру.

Ниже разбор того, как устроена поисковая машина ChatGPT изнутри, подтверждения из судебных документов Google, логи A/B-тестов и шаги по адаптации вашей SEO-стратегии.

1. Семья индексов Labrador: от PDF до Reddit и Legal

В период с мая по июль 2026 года в Server-Side Events (SSE) ChatGPT временно светился параметр result_source. Он содержал четыре источника: Bright, Oxylabs, SERP (внешние скраперы) и Labrador.

Labrador - это собственная система индексации OpenAI. И это не один универсальный индекс, а целая семейная экосистема вертикальных индексов, аналогичная структуре Google:

  • General Web (общий веб)
  • Shopping (товарный поиск)
  • News (с делением на свежие новости за 24 часа, 7 дней и архив)
  • Local (локальный поиск)
  • PDF и arXiv (научные публикации и документы)
  • Legal, Medical, Finance (узкоспециализированные ниши)
  • YouTube, Images, Wikipedia

OpenAI сохраняет классические атрибуты страниц: полный HTML-контент, дату краулинга и дату публикации.

2. Доказательства: от судебных заседаний Google до вакансий на эксабайты

Это не случайно возникший сайд-проект, а целенаправленная многолетняя стратегия:

Доказательство №1: Показания под присягой (2024 год)

На антимонопольном процессе против Google глава ChatGPT Ник Терли (Nick Turley) под присягой заявил, что еще в 2023 году OpenAI столкнулась с проблемами качества данных от сторонних API. Компания хотела заключить прямую сделку с Google, но получив отказ, запустила разработку собственного поискового индекса.

ChatGPT тайно создал собственный поисковый индекс

Первоначальная цель была агрессивной: закрыть 80% всех поисковых запросов внутренним индексом уже к концу 2023 года.

Доказательство №2: Вакансии OpenAI

В описаниях вакансий Software Engineer (Foundations Search) и Engineering Manager (Online Data Systems) напрямую указаны задачи:

«Проектирование и эксплуатация систем индексации, поисковых конвейеров (retrieval pipelines) и гипермасштабируемых векторных баз данных на эксабайтных объемах (10¹⁸ байт)».

В требованиях к инженерам указан опыт работы как с плотными (dense/vector), так и с разреженными (sparse/lexical - TF-IDF, BM25) представлениями. Это классический фундамент для гибридного поиска RRF (Reciprocal Rank Fusion), который использует Google.

3. Товарный поиск и A/B-тесты в реальном времени

Самая горячая точка развертывания собственного индекса ChatGPT прямо сейчас - Shopping.

В логах SSE (Server-Side Events) зафиксированы масштабные A/B-тесты, где OpenAI проверяет свой индекс на живом трафике (от 8% до 20% пользователей):

  • prefer-index-over-serp-v3 - эксперимент по приоритету внутреннего индекса над внешним парсингом выдачи (SERP).
  • shopping-reduced-topn-v4b - гибридный алгоритм ранжирования товаров:prod400: выборка из 400 товаров-кандидатов;ann4096 / ann12288: векторный поиск (Approximate Nearest Neighbor);rerank400: этап переранжирования;BM25: сужение до финальной ТОП-10 выдачи.

4. Кэширование и сумасшедший краулинг

Запрашивать сайты «на лету» при каждом промпте слишком долго (более 58% сайтов грузятся дольше 0.8 сек). Чтобы отдавать ответы за доли секунды, OpenAI использует агрессивный кэширующий слой.

Эксперимент с краулером:

В рамках теста GEO-исследователь Метехан Ешилюрт развернул тестовый сайт на 1 млрд страниц. Краулер OpenAI начал сканировать его со скоростью 35 000 запросов в час и проиндексировал уже более 6 млн страниц.

Сканировать такой объем данных «впустую» экономически нецелесообразно - данные уходят напрямую во внутренний векторный кэш для предварительного расчета эмбеддингов.

Как проверить ваш сайт: Включите режим Lockdown Mode в настройках ChatGPT (он отключает live-веб-поиск) и попросите показать свежий контент вашей главной страницы. Вы увидите, что именно зафиксировано во внутреннем кэше OpenAI.

ChatGPT тайно создал собственный поисковый индекс

5. Из кого состоит гибридный «пазл» ChatGPT?

ChatGPT не полностью отказался от сторонних API. Система объединяет минимум 9 различных источников:

  1. Собственный бот-краулер (индекс Labrador)
  2. Bright Data (парсинг Google Web и Google Maps)
  3. Oxylabs (парсинг Google News)
  4. Канал «SERP» (новости и локальная выдача)
  5. Yelp (прямой лицензированный партнер по локальному бизнесу)
  6. TripAdvisor (партнер по туризму и HoReCa)
  7. Внутренние пайплайны b1/b3 (Facebook-страницы, бизнес-сайты, Google Maps)
  8. Microsoft Web IQ (инфраструктура заземления от Microsoft с задержкой <165 мс)
  9. Google Search Console / Live API (прямой фоновый обратный запрос к Google)

Что делать SEO-специалистам и маркетологам в 2026 году?

  1. Забудьте формулу «Bing = ChatGPT». Выдимость в Bing больше не гарантирует попадание в ответы ChatGPT. Большинство фоновых запросов проходят через Microsoft Web IQ или собственный индекс Labrador.
  2. E-commerce: Уделите внимание технической оптимизации карточек товаров для векторных эмбеддингов. ChatGPT строит товарный графы на базе собственного индекса.
  3. Локальное SEO: Заполняйте профили в Yelp и TripAdvisor. Для ChatGPT они являются доверенными структурированными источниками первично корректных данных.
  4. Проверяйте индекс через Lockdown Mode. Протестируйте ключевые посадочные страницы, чтобы понять, корректно ли считывается структура сайта без обращения к «живому» интернету.
  5. Оптимизируйте под гибридный поиск (BM25 + Dense). Тексты должны содержать как четкие точные вхождения ключей (для lexical BM25), так и глубокую семантическую связность (для векторного ann4096).
11