За 72 часа сменились четыре фронтирные модели подряд. Ваш замер видимости уже устарел

За 72 часа сменились четыре фронтирные модели подряд. Ваш замер видимости уже устарел

С первого по третье сентября вышли Claude Fable 5.1, Gemini 3.8 Flash, Muse Spark 1.3 и GPT-6 Astra. Для бизнеса это значит простую вещь: отчёт о видимости бренда, собранный на прошлой неделе, частично описывает системы, которых больше нет. Разбираю, что произошло и почему замеры пора привязывать к версиям моделей

Обычно новые модели выходят по одной, и рынок успевает разобраться, что изменилось. На этой неделе так не получилось.

1 сентября. Anthropic выпустила Claude Fable 5.1 вместе с закрытой версией Mythos 5.1 и заодно срезала цену на чтение кеша на 75%.

2 сентября. Google представил Gemini 3.8 Flash, третью модель линейки Flash за шесть недель, плюс отдельный вариант для кибербезопасности. В тот же день Meta без особого шума выкатила Muse Spark 1.3 по цене около десяти центов за миллион токенов.

3 сентября. OpenAI показала GPT-6 Astra: контекст больше миллиона токенов, знания обновлены до конца апреля, цена десять долларов за миллион входных токенов и пятьдесят за выходные.

Заявление про AGI в день, когда токены подешевели вдвое

Вторая новость той же недели объясняет, почему этот темп теперь надолго.

Представляя новую модель, президент OpenAI приветствовал наступление эры AGI. В тот же день индекс цен на токены показал, что средняя стоимость миллиона токенов опустилась примерно до девяноста семи центов, то есть меньше половины летнего пика.

Две эти вещи в одних сутках описывают отрасль лучше любого отчёта. Продукт, который его создатели называют важнейшим технологическим достижением в истории человечества, за лето подешевел вдвое.

Есть и третья деталь. Anthropic и OpenAI независимо друг от друга выставили на свои флагманы одинаковую цену: десять долларов за миллион входных токенов и пятьдесят за выходные. Разница между анонсами два дня, договориться они вряд ли могли. Цены на фронтир сходятся к общему уровню, а пол для массовых моделей уехал куда-то к двадцати центам.

Вывод из этого простой и неприятный для тех, кто планирует работу кварталами. Дешёвые вычисления и упор на дообучение вместо новых архитектур позволяют выпускать обновления всё чаще. Неделя с четырьмя релизами это не аномалия, а то, как теперь будет выглядеть обычный месяц.

Почему это проблема для замеров

Видимость бренда в нейросетях это не свойство вашего контента. Это свойство конкретной модели конкретной версии, которая читает ваш контент своим способом и решает, кого упомянуть. Меняется модель, меняются ответы.

Такое уже наблюдали в цифрах. Компания Semrush, отслеживая цитирование новых страниц, зафиксировала, что Google постоянно пересматривает пул источников: страницы, которые цитировались на этой неделе, на следующей исчезали. И это между обновлениями. А когда обновление случается, картина может перестроиться целиком.

Отсюда практическое следствие, которое обычно не проговаривают. Ваш отчёт по видимости за август описывает поведение Gemini 3.7 и GPT-5.6. Этих моделей больше нет в проде. Сравнивать сентябрьские цифры с августовскими напрямую нельзя: вы сравниваете не свою работу, а две разные системы.

Что именно поменялось под капотом

По сообщениям, GPT-6 Astra использует другой подход к рассуждению: вместо того чтобы расписывать ход мысли словами, модель прогоняет токены через одни и те же слои по кругу, рассуждая во внутреннем представлении. Если это так, меняется сам механизм выбора того, что попадёт в ответ.

Второе наблюдение из отраслевых разборов сентября: основной прирост возможностей в этих релизах дали не новые архитектуры, а дообучение, то есть на то, как модель настраивали после базового обучения. А именно эта настройка определяет, какие источники модель считает надёжными и кого называет в ответах.

Третье: три из четырёх запусков вышли с отдельными уровнями доступа по кибербезопасности. GPT-6 Astra стала первой моделью, которая пробила собственный критический порог OpenAI в этой области. Для брендов это означает, что часть возможностей теперь живёт за закрытыми дверями, и поведение публичной версии может отличаться от того, что показывают в анонсах.

Что с этим делать

Четыре практических правила, которые следуют из этой недели.

Первое. Привязывайте замер к версии модели. В отчёте должна стоять не только дата, но и то, какая версия отвечала. Иначе через полгода вы будете смотреть на график и гадать, что означает ступенька: вашу работу, смену алгоритма или выход новой модели.

Второе. После крупного обновления делайте контрольный замер. Не через месяц, а в ближайшие дни. Это ваша новая точка отсчёта, и от неё вы будете считать эффект своих действий дальше.

Третье. Не переписывайте контент на панике. Если после обновления модели видимость просела, первая гипотеза не «наш контент устарел», а «система перевзвесила источники». Прежде чем что-то менять, посмотрите, изменился ли набор площадок, которые модель цитирует по вашей теме. Если сменились источники, а не позиция вашего материала, работать надо с источниками.

Четвёртое. Смотрите несколько моделей сразу. Обновления идут вразнобой, и провал в одной системе на фоне стабильности в остальных почти всегда означает изменение алгоритма, а не проблему бренда. Понять это можно только при сравнении.

Что тут могут GEO-сервисы

Все четыре правила упираются в одно: руками такое не отследить. Между вашими двумя проверками может смениться поколение моделей, а вы об этом узнаете из новостей, а не из своих цифр.

Под эту задачу и существует класс GEO-сервисов. Устроены они в целом похоже: регулярно прогоняют один и тот же набор запросов через несколько нейросетей, считают, как часто в ответах появляется бренд, сравнивают с конкурентами и собирают источники, на которые опираются модели. На российском рынке это VisioBrand, brandfound.ai и другие платформы.

Разница между ними как раз в том, насколько они помогают отличить обновление модели от проблемы бренда. Разберу на примере, что для этого нужно.

Частота замера. Если проверка идёт раз в месяц, вы увидите итог смены поколения, но не сам момент. В brandfound мониторинг идёт ежедневно, а по избранным запросам данные обновляются раз в час, поэтому провал после выхода новой версии виден в тот же день, а не задним числом.

Несколько моделей одновременно. Это главный инструмент диагностики. Если после обновления GPT-6 просадка случилась только в ChatGPT, а в остальных девяти системах всё стабильно, дело почти наверняка в обновлении, а не в вашем контенте. Сервис, который смотрит одну платформу, такой вывод сделать не позволяет в принципе.

Источники, а не только упоминания. Когда видимость проседает, важнее всего понять, что именно поменялось: перестали цитировать конкретно вас или сменился весь набор площадок, из которых модель собирает ответ по вашей теме. Во втором случае переписывать свои тексты бесполезно, работать надо с теми площадками. Поэтому в отчёте нужны не только цифры по бренду, но и список доменов, на которые ссылается каждая из моделей.

Привязка к действиям. И последнее: если вы после обновления что-то предприняли, надо уметь доказать, что подействовало именно это. В brandfound под это сделан отдельный механизм: вы ставите ссылку на опубликованный материал в карточку, и платформа отслеживает, когда нейросети начали на него ссылаться и как это сдвинуло упоминания бренда.

Инструмент, повторюсь, вторичен. Первично то, что в среде, где за трое суток меняются четыре модели, разовая проверка перестала давать хоть какую-то информацию.

Что в итоге

Четыре фронтирные модели за трое суток это не рекорд ради рекорда, а новая нормальность. Дешёвые вычисления и упор на дообучение позволяют выпускать обновления быстрее, чем компании успевают осмыслить предыдущие.

Для тех, кто следит за видимостью бренда, следствие одно. Замер перестал быть фотографией, которую можно сделать раз в квартал. Он становится похож на мониторинг курса: смысл имеет только регулярный ряд наблюдений, привязанный к тому, какая версия модели отвечала в этот момент.

Иначе получится классическая ошибка: увидели просадку, месяц переписывали статьи, а на самом деле просто вышла новая версия модели и перевзвесила источники.

А теперь к вам

Замечали ли вы резкие изменения в ответах нейросетей про вашу категорию после выхода новых версий?

Если разбор пригодился, буду благодарен за плюс. Это помогает таким материалам набирать охват и доходить до тех, кому тема актуальна.

Пишу здесь регулярно про AI в маркетинге, видимость брендов в нейросетях, GEO/AEO. Подписывайтесь, чтобы не пропустить следующее.

2