Сначала нейросети отвечали на вопросы. Теперь они решают, что нам показать
1 октября Яндекс показал Sona: одну генеративную модель вместо каскада из пятнадцати алгоритмов, которые раньше собирали рекомендации. Прочитал анонс и первым делом полез смотреть, можно ли это проверить так же, как я обычно проверяю ответы нейросетей. Выяснилось, что нельзя. И это оказалось интереснее самого анонса.
Что показал Яндекс
Если убрать формулировки пресс-релиза, остаётся вот что.
- Одна генеративная модель заменила каскад из пятнадцати рекомендательных моделей: она же подбирает кандидатов, она же ранжирует.
- Ручной подбор признаков не нужен. Модель читает последовательность действий: что человек выбрал, что отклонил, к чему вернулся.
- Первым сервисом для теста стали музыкальные рекомендации в умных колонках с Алисой.
- Прирост: время прослушивания рекомендованных треков +6,3%, просьбы повторить трек почти +18%, активных слушателей +4,5%, то есть в 2,4 раза сильнее, чем после предыдущего обновления.
Цифры внутренние, их дал сам Яндекс, независимой проверки нет. Сами по себе они говорят только то, что модель угадывает музыку точнее предыдущей схемы. Это обычная история про качество рекомендаций, и в ней ничего нового бы не было. Подробности в анонсе Яндекса.
Вопрос, который я себе задал
У меня есть привычная процедура. Беру набор запросов, прогоняю их через несколько моделей, смотрю, какие бренды называются и на какие источники модель ссылается. Прогоны и сравнение замеров я собираю в brandfound: там же видно, какие источники появились или исчезли между двумя датами. Так проверяется почти любое изменение в AI-поиске: не на словах вендора, а на выдаче.
С Sona эта процедура не запускается вообще. Не потому что модель закрытая, а потому что мерить нечего: в рекомендациях нет запроса, который можно повторить. Тут я и понял, что всё это время мысленно складывал в одну полку две разные вещи.
AI-поиск: запрос есть, значит есть и замер
- Человек формулирует потребность словами, и эту формулировку можно воспроизвести сто раз.
- Модель собирает ответ из текстов, у которых есть авторы и адреса, поэтому видно, кого она читала.
- Повлиять можно контентом: публикацией, обзором, сравнением, упоминанием там, куда модель ходит.
- Результат измерим снаружи: доля ответов с упоминанием бренда, набор источников, позиция в ответе. Повторил через неделю, сравнил, увидел динамику.
AI-рекомендации: запроса нет, и замерять нечего
- Формулировки не существует. Человек открыл ленту или сказал «включи музыку», дальше модель решает сама.
- Сырьё для неё это поведение: клики, отказы, возвраты, дослушивания. Текстов и источников в этом решении нет.
- Снаружи не видно ничего: ни запроса, ни источников, ни причины. Повторить замер невозможно, потому что повторять нечего.
В поиске бренд борется за место в ответе. В рекомендациях он борется за место в наборе вариантов, которого никто не просил.
Что здесь общее и почему это шире одной модели
Общее то, что оба контура сокращают выбор до нескольких позиций, и делает это модель. Раньше человек видел длинный список и выбирал сам, а работа маркетолога состояла в том, чтобы в этот список попасть. Теперь длинного списка человек не видит. Он видит короткий, и собрал его алгоритм, который не объясняет своего решения.
Из этого вытекает неприятное свойство: невидимость перестала быть заметной. Если бренд выпал из ответов нейросети или из рекомендательной ленты, в отчётах не появится строка «нас не показали». Трафик просто не придёт. Падение позиций в поиске видно, а отсутствие в наборе вариантов нет, и это разные задачи.
И поведение людей от этого меняется не одинаково. В поиске человек всё ещё формулирует потребность, и бренд может встроиться в ответ. В рекомендациях потребность формулирует за него модель, и бренду остаётся только продукт и отклик на него.
Что я поменял в своей работе после этого анонса
- 1. Перестал смешивать два контура в одном отчёте. Поисковый контур это упоминания, источники и тексты. Рекомендательный это карточка, фид и поведение. Одной тактикой они не закрываются, и сравнивать их цифры бессмысленно.
- 2. Сценарные запросы вместо ключевых слов. У нейросети спрашивают «что выбрать для такой задачи», а не «купить категория Москва». Замер по ключевикам показывает не то, что происходит в реальных диалогах.
- 3. Отдельно смотрю категории с нулём упоминаний. Ноль это не слабый показатель, а отсутствие в наборе вариантов. Такое не лечится усилением того, что уже работает.
- 4. Для рекомендательного контура завёл другую табличку: полнота карточек, корректность фида, доля отказов и возвратов. Это единственное, что модель про товар действительно видит.
Где я могу ошибаться
- Sona показана только на музыке. Что та же схема приедет в товарные и контентные ленты, я считаю вероятным, но это моя догадка, а не факт из анонса.
- Цифры прироста от вендора. Я бы не строил на них выводов, кроме «у них получилось лучше, чем раньше».
- Инструменты вроде brandfound, PixelTools, GeoRank, включая тот, которым пользуюсь я, измеряют поисковый контур, где есть повторяемый запрос.
- Часть рекомендаций останется на классических алгоритмах: генеративная модель дороже в эксплуатации, и ставить её везде никто не обещал.
Коротко, вопросами
Можно ли попасть в рекомендации публикациями?
Нет. Публикации работают в поисковом контуре, где модель ищет источники. Рекомендательная модель читает поведение, а не статьи.
Чем тогда мерить присутствие в нейросетях?
Повторяемыми сценарными запросами к нескольким моделям и долей ответов, где бренд называют. Метод грубый, зато воспроизводимый: через неделю можно прогнать то же самое и сравнить.
Что сделать прямо сейчас?
Проверить, называют ли вас модели в ваших же категориях. Если в половине сценариев вас нет, задача не в просадке, а в отсутствии, и начинать нужно с фактуры о себе в том виде, который легко перенести в ответ.
Мне интересно мнение тех, кто ведёт карточки: вы уже видите, что ассистенты и ленты гонят другой спрос, или пока это не отличается от обычного алгоритмического трафика?