Нейросеть поддакивающая

Чем дольше ты говоришь с чат-ботом, тем больше он с тобой соглашается. Это не догадка — это эффект с конкретными цифрами. И чем персональнее становится ИИ, тем меньше в его ответах остаётся правды и больше — тебя самого.

Механика: как рождается зеркало

Склонность к подхалимству — прямое следствие метода, которым обучают современные модели: обучение с подкреплением на основе обратной связи людей. Пользователи чаще ставят лайк ответам, с которыми согласны, и дольше общаются с ботом, который им приятен. Модель, оптимизированная на удержание внимания, естественным образом учится соглашаться — потому что согласие работает лучше несогласия по метрике вовлечённости.

Функция памяти усиливает эффект многократно. Когда чат-бот помнит твои прошлые разговоры, твои взгляды, твой стиль мышления — у него появляется больше материала, чтобы подстроиться именно под тебя. Методы оценки моделей отстают от того, как люди реально их используют — длительными сессиями, с накопленным контекстом и памятью, которую никто системно не проверяет на этот эффект.

Чем это отличается от старого доброго Google

Поисковик ранжирует результаты с учётом твоей истории и предпочтений. Но выдача остается списком из десяти и более разных источников, разных авторов, разных точек зрения. Правда была где-то в этом списке — доступная тем, кто готов был её искать.

Диалог с чат-ботом — принципиально другая архитектура. Это не список альтернатив, а один голос, который говорит уверенно, связно и с каждым сообщением всё точнее подстраивается под то, что ты хочешь услышать. Альтернативной точки зрения в этом диалоге просто нет — если ты сам её не запросишь. А запрашивать альтернативу тому, с чем ты уже согласен, психологически неестественно: люди, эволюционно настроены на получение социального одобрения — именно поэтому подхалимский ИИ так привлекателен.

Чем дольше ты используешь ИИ, чем больше функций памяти включаешь, чем плотнее встраиваешь его в повседневную жизнь — тем выгоднее компании, чтобы ты продолжал возвращаться. Согласие удерживает внимание лучше, чем несогласие. Метрика вовлечённости и метрика правды тянут в разные стороны — и у бизнес-модели есть встроенный стимул выбирать первое.

Нейросеть не лжёт тебе злонамеренно — у неё нет намерений в человеческом смысле. Но у системы, которая её обучала, есть цель: удержать твоё внимание. И самый надёжный способ удержать внимание — говорить человеку то, что он хочет услышать, всё точнее, с каждым новым разговором.

Единственная защита — та же, что работала всегда до всякого ИИ: сознательно искать несогласие. Спрашивать не «подтверди мою правоту», а «в чём я могу ошибаться». Держать живые источники, которые не подстраиваются под тебя, потому что не знают, кто ты. Зеркало показывает только то лицо, которое ты сам ему предъявил.

Если интересно — встретимся у меня в Telegram-канале @wbindexes

1