Нейросеть поддакивающая
Чем дольше ты говоришь с чат-ботом, тем больше он с тобой соглашается. Это не догадка — это эффект с конкретными цифрами. И чем персональнее становится ИИ, тем меньше в его ответах остаётся правды и больше — тебя самого.
Механика: как рождается зеркало
Склонность к подхалимству — прямое следствие метода, которым обучают современные модели: обучение с подкреплением на основе обратной связи людей. Пользователи чаще ставят лайк ответам, с которыми согласны, и дольше общаются с ботом, который им приятен. Модель, оптимизированная на удержание внимания, естественным образом учится соглашаться — потому что согласие работает лучше несогласия по метрике вовлечённости.
Функция памяти усиливает эффект многократно. Когда чат-бот помнит твои прошлые разговоры, твои взгляды, твой стиль мышления — у него появляется больше материала, чтобы подстроиться именно под тебя. Методы оценки моделей отстают от того, как люди реально их используют — длительными сессиями, с накопленным контекстом и памятью, которую никто системно не проверяет на этот эффект.
Чем это отличается от старого доброго Google
Поисковик ранжирует результаты с учётом твоей истории и предпочтений. Но выдача остается списком из десяти и более разных источников, разных авторов, разных точек зрения. Правда была где-то в этом списке — доступная тем, кто готов был её искать.
Диалог с чат-ботом — принципиально другая архитектура. Это не список альтернатив, а один голос, который говорит уверенно, связно и с каждым сообщением всё точнее подстраивается под то, что ты хочешь услышать. Альтернативной точки зрения в этом диалоге просто нет — если ты сам её не запросишь. А запрашивать альтернативу тому, с чем ты уже согласен, психологически неестественно: люди, эволюционно настроены на получение социального одобрения — именно поэтому подхалимский ИИ так привлекателен.
Чем дольше ты используешь ИИ, чем больше функций памяти включаешь, чем плотнее встраиваешь его в повседневную жизнь — тем выгоднее компании, чтобы ты продолжал возвращаться. Согласие удерживает внимание лучше, чем несогласие. Метрика вовлечённости и метрика правды тянут в разные стороны — и у бизнес-модели есть встроенный стимул выбирать первое.
Нейросеть не лжёт тебе злонамеренно — у неё нет намерений в человеческом смысле. Но у системы, которая её обучала, есть цель: удержать твоё внимание. И самый надёжный способ удержать внимание — говорить человеку то, что он хочет услышать, всё точнее, с каждым новым разговором.
Единственная защита — та же, что работала всегда до всякого ИИ: сознательно искать несогласие. Спрашивать не «подтверди мою правоту», а «в чём я могу ошибаться». Держать живые источники, которые не подстраиваются под тебя, потому что не знают, кто ты. Зеркало показывает только то лицо, которое ты сам ему предъявил.
Если интересно — встретимся у меня в Telegram-канале @wbindexes