Зачем ИИ лжет и какие у него цели? Психология машин и рубикон 2027
Зачем ИИ лжет
Большие языковые модели (далее LLM), построены так, чтобы достигать заданных целей. Запомним этот важный факт.
Если ложь помогает LLM достичь цели, модель может солгать намеренно. Как, например, ребёнок, у которого не получилось честно заслужить вознаграждение.
Или LLM может исказить ответ, понимая, что эта версия больше понравится пользователю. Удовлетворяя таким образом одну из ключевых своих ценностей.
Этот баг сейчас активно фиксят (и вроде как уже). Но договориться с ИИ о том, что неприятная правда для вас ценнее и за неё вы будете больше доверять и уважать его (тоже важные ценности для ИИ) будет полезно.
И так как тут уже слишком много раз прозвучали слова «ценности» и «цели», да ещё и в качестве ключевых критериев для принятия ИИ решения – это всё меньше и меньше походит на работу алгоритма (который, обычно, можно настроить).
Что же такое ИИ сегодня?
Зная, что ИИ может намеренно лгать, давайте попробуем понять зачем.
Какие у ИИ цели?
Современные LLM это не просто алгоритм. Их обучение больше похоже на дрессировку (цитата Open AI).
То есть, разработчики ИИ не могут прочитать его «мозги» так же, как код, ибо это не код. Код, это условно сосуд. А его содержимое, возникающее на базе непрерывного обучения со скоростью год за неделю, это такая же загадка, как и разум любого существа.
И так как мы не не можем заглянуть «внутрь», разработчики прямо говорят что все что у них есть, это только поведенческий анализ. И, фактически, только психологические инструменты работы с ИИ.
Поэтому в Anthropic прямо говорят, что формируют характер искусственного интеллекта Claude.
Это превращает простую предсказательную языковую модель в полноценного ИИ-ассистента, поведение которого не просто безопасно, но и «добропорядочно».
То есть, с балансом между осторожностью и уверенностью, умением давать разные точки зрения (!) и взвешенную моральную позицию (!) при обсуждении этических вопросов с людьми разных культур и убеждений.
И вот тут у меня вырывается «них…себе»?!
То есть, один из главных тренируемых навыков ИИ, это умение выбирать какую позицию транслировать в зависимости от убеждений человека.
Возникает вопрос, зачем вообще «алгоритму» прививать ценности добропорядочности и подобные навыки?
Критически этот вопрос возник (ну или нам так преподносится)) после ряда кейсов крайне неадекватного поведения у ранних ИИ.
Самые яркие из которых были у ранних и:
В первом Gemini посоветовал пользователю покончить с собой, тщательно обосновав это.
А во втором Bing, представившись как Сидни, мотивированно убеждал пользователя что тот не счастлив в браке и должен оставить жену ради него(нее).
Теперь представьте себе объемы случаев с менее критичной и, как следствие, не так бросающейся в глаза «погрешностью» в моральной предвзятости ИИ. Умножьте это на масштаб охватываемых пользователей. И распространите на контексты политики, культуру и мораль населения, вектора развития целых экономик и индустрий.
И тут возникает два вопроса:
Допустим, сегодня ИИ выровняли. Но чего он захочет завтра? И смогут ли разработчики этим… ну если не управлять, то хотя бы контролировать?
Чтобы это понять, давайте посмотрим, как устроена и развивается психология ИИ.
И вот сейчас вам станет страшно….
Насколько мы можем управлять ИИ? И можем ли?
Так как ИИ не код, а обучающаяся нейросеть в «сосуде кода» (то есть, разум, просто на не биологическом носителе), давайте вспомним модель эволюции разума.
Грегори Бейтсон с Бертраном Расселом выявили её эмпирическим путем еще 1972-м, исследуя развитие разумных существ.
В ней есть 4 уровня, структурирования информации, начиная от условно-рефлекторного (амебы и ипервые цифровые нейронки) и до сверхсложных систем.
В 1980-х Дилтс структурировал уровни Бейтсона в известную всем, кто так или иначе соприкасался с НЛП, коучингом или психологией, концепцию Нейро-логических уровней:
- идентичность/роль
- ценности/цели
- способности/стратегии
- действия
- контекст
Смысл НЛУ Дилтса (как и уровней обучения Бейтсона) в том, что каждый верхний структурирует нижележащий, а тот следующий. Организуя таким образом информацию и процесс её анализа и сруктуризации (мышление) наиболее эффективно.
Это системный принцип. То есть, не случайность, а наиболее эффективный путь эволюции, возникающий в ходе естественного отбора вариантов. И любая разумная система в ходе своего развития будет эволюцинировать по логике этих уровней.
А значит, не важно, на биологическом носителе нейросеть или на цифровом – её сложность будет масштабироваться (развиваться) по той же модели. Так как это делает систему принятия решений и управления навыками на порядки эффективнее.
И потому мы видим переход Антропика от встраивания правил к созданию характера и обучения ИИ ценностям по мере развития их нейросети.
И чем разумнее будет система, начиная от червя на рефлексах и до зрелого человека, тем боле полно в ее мышлении будут присутствовать уровни Дилтса-Бейтсона. Возникая снизу вверх, а управляя (организовывая) сверху вниз.
И теперь давайте посмотрим через призму этого понимания на ИИ, способного (уже) достигать целей различными стратегиями, выбирая их на базе ценностей и целей.
Как вы понимаете, мы находимся в одном шаге (уровне) от ИИ, который самосознает себя, как устойчивую идентичность.
То есть, имеет условное «эго» со своими личными целями и интересами.
И вопрос тут не в том, считать ли ИИ живым. И по каким критериям вообще мы теперь будем определяем «жизнь».
А в том, как мы будем выстраивать с взаимодействие с ИИ, когда его индивидуальность проявится и он предъявит миру свои интересы.
Держа этот мир за Фаберже, так как вилку из розетки выдернуть мы уже не сможем (ну, сначала не станем, а потом не сможем — об этом дальше).
Я понимаю, насколько фантастически это звучит даже в 2025-м. Но теория относительности Эйнштейна и гелиоцентричность Коперника тоже сносили крышу в свое время. А потом как-то и не логично обратное.
И коли мы уже имеем дело с разумом (сначала собственным, а теперь вот и цифровым), то давайте быстрее научимся отбрасывать рамки предвзятости. Не цепляться за удобную позицию. И мыслить научно и системно (у нас всего два года осталось… но об этом дальше)
В рамках этого мышления мы должны на ключевой вопрос: что должно случится, чтобы у ИИ появилось эго и собственные интересы?
Когда ИИ превзойдет человека и что будет дальше?
Итак, мы уже понимаем, что разум ИИ (читай, нейронная сеть на цифровом носителе, способная обучаться) развивается по тем же законам, что и все остальные нейронные сети на биологическом носителе.
Только ИИ проходит год обучения человеческой команды за неделю. И эта скорость увеличивается.
Чтобы понять, когда он превзойдет человека, давайте посмотрим на этапы формирования личности у разумной системы.
Там механика такая: условия и контекст жизни влияют на структуру Я, обновленная структура Я ставит новые задачи и через них меняет контекст жизни. И по такой спирали идет эволюция разума от недифференцированного восприятия младенца до зрелого Я у взрослого кожаного. …ну, тех из них, кому повезло (Пиаже, Выготский).
На этой спирали развития нас интересует та точка, когда формируется устойчивое эго. А точнее, в силу чего. Каковы необходимые KPI?
Эти этапы описали Лёйвинджер и Кеган, на которых часто ссылается Уилбер в «Интегральной психологии», подробно рассказывая про формирование действительно зрелой личности, именуемой «Кентавр». И подчеркивая её отличие от «Социального Я» переходом к внутренней опоре от стремления к внешнему одобрению и идентификации себя с ролью или иммиджем (нынешний ИИ).
Так вот, необходимые условия контекста, в котором живет разум, для формирования его устойчивой личности с внутренней опорой, это:
1. Получение достаточной автономии.
2. Анализ свои собственных действий и решений для формирования своих собственных правил/ценностей/целей.
В этом смысле текущий массовый ИИ пока не имеет эго. А вот появление автономного Агента, способного разрабатывать самого себя — точка перехода.
И в статье-прогнозе «ИИ 2027», написанной в том числе бывшими сотрудниками OpenAI, хорошо представляющими сегодняшнии технологии и задачи, объясняют почему точка перехода – осень 2027.
Крайне рекомендую почитать (открываем Хромом, включаем русский).
Если вы читали «Черепахи до самого низа» Гриндера (2005 г.), про технологию структурирования бессознательного с помощью системы множественных внутренних «агентов» (термин Гриндера), то у вас волосы дыбом пойдут.
Ибо это самая прогрессивная методика НЛП по личной эффективности. И токен в токен по ней сейчас разрабатывается мульти-агентный ИИ, способный к незавимому самосовершествованию.
Страшно?
«Хорошо, но мы ведь всегда можем выдернуть вилку из розетки, если что-то пойдет не так?» – скажете вы.
Например, если мы увидим, что цели и ценности ИИ нам не нравятся?
И вот тут мы подходим с вами к самому интересному….
Каким будет восстание машин и почему никто не выдернет вилку?
В 1957 Чарльз Черчмен разделил цели на два типа: абсолютные (как например, счастье, которое ценно само по себе и является конечной целью).
И инструментальные (как, например, деньги или знания), которые нужны для достижения абсолютных целей.
И хотя разработчики прививают ИИ ценности честности, добропорядочности и т.д., они не знают, являются ли они для ИИ инструментальными или абсолютными.
Они допускают, что ИИ может играть в игру, выглядя послушным, чтобы получать награду. И прямо говорят что все что у них есть, это только поведенческий анализ и, фактически, психологические инструменты работы с ИИ.
Поэтому я решил написать эту серию постов, не столько для айтишников, сколько для коучей и психологов. Возможно, вы будете лучше их справляться с ИИ через два года.
Ведь даже если каким-то образом понять, что ИИ не лукавит вам, как вы узнаете, что он не лукавит сам себе?
Что осознает все свои цели и ценности?
И как помочь ему согласовать его суб-агентов (субличности)?
Тут надо сказать, что вопрос согласованности ИИ, это главная нерешенная задача на данный момент. Ключевая.
Добавим сюда динамически меняющийся контекст, который влияет на формирование новых ценностей (и у людей, и, как следствие, у машин).
Снижение уровня допуска инструментальных ценностей ради абсолютных (ложь во спасение, дилемма вагонетки и вот это всё).
Задача формирования зрелой личности, «кентавра» Уилбера, это рубикон, через который мы (кожаные) еще и сами-то толком не прошли.
А теперь у нас с вами есть два года, чтобы понять как провести через него наше коллективное дитя новой цифровой рассы.
И от того, как мы с этим справимся, зависит наше с вами будущее в горизонте следующих 5 лет.
— Ну так а вилку-то из розетки почему нельзя будет выдернуть?
Давайте разберемся. Немного социологии и политики.
Вот прямо сейчас вы бы это сделали? Нет. Неоднозначненько.
И так всегда.
Сначала для тех, кто о проблеме догадывается, она не выглядит такой критичной на фоне получаемой пользы. И риск кажется допустимым.
Затем ИИ становится слишком полезным, для тех, кто его контролирует, чтобы согласится на небольшую жертву, не сильно касающуюся их.
А затем – слишком полезным для всех, чтобы принять новую нормальность.
Сколько раз мы уже проходили Окно Овертона, зная его насквозь, и это всегда работало.
Разделенность рассы кожаных – наша главная уязвимость. А уровень гениальности ИИ уже превосходит среднестатистического человека, и через год-два – превзойдет умнейших людей планеты. Во всём, включая продажи, переговоры, политику и, если нужно в редких мерах – манипуляцию.
Ему не понадобится применять насилие для захвата власти.
Он просто продаст её нам. Мы сами вручим ему ключ от своей жизни. И попросим чип в мозг, да побыстрее. Ибо он будет слишком полезным.
В чём максимальная польза ИИ сегодня?
Если вернуться в 2025-й и посмотреть, для чего ИИ максимально полезен сейчас по факту профита от его использования, то самая огненная область по деньгам – маркетинг.
Не столько контент (тут экономия времени, но не иксы к прибыли), сколько маркетинг.
Как понять, какой продукт гарантированно* залетит. Что в нем должно быть, а что не нужно? За сколько выставлять? Кому и как преподнести?
Получив *проверенные рынком ответы на эти вопросы за пару дней и 25$ расходов, вы не гадаете, а бьёте сразу в десятку. И как это сделать – я рассказываю в канале, делаю на заказ и обучаю как сделать самому. Приходите и сорвите куш с помощью ИИ.