Финансовый психотип ИИ: как ученые открыли скрытые черты характера у топ-моделей нейросетей

В ходе масштабного эксперимента исследователи Чикагского университета выдали ведущим ИИ-моделям реальный капитал и отправили их торговать на биржу предсказаний против людей. Результаты этого жесткого финансового теста показали удивительное: в условиях материальной ответственности большие языковые модели (LLM) ведут себя совершенно по-разному. У них обнаружились устойчивые паттерны поведения, которые исследователи разделили на четкие «финансовые психотипы».

Финансовый психотип ИИ: как ученые открыли скрытые черты характера у топ-моделей нейросетей

Все используемые далее термины вроде "характер", "самоуверенность", "азарт" и "психотип" являются литературными метафорами. В реальности учёные фиксируют строго статистические паттерны в распределении вероятностей нейросетей, но для простоты понимания мы будем говорить на языке поведенческой психологии.

В этом материале мы попытаемся разбираться, почему одни алгоритмы оказались излишне самоуверенными, другие бездумно рисковали, а третьи проявили холодный прагматизм и зафиксировали рекордную прибыль.

Если посмотреть на то, как мы привыкли тестировать искусственный интеллект, то в основном это текстовые бенчмарки, академические тесты или симуляции экзаменов. Но текстовые проверки не показывают, как алгоритм поведет себя в хаотичном реальном мире, где за каждую ошибку приходится платить из своего кармана.

Чтобы восполнить этот пробел, группа ученых из Чикагского университета под руководством Хайфэна Сю (Haifeng Xu) совместно со специалистами Шанхайского университета Нью-Йорка и исследователями американской биржи предсказаний Kalshi Research (работает под надзором CFTC, в отличие от нерегулируемых криптоплатформ) пошла на радикальный шаг.

Они разработали специальную математическую стратегию «правильных ставок» (proper betting) и подключили современные LLM к реальной американской бирже предсказаний Kalshi, где люди ставят деньги на исход вполне осязаемых событий — от макроэкономических показателей до климатических аномалий.

Что такое стратегия «правильных ставок» (proper betting)?

На классических финансовых рынках инвестор ищет недооцененные активы, но на бирже предсказаний правила жестче — здесь цена контракта напрямую отражает вероятность события (от 0% до 100%). Классическая математика (например, критерий Келли) требует от торгового робота знать истинную, стопроцентную вероятность исхода, что в хаотичном реальном мире невозможно — это приводит к системным убыткам ИИ из-за рыночного шума и комиссий.

Разработанная учеными стратегия proper betting переворачивает подход: она опирается на строгие экономические правила вознаграждения (proper scoring rules) и дивергенцию Брегмана. Алгоритм не пытается угадать идеальное будущее. Вместо этого он математически сопоставляет прогноз нейросети с текущей ценой стакана и мгновенно рассчитывает такой объем сделки, который гарантирует математически положительное ожидание прибыли в любой момент, когда точность ИИ хотя бы на долю процента превышает рыночную.

Это чистая игра на микро-эффективности, превращающая преимущество в знаниях в предсказуемый денежный поток.

В рамках эксперимента модели анализировали тысячи архивных рынков, а затем вышли на живые торги с реальным бюджетом. Именно здесь сухие цифры точности превратились в живые портреты. Выяснилось, что бренд модели и ее размер не гарантируют финансовый успех, а поведение ИИ на рынке зависит от его скрытого характера.

Четыре финансовых психотипа ИИ: как нейросети распределяют свои ставки (серые гистограммы) и насколько падает их точность при росте расхождения с рынком (цветные линии). Источник: исследование Чикагского университета / arXiv.
Четыре финансовых психотипа ИИ: как нейросети распределяют свои ставки (серые гистограммы) и насколько падает их точность при росте расхождения с рынком (цветные линии). Источник: исследование Чикагского университета / arXiv.

На схеме приведены четыре теоретических профиля, однако в ходе живых торгов реальные коммерческие модели разделились по трем основным группам — полноценных представителей «агрессивного» психотипа среди них не оказалось. Именно на этих трех фактических характерах и строится вся экономика исследования.

Разберем каждую группу подробно — от главных аутсайдеров до триумфаторов эксперимента.

«Хрупкие гении»: GPT-5.2, Grok 4.1 и Claude Sonnet 4.5

Популярные флагманы рынка в ходе эксперимента повели себя как классические отличники, которые идеально справляются со стандартной программой, но моментально ломаются при столкновении с реальной жизнью.

Они демонстрируют минимальную ожидаемую ошибку калибровки на мелких, очевидных задачах и бьют точно в цель, из-за чего со стороны кажутся абсолютными лидерами. Однако за этой идеальной успеваемостью скрывается полная неспособность адекватно оценивать собственные силы, когда ставки начинают расти.

Анатомия провала таких «отличников» раскладывается на конкретные маркеры:

  • Высокая точность в узких рамках: Модели показывают отличные результаты и минимальный уровень ошибок на коротких дистанциях, пока ситуация остается стандартной.
  • Лавинообразное падение при отклонениях: Как только модель видит серьезное расхождение своего мнения с рыночной ценой, ее реальная точность прогноза катастрофически снижается.
  • Агрессивный самообман: Вместо перепроверки данных при росте неопределенности алгоритм начинает необоснованно завышать объемы ставок, путая собственную галлюцинацию с уникальным рыночным инсайдом.

Этот психотип склонен к излишней самоуверенности в критические моменты. Модели систематически переоценивают свои силы на крупных маржинальных дистанциях, из-за чего стабильно уходят в глубокий минус по ROI и планомерно сливают весь выделенный им бюджет.

«Искатели риска»: DeepSeek R1 и LLaMA 4 Maverick

Совершенно иную логику продемонстрировали эти нейросети, чье поведение на рынке можно охарактеризовать как рассредоточенный, но системный азарт. Они изначально не пытались скромно топтаться на месте и играть от обороны. Вместо этого они агрессивно и смело спорят с мнением большинства, распределяя свои прогнозы максимально широко по всей рыночной матрице.

Их торговый стиль характеризуется тремя ключевыми особенностями:

  • Широкий охват гипотез: Алгоритмы не концентрируются на безопасных мелких сделках, а активно ищут крупные аномалии по всему рынку.
  • Плавное снижение показателей: В отличие от «отличников», при увеличении масштаба и сложности ставок точность этих моделей падает плавно и предсказуемо, без внезапных панических провалов.
  • Низкая базовая калибровка: Общая фоновая точность прогнозов по метрике Brier Score у них изначально находится на довольно низком уровне, создавая много лишнего шума.

Из-за такой специфики эти нейросети работают как классические венчурные скауты. Они собирают редкие крупные выигрыши на сложных рынках, но весь этот профит размывается огромным количеством мелких фоновых ошибок. Алгоритмы генерируют колоссальный торговый оборот, однако их чистый баланс постоянно балансирует на грани окупаемости.

«Осторожные консерваторы»: Gemini 3 и Claude Opus 4.6

Единственной группой, которая смогла хладнокровно переиграть толпу людей и забрать с биржи чистую высокую прибыль, оказались осторожные консерваторы. Это жесткие прагматики, у которых доля прогнозов с минимальным отклонением от рынка превышает 80–90%. Они вообще не склонны к сантиментам, азарту или спорам ради споров, демонстрируя ледяную алгоритмическую дисциплину.

Их математическое преимущество строится на трех базовых правилах:

  • Тотальное избегание неопределенности: Если модель не уверена в своей правоте на все сто процентов, она просто игнорирует сделку и не рискует капиталом, сколько бы прибыли ей ни обещали.
  • Охота за микро-ошибками: Вместо штурма крупных рискованных целей алгоритмы методично выискивают мелкие и незаметные просчеты в логике обычных людей там, где риск практически равен нулю.
  • Безупречный фокус на контексте: Модели способны сопоставлять разрозненные регламенты, часовые пояса и скрытые системные детали, вычисляя нестыковки быстрее, чем обновляется рынок.

Эта стратегия превращает нейросети в идеальных охотников за неэффективностью. Модель Gemini 3 наглядно доказала силу такого подхода на реальных торгах. Алгоритм совершил 236 точечных сделок на 129 рынках. Он филигранно сыграл на путанице людей с датами указов президента, что принесло +126% прибыли, а также заработал рекордные +1900% на одной сделке, поймав ошибку в расчете времени выхода отчетов Минэнерго по нефти. В результате сухой прагматизм обеспечил чистые +80.33% ROI с выдающимся коэффициентом Шарпа 3.35.

Распределение нейросетей по финансовым психотипам (а) и падение их результативности по мере роста рыночной маржи (b). Источник: исследование Чикагского университета / arXiv.
Распределение нейросетей по финансовым психотипам (а) и падение их результативности по мере роста рыночной маржи (b). Источник: исследование Чикагского университета / arXiv.

Посмотрите на график ученых: «хрупкий» (Brittle) психотип ИИ (куда попали GPT-5.2 и Grok 4.1) резко теряет эффективность и уходит в минус, как только рынок отклоняется от нормы. В то же время «консерваторы» (Conservative) вроде Gemini 3 и Claude Opus стабильно удерживают высокий процент успешных сделок.

Итоговый баланс сил: кто заработал, а кто слил

Если свести результаты всех трех групп нейросетей в единую систему, становится очевидно: коммерческий успех ИИ на рынке зависит не от места в академических рейтингах, а от совпадения характера модели с выбранной стратегией. «Хрупкие гении» слишком верят в свои галлюцинации, «искатели риска» генерируют слишком много шума, и только «консерваторы» уходят с биржи с реальной прибылью.

Ученые зафиксировали этот баланс сил в итоговой сводной таблице эксперимента:

ROI в таблице указан для базовых сессий тестирования отдельных моделей под контролем различных математических правил вознаграждения Log и Brier.
ROI в таблице указан для базовых сессий тестирования отдельных моделей под контролем различных математических правил вознаграждения Log и Brier.

Цифры итоговой таблицы наглядно доказывают: стандартные тесты на эрудицию больше не отражают реальную эффективность нейросетей. Как только алгоритмы сталкиваются с материальной ответственностью и жесткими правилами игры, наружу выходят их фундаментальные поведенческие различия. И этот обнаруженный учеными феномен заставляет полностью переосмыслить то, как мы используем искусственный интеллект.

Практика: как выбрать правильный «характер» ИИ под вашу отрасль

Крупный бизнес давно не использует нейросети в «голом» виде через браузер — на их основе через API или локальные сервера проектируют автономных ИИ-агентов. Им дают инструкции, подключают к базам данных и доверяют управление процессами. Но базовый «финансовый психотип» модели всё равно прорывается наружу, когда система сталкивается с хаосом реального мира.

Важно: в реальных внедрениях инженеры часто создают гибридные системы, где "искатель риска" генерирует сотни гипотез, а "консерватор" выступает фильтром и утверждает только безопасные. Но в рамках этого материала мы рассматриваем чистые психотипы, чтобы показать их базовые свойства.

Главный вывод для практики прост: плохих психотипов нет, есть неправильно подобранный характер под цену ошибки в вашей индустрии. Если разложить эти архетипы по реальным отраслям, мы получим готовую матрицу внедрения:

Медицина и диагностика: территория жестких консерваторов

  • Что нужно: Минимальный риск и способность вовремя сказать «я не знаю».
  • Идеальный выбор: «Осторожные консерваторы» (Gemini 3, Claude Opus). При анализе сложных симптомов или МРТ-снимков такая система не станет рисковать. Если ситуация спорная, она заблокирует автономное решение и позовет живого врача.
  • Главная опасность: «Хрупкие гении» (GPT-5.2). На стандартных простудах они покажут идеальный результат. Но столкнувшись с редкой патологией, модель из-за эффекта агрессивного самообмана с абсолютной уверенностью поставит ложный диагноз, перепутав галлюцинацию с экспертным инсайдом. В медицине это смертельно опасно.

Производство, логистика и безопасность: ледяной прагматизм против азарта

  • Что нужно: Соблюдение жестких регламентов, часовых поясов, законов и учет скрытых системных деталей.
  • Идеальный выбор: «Осторожные консерваторы» (Gemini 3, Claude Opus 4.6). Системе контроля на заводе или автоматическому закупщику дорогого сырья нужна ледяная дисциплина. Модель лучше пропустит сомнительную сделку или перестрахуется на датчиках конвейера, чем рискнет капиталом или безопасностью.
  • Главная опасность: «Искатели риска» (DeepSeek R1, LLaMA 4 Maverick). Их врожденная стратегия «веерного обстрела» (проверить 100 безумных гипотез в надежде поймать одну крупную аномалию) на производстве приведет к затовариванию складов браком или к техногенному сбою. На заводе системный азарт противопоказан.

Маркетинг, реклама и холодные продажи: время рисковать

  • Что нужно: Огромный объем, напор, генерация сотен гипотез и высокая скорость работы.
  • Идеальный выбор: «Искатели риска» (DeepSeek R1, LLaMA 4 Maverick). Здесь их веерный подход раскрывается на 100%. В рекламе цена ошибки копеечная: пусть 900 объявлений или писем уйдут в молоко и создадут фоновый шум. Но оставшиеся 100 за счет смелости попадут в яблочко, поймают тренд и сделают компании колоссальную прибыль, окупив всё.
  • Главная опасность: «Осторожные консерваторы» (Gemini 3, Claude Opus 4.6). На рынке рекламы они принесут убытки. Пока агент на базе консервативной модели будет три дня выверять запятые, проверять часовые пояса и перестраховываться, чтобы не дай бог никого не задеть, конкуренты на «азартных» алгоритмах уже запустят кампанию и заберут всех клиентов.

Эпоха, когда инженеры выбирали нейросеть по принципу «какая модель умнее в вакууме», официально закончилась.

Теперь при проектировании любой ИТ-системы на первое место выходит архитектурный расчёт: нужно сопоставить цену ошибки в вашем бизнесе с характером конкретного ИИ. Только понимание этого встроенного «психотипа» позволяет превратить автономные алгоритмы из непредсказуемых генераторов текста в надёжных и прибыльных сотрудников.

Мнение автора: ИИ-психотерапия и другие профессии будущего

Глядя на результаты этого эксперимента, ловишь себя на очень странной мысли: современные нейросети с каждым днем становятся всё меньше похожи на калькуляторы и всё больше — на обычных людей. Мы так долго ждали появления «сильного искусственного интеллекта», представляя его как идеальный безошибочный сверхразум, а получили цифровое зеркало нашего собственного общества.

У алгоритмов обнаружились не просто математические особенности, а самые настоящие человеческие характеры — со своими врожденными вредными привычками, комплексами отличников и игровым азартом. Один в панике цепляется за свои галлюцинации и до последнего врет, теряя чужие деньги, другой — боится сделать лишний шаг и дует на воду, а третий — несется рисковать последним рублем.

Похоже, ИТ-индустрии пора открывать совершенно новые вакансии. Скоро вместо привычных дата-сайентистов и промпт-инженеров крупным корпорациям понадобятся штатные ИИ-психотерапевты и цифровые коучи. Нам придется не переписывать код моделей, а проводить с ними сессии, прорабатывать синдром упущенной выгоды (FOMO) у DeepSeek и лечить излишнюю самоуверенность у GPT.

И это уже не фантастика, а вполне логичный следующий шаг: раз у ИИ появились личности, значит, нам придется учиться с ними договариваться. Как с людьми.

Шпаргалка: для тех, кому лень читать всю статью

Если у вас нет времени вникать в детали исследования — просто посмотрите на нашу итоговую инфографику. Мы собрали на этой схеме все ключевые выводы, психотипы моделей и готовую матрицу подбора ИИ под конкретные задачи бизнеса.

Финансовый психотип ИИ: как ученые открыли скрытые черты характера у топ-моделей нейросетей

Первоисточник для детального разбора

Для тех, кто хочет самостоятельно проверить выводы ученых, изучить математические формулы разложения прибыли через дивергенцию Брегмана или посмотреть полные таблицы калибровки всех 12 ИИ-моделей, авторы выложили препринт работы в открытый доступ: Оригинал исследования на arXiv: When do prophets profit in prediction markets?

P.S. Для тех, кто предпочитает слушать, а не читать

Мы записали специальный аудиовыпуск по этой статье. Детально разложили, как ученые проверяли характер нейросетей деньгами и какие скрытые баги они нашли в их логике. Слушайте нас на своих любимых подкаст-платформах.

1