Предсказания для стартапов от ИИ

Обсудим сегодня одну любопытную работу: там взяли данные по стартапам, взяли случайный лес и обучили его предсказывать для стартапов успешность. И он справился лучше нейросетей.

Там разные нюансы, я обо всех написала дальше. Но работа интересная, и не в последнюю очередь именно тем, что авторы не пихают большие и сложные модели куда не надо, а выбирают небольшие (ну, относительно) и понятные.

И про это тоже скажем пару слов.

Статья называется «Startup Sustainability Forecasting with Artificial Intelligence» («Прогнозирование устойчивости стартапов с помощью искусственного интеллекта»), она опубликована в октябре 2024 года.

О чём работа

Авторы решали три задачи.

Во-первых, они выбрали четыре организации, которые занимаются финансированием стартапов и как раз оценивают, перспективен стартап или нет. Авторы узнавали, хотят ли эксперты вообще использовать в своей работе ИИ, для чего, и что именно им нужно предсказывать. Двенадцать вопросов, четыре аналитика.

Это греческая, кстати, работа, и все компании греческие. Авторы говорят, что их результаты можно приложить к любым европейским стартапам, но мы всё равно будем относиться к ним с некоторой осторожностью.

Во-вторых, они составили систему, которая принимает на вход бизнес-планы, сайты стартапов и посты их представителей в соцсетях, финансовые отчёты и психологический портрет основателей, а на выходе предсказывает, какую оценку стартапу даст эксперт.

Про психологический интересное рассказали: оказывается, для анализа личностных качеств сотрудников и основателей компаний можно использовать игры типа “побег из комнаты”.

Логика вот в чём: если дать человеку анкету, он там будет стараться выбирать “правильные” ответы. А если посадить его играть в игру, он будет стараться выиграть, а вы будете смотреть, как именно, и получите честные ответы.

“Побег из комнаты” — один из моих любимых видов головоломок. Есть, собственно, комната, и вам надо из неё выбраться, а ключ где-то спрятан. И вы должны всё обыскать, решить головоломки и найти ключ. Лучшая игра этого жанра — The Room от Fireproof Games. Там четыре серии, первая вышла в 2012 году. Лучше с тех пор ничего не придумали, отвечаю. Если вдруг любите головоломки и искали, во что поиграть, — вот.

И на работе можно сыграть! Там в начале статьи авторы ссылаются на разные исследования, которые показывают эффективность этого типа игр для оценки сотрудников. Начальству можно показать и сказать, что вы вообще-то научные эксперименты проводите на благо компании.

Так, о чём это я?

О статье.

Значит, в-третьих, авторы собрали данные по 44 греческим стартапам и прогнали на них семь разных моделей машинного обучения.

И вот про этот последний пункт поговорим поподробнее.

Случайный лес круче нейросети (в данном случае)

Про случайный лес я писала подробный пост. Можете его прочитать сначала, чтобы понимать, о чём речь, а потом вернуться сюда.

Авторы взяли семь разных моделей, в том числе дерево решений, случайный лес и неназванную нейросеть. Они вообще мало раскрыли технических подробностей, так что воспроизвести эксперимент не получится. Будем иметь это в виду и относиться к результатам вдвойне аккуратно.

В результате меньше всего ошибок сделал случайный лес. Нейросеть отработала заметно хуже, а хуже неё только линейная регрессия — модель, которая выстраивает прямую линию по всем точкам набора данных. Я подробно про неё рассказывала вот в этом видео.

То, что случайный лес сработал лучше, очень логично, на самом деле: если данных мало, вам нужна модель поменьше. Представьте себе, что все наши данные можно уложить в двумерное пространство. Допустим, если нарисовать их на графике, они выглядят как треугольник. А мы взяли модель, которая строит трёхмерные фигуры, и получили пирамидку. А откуда она достроила недостающие грани, которых в данных не было?

И главное: мы же обучаем модель не чтобы она показала, как выглядят наши данные. Нам нужно с использованием её для новых данных получить результат. Положим, мы ей хотим дать две точки и получить третью, чтобы треугольник получился такой же, как в наших обучающих данных. А она пирамидки рисует — это же бесполезно.

Более того, в опросах эксперты, которые стартапы оценивают, сказали, что готовы пожертвовать точностью ради понятности, а случайный лес как раз очень понятный.

Вот поэтому не везде нужны сложные нейросети и не везде они будут эффективны.

Что в итоге

Поскольку модели обучали на оценках экспертов, а не реальных рыночных результатах, использовать её для оценки своего стартапа бессмысленно.

Но, как это часто бывает, подход всё равно интересный. Нужно только взять базу данных побольше и с реальными данными по успешности стартапа: закрылся, окупился, был поглощён более крупной компанией и так далее. Такие есть: например, Dealroom или Kauffman Firm Survey.

И попробовать обучить свой случайный лес: он здесь подходит как родной.

И ещё: эксперты хотели больше прозрачности, помните? Готовы были пожертвовать качеством, лишь бы понимать, что происходит под капотом.

Это важно, мне кажется, если вы делаете какой-нибудь продукт на основе ИИ. Важно спросить потенциальных пользователей: они хотят самую крутую модель или понятную модель, предсказания которой легко объяснить?