Предсказания для стартапов от ИИ
Обсудим сегодня одну любопытную работу: там взяли данные по стартапам, взяли случайный лес и обучили его предсказывать для стартапов успешность. И он справился лучше нейросетей.
Там разные нюансы, я обо всех написала дальше. Но работа интересная, и не в последнюю очередь именно тем, что авторы не пихают большие и сложные модели куда не надо, а выбирают небольшие (ну, относительно) и понятные.
И про это тоже скажем пару слов.
Статья называется «Startup Sustainability Forecasting with Artificial Intelligence» («Прогнозирование устойчивости стартапов с помощью искусственного интеллекта»), она опубликована в октябре 2024 года.
О чём работа
Авторы решали три задачи.
Во-первых, они выбрали четыре организации, которые занимаются финансированием стартапов и как раз оценивают, перспективен стартап или нет. Авторы узнавали, хотят ли эксперты вообще использовать в своей работе ИИ, для чего, и что именно им нужно предсказывать. Двенадцать вопросов, четыре аналитика.
Это греческая, кстати, работа, и все компании греческие. Авторы говорят, что их результаты можно приложить к любым европейским стартапам, но мы всё равно будем относиться к ним с некоторой осторожностью.
Во-вторых, они составили систему, которая принимает на вход бизнес-планы, сайты стартапов и посты их представителей в соцсетях, финансовые отчёты и психологический портрет основателей, а на выходе предсказывает, какую оценку стартапу даст эксперт.
Про психологический интересное рассказали: оказывается, для анализа личностных качеств сотрудников и основателей компаний можно использовать игры типа “побег из комнаты”.
Логика вот в чём: если дать человеку анкету, он там будет стараться выбирать “правильные” ответы. А если посадить его играть в игру, он будет стараться выиграть, а вы будете смотреть, как именно, и получите честные ответы.
“Побег из комнаты” — один из моих любимых видов головоломок. Есть, собственно, комната, и вам надо из неё выбраться, а ключ где-то спрятан. И вы должны всё обыскать, решить головоломки и найти ключ. Лучшая игра этого жанра — The Room от Fireproof Games. Там четыре серии, первая вышла в 2012 году. Лучше с тех пор ничего не придумали, отвечаю. Если вдруг любите головоломки и искали, во что поиграть, — вот.
И на работе можно сыграть! Там в начале статьи авторы ссылаются на разные исследования, которые показывают эффективность этого типа игр для оценки сотрудников. Начальству можно показать и сказать, что вы вообще-то научные эксперименты проводите на благо компании.
Так, о чём это я?
О статье.
Значит, в-третьих, авторы собрали данные по 44 греческим стартапам и прогнали на них семь разных моделей машинного обучения.
И вот про этот последний пункт поговорим поподробнее.
Случайный лес круче нейросети (в данном случае)
Про случайный лес я писала подробный пост. Можете его прочитать сначала, чтобы понимать, о чём речь, а потом вернуться сюда.
Авторы взяли семь разных моделей, в том числе дерево решений, случайный лес и неназванную нейросеть. Они вообще мало раскрыли технических подробностей, так что воспроизвести эксперимент не получится. Будем иметь это в виду и относиться к результатам вдвойне аккуратно.
В результате меньше всего ошибок сделал случайный лес. Нейросеть отработала заметно хуже, а хуже неё только линейная регрессия — модель, которая выстраивает прямую линию по всем точкам набора данных. Я подробно про неё рассказывала вот в этом видео.
То, что случайный лес сработал лучше, очень логично, на самом деле: если данных мало, вам нужна модель поменьше. Представьте себе, что все наши данные можно уложить в двумерное пространство. Допустим, если нарисовать их на графике, они выглядят как треугольник. А мы взяли модель, которая строит трёхмерные фигуры, и получили пирамидку. А откуда она достроила недостающие грани, которых в данных не было?
И главное: мы же обучаем модель не чтобы она показала, как выглядят наши данные. Нам нужно с использованием её для новых данных получить результат. Положим, мы ей хотим дать две точки и получить третью, чтобы треугольник получился такой же, как в наших обучающих данных. А она пирамидки рисует — это же бесполезно.
Более того, в опросах эксперты, которые стартапы оценивают, сказали, что готовы пожертвовать точностью ради понятности, а случайный лес как раз очень понятный.
Вот поэтому не везде нужны сложные нейросети и не везде они будут эффективны.
Что в итоге
Поскольку модели обучали на оценках экспертов, а не реальных рыночных результатах, использовать её для оценки своего стартапа бессмысленно.
Но, как это часто бывает, подход всё равно интересный. Нужно только взять базу данных побольше и с реальными данными по успешности стартапа: закрылся, окупился, был поглощён более крупной компанией и так далее. Такие есть: например, Dealroom или Kauffman Firm Survey.
И попробовать обучить свой случайный лес: он здесь подходит как родной.
И ещё: эксперты хотели больше прозрачности, помните? Готовы были пожертвовать качеством, лишь бы понимать, что происходит под капотом.
Это важно, мне кажется, если вы делаете какой-нибудь продукт на основе ИИ. Важно спросить потенциальных пользователей: они хотят самую крутую модель или понятную модель, предсказания которой легко объяснить?