Новые данные для обучения LLM: стартапы и технологии сбора информации
Есть статья 2-ух летней давности, в которой обсуждали сколько еще осталось данных в мире для обучения LLM
Интернета, книг и форумов осталось на ~300 триллионов токенов, которые полностью закончатся в 2026-2032 году
Вот сейчас и зарождается новый рынок, где компании добывают новые данные для обучения моделей и строют вокруг этого стартапы.
Один из самых очевидных: собирать реальные пользовательские данные.
Например приложение Kled AI нанимает людей чтобы те снимали на видео доставку у двери, яму на дороге или свою утреннюю прогулку.
Там юзеры грузят в день около 3 млн файлов.
По таким данным роботы, self-driving модели и мультимодальные учатся понимать наш окружающий мир.
То же самое делает компания Luel, но уже про человеческое поведение: мимика, жесты, видеозвонки, walkthrough-видео от первого лица.
Или например Silencio, где записывают реальные звуки: речь, шум города, редкие языки и тд.
Для голосовых агентов это вообще золото, потому что таких данных в интернете очень мало.
Дальше идет рынок узконаправленных специалистов:
Компании типа Mercor ищут врачей, юристов, банкиров, чтобы те размечали картинки, писали задания, проверяли ответы моделей и создавали критерии оценки качества.
По сути переводят профессиональное суждение и редкий опыт в формат который удобно скорить модели.
Есть еще один отдельный слой — архивы закрывшихся компаний:
Была такая транскрибационная компания Cielo24, которая при закрытии продала свой 13-летний архив данных о том как реально работают и принимают решения люди (Slack, Jira, почта, google drive и тд.)
Продала ИИ-лабе конечно и таких сделок десятки штук в год.
Так что если хотите внести вклад в обучение AGI, пишите чаще комментария на мои посты, возможно через пару лет будет датасет ☕
Подписывайтесь на Telegram Tips AI | IT & AI.