Новые данные для обучения LLM: стартапы и технологии сбора информации

Есть статья 2-ух летней давности, в которой обсуждали сколько еще осталось данных в мире для обучения LLM

Новые данные для обучения LLM: стартапы и технологии сбора информации

Интернета, книг и форумов осталось на ~300 триллионов токенов, которые полностью закончатся в 2026-2032 году

Вот сейчас и зарождается новый рынок, где компании добывают новые данные для обучения моделей и строют вокруг этого стартапы.

Один из самых очевидных: собирать реальные пользовательские данные.

Например приложение Kled AI нанимает людей чтобы те снимали на видео доставку у двери, яму на дороге или свою утреннюю прогулку.

Там юзеры грузят в день около 3 млн файлов.

По таким данным роботы, self-driving модели и мультимодальные учатся понимать наш окружающий мир.

То же самое делает компания Luel, но уже про человеческое поведение: мимика, жесты, видеозвонки, walkthrough-видео от первого лица.

Или например Silencio, где записывают реальные звуки: речь, шум города, редкие языки и тд.

Для голосовых агентов это вообще золото, потому что таких данных в интернете очень мало.

Дальше идет рынок узконаправленных специалистов:

Компании типа Mercor ищут врачей, юристов, банкиров, чтобы те размечали картинки, писали задания, проверяли ответы моделей и создавали критерии оценки качества.

По сути переводят профессиональное суждение и редкий опыт в формат который удобно скорить модели.

Есть еще один отдельный слой — архивы закрывшихся компаний:

Была такая транскрибационная компания Cielo24, которая при закрытии продала свой 13-летний архив данных о том как реально работают и принимают решения люди (Slack, Jira, почта, google drive и тд.)

Продала ИИ-лабе конечно и таких сделок десятки штук в год.

Так что если хотите внести вклад в обучение AGI, пишите чаще комментария на мои посты, возможно через пару лет будет датасет ☕

Подписывайтесь на Telegram Tips AI | IT & AI.