Почему ваш ИИ ведет себя как капризный подросток: секрет «грязных» данных и экономика хайпа.
Если коротко: современные нейросети так лихо имитируют человеческую речь только потому, что самый большой массив «живого текста» в открытом доступе — это социальные сети, комментарии и форумы. Именно на них выросли те, кого мы сегодня называем «искусственным интеллектом».
Шоу-эффект на миллиарды: как ИИ стал новой золотой лихорадкой
Конечно, OpenAI и прочие гиганты не спешат публиковать точные списки своих «учебников». Но выводы на основе косвенных данных однозначны: основным источником обучения стали соцсети. Это было просто, доступно, массово, а значит — дёшево. И, что немаловажно, это позволило получить дата-сет, максимально приближенный к реальной речи.
Причём тут речь? Да при том, что сами разработчики называют свои творения большими ЯЗЫКОВЫМИ моделями. В начале всё это было просто трюком: «смотрите, компы научились разговаривать». И шоу-эффект получился на славу! У части человечества, особенно склонной к магической модели мышления, сложилась новая вера: «Вау! Оно живое!»
Ну и, конечно, это следовало монетизировать. Скажете: как так? Мы до сих пор ничего не платим! Монетизация идет, моё почтение — на уровне национальных экономик. Время удачное: экономики в стагнации, у финансовых рынков новых долгосрочных идей нет. И тут — новая золотая лихорадка: финансы, наука, железо, энергетика, технологии. Я не удивлюсь, если где-нибудь в американской глубинке появится культ святого ИИ.
На ТАКОМ хайпе каждый школьник знает, что надо вкладывать в OpenAI и Nvidia. И чтобы подлить бензина в процесс, эти монстры договорились и «проинвестировали» друг в друга несуществующие пока миллиарды, обменявшись активами. Формально это показало дикую прибыльность в моменте. А значит, все мамкины инвесторы теперь знают, куда именно надо нести заработанное на крипте и достатое из банок и из-под матрацев =).
Пузырь или индустрия?
Я не стану сто пятьсот первый раз говорить про пузырь. Да, это пузырь, но давайте разберем профиты. Во-первых, экономика получила новую индустрию и ожила вокруг новых идей. Во-вторых, появился практический смысл применения технологий в реальном физическом мире. Сейчас бизнес-менеджмент тестирует границы и пытается найти новый баланс между страхом и жадностью. И поверьте, скоро он будет найден!
Самый главный плюс этих моделей в том, что компиляция статистических алгоритмов, обученных на большом количестве узкоспециализированных данных, позволяет создавать по-настоящему годные инструменты. Но инвесторы неохотно вкладываются непосредственно в исследования, а вот в шоу-технологии — да! Поэтому развитие ИИ идёт немного непрактичным и непрямым путём.
Почему путь ИИ «кривой»
Куда практичнее было бы учить статистические алгоритмы сразу на данных с датчиков, измерительной аппаратуры и развивать математические вычисления напрямую. В узкоспециализированных проектах это так и делается, но на малых объемах специальных данных быстро не вырасти. Поэтому вначале LLM обкатывают идеи на себе, затем инновационные «утечки» попадают в индустрию, и уже потом небольшие компании пилят на их базе решения для жизни и бизнеса.
Почему этот путь непрямой? Представьте, что вы в автомобиле, а там вместо руля и педалей — микрофон. Вам поворачивать, а тут непонятно, как объяснить системе, что именно нужно сделать. И не дай бог машина начнет ради «реалистичности общения» косплеить капризного подростка. Пока будете уговаривать — поворот проедете. А если тормозить надо? =)
Вот именно поэтому дата-сет для автопилота Tesla — это не слова, а четкий бинарный цифровой код. Буквальное натаскивание ИИ на конкретные задачи могут себе позволить только монстры уровня Маска.
Наследственная боль LLM: кто «воспитал» вашу нейросеть
Что остается остальным? Либо сложный путь (дорого нанять разработчиков, построить гипотезу, обучить локальную модель и долго её тюнить), либо простой — использовать готовые LLM. Но во втором случае нужно понимать, на чем их учили.
Принципиальное непонимание этого вопроса приводит к высокому браку результатов. Главная «боль» глобальных моделей — обучение на контенте из соцсетей. По данным Pew Research Center, актуальный дата-сет из крупнейших соцсетей и форумов (с 2015 года по настоящее время) пропорционально складывался из следующих групп:
ПоколениеГоды рожденияДоля в дата-сетеМиллениалы (Gen Y)≈ 1981–1996~37%Зумеры (Gen Z)≈ 1997–2012~28%Поколение X≈ 1965–1980~25%Бумеры (Baby Boomers)≈ 1946–1964~10%
Глядя на эти цифры, становится понятно, почему модели ведут себя именно так. Они обучены на поведении этих групп. Если ваша тема лежит вне кругозора миллениалов, а вы не уделили этому внимания в промптах — галлюцинации гарантированы.
Если к вам придет устраиваться на работу представитель поколения Z, вы вряд ли оставите его без присмотра на важных аналитических или технологических процессах. Так что выключаем безосновательную надежду на лучшее, тщательно тестируем промпты и ставим на контроль результатов «опытного зубра» — ветерана с острым умом, готового конкурировать за рабочее место в новых условиях.
Итог
Если понимать, как оно работает и почему, становится ясно, чего ИИ не может и не сможет никогда. Отсюда понятно, как с ним конкурировать и как им эффективно пользоваться. Выключаем магическое мышление: за всеми чудесами лежит внутренний труд и подготовка. Удачи нам всем в этом!