LLM – всё?
Сижу я значит, работаю, никого не трогаю. И захотелось вынести на всеобщее обсуждение некоторые мысли.
Я уже некоторое время как отказался от подписок на нейросети и экспериментирую с роутерами, то и дело тестируя разные модели в разных задачах. И в последнее время начинаю всё больше удивляться одному интересному факту.
Мы(те, кто интересовался ИИ ещё до массового внедрения и помешательства) жили несколько лет в парадигме того, что фронтирные большие модели - это круто. Куда ни плюнь, каждый месяц выходит обновление «Клауд файбле x.y» или другой помойки из семейства проприетарных гигантов и весь интернет начинает ссать кипятком.
Но вот что интересно. Создается ощущение, что стоимость обучения и эксплуатации больших моделей растет настолько быстро, что экономика дальнейшего их масштабирования начинает вызывать вопросы. Причем растет не только стоимость создания модели. Растет стоимость каждого её следующего вызова. И когда модель должна отвечать не тысячи, а миллионы раз, вопрос «а точно ли нам нужны эти сотни миллиардов параметров?» становится вполне обоснованным. Потому что тупо масштабировать параметры модели до бесконечности не просто не получится, но и в целом, откровенно говоря, стратегия довольно стремная.
Разумеется, я не претендую на место главного умника и многие владельцы моделей уже это смекнули. С одной стороны, появилась архитектура MoE, позволяющая делать гигантские модели вычислительно эффективнее. С другой - все активнее развиваются маленькие специализированные модели, которые отлично умеют делать что-то одно.
В этот момент большая языковая модель становится учителем для более маленьких, позволяя делать сильно эффективные модели с не таким уж и тяжелым инференсом(Mistral, к слову на этом быстрее остальных свой бизнес построил).
Ведь реально важно не столько то, что знает исходная модель, сколько то, насколько ты способен обогатить её контекст правильной информацией. И инструментов для этого огромное количество. Конечно, всё зависит от обертки, контура, тулзов которые вы ей даете. Но всё же.
Я уже месяц плотно мучаю Flash модели разных провайдеров и могу уверенно сказать несколько вещей: - Мой расход на токены снизился в несколько раз - Я практически не заметил потери качества в типовых задачах. Если мне нужно сложное планирование или экспертиза, сложные рассуждения, я по прежнему использую большие модели - В подавляющем большинстве задач гиганты мне больше не нужны
Возможно, мы немного неправильно ставили вопрос всё это время. Не «какая модель умнее?», а «какая модель достаточно умна для этой конкретной задачи?».
Потому что если одна модель за X денег решает задачу хорошо, а другая за 0.1X решает её так же хорошо, то для реального потребителя победитель очевиден.
Скорее, большая модель постепенно превращается в станок по производству маленьких моделей. И это куда интереснее, чем капать слюной на бенчмарки, которые в реальных задачах, оказывается, не очень то и в тему.
P.S. Моя персональная боль идеалиста и «хорошего мальчика».
Желаю всем воздуханам в интернетах постепенно попасть в забвение после фраз «Эта новая модель только что убила все остальные», «Используй этот навык для Клауд кода и делай монтаж лучше, чем моушн-дизайнер» и всех подобных им.