Ex-разработчик OpenAI выкатил сверхэффективный класс моделей — идеальный тул для AI агентов

Диого Алмеида (Diogo Almeida) 2 года назад ушел из OpenAI и начал пилить свой стартап TypeSafe AI. Ребята бросили вызов современной самой мощной концепции ИИ — ЛЛМкам.

Разрабы сравнили на собственных бенчмарках Jev и топовые LLM
Разрабы сравнили на собственных бенчмарках Jev и топовые LLM

У них простой тейк — мы заставляем делать LLM то, подо что они не заточены. Так давайте сделаем модели, которые созданы специально для этого. И, похоже, сделали 😎

Чего-чего? О чем речь вообще?

Вот вы просите LLM — собери все отзывы на товары проанализируй их и опиши их. Или ставите агента отсматривать инциденты и принимать решение об эскалации. Или агент сидит в вашей почте и решает, какое письмо вам сегодня подсветить, а какое замьютить и не отвлекать вас...

Чтобы решать такие задачи вообще-то хорошо бы использовать специально обученные классификаторы. Но на все такие задачи не наобучаешься моделей, а иногда нет нужной выборки для обучения (ну вот приспичило вам классифицировать сообщения ваших коллег по психиатрическим диагнозам 😁) или просто нет времени и желания.

Вот тогда на сцену раньше выходили LLM. Но вообще-то LLM очень плохое решение для такого класса задач. Они переводят все данные в текст, сами размышляют текстом и либо выплевывают рандомную циферку, либо в лучшем случае пытаются придумать правила скоринга и потом оценивают по этой примитивной формуле. Да еще и сжигают кучу токенов и делают это очень медленно.

Возможно теперь решение проблемы — Jev

Так назвали свою первую модель ребята из TypeSafeAI. И, если вкратце, то модель берет на вход рандомный текст, а на выход позволяет юзеру предзадать любой набор классов. Модель — раскидает данные по ним.

То есть архитектура явно работает тоже через предобучение на большом количестве данных. И имеет под капотом некое представление об окружающем мире, как и LLM. Но только на выход модель выдает не текст, как LLM, а структурированный файл с заданной заранее классификацией.

Зато работает Jev почти в 200 раз быстрее топовых LLM и почти в 450 раз дешевле. А качество ответов будет на уровне Opus 5.

То есть получается такая универсальная решалка с общим знанием мира. А дальше ее можно комбинировать в деревья решений. И на выходе получается адаптивная AI система, которая напоминает те самые workflow из времен n8n. Только в n8n в "звенья" воркфлоу подключалась LLM в качестве мозга, а здесь — Jev на его космических скоростях. На выходе получаем систему, которая играет в Doom в реальном времени 🕶

Jev при этом, по заявлению создателей, был создан совершенно новым способом:

• новая архитектура

• новый sampler

• новый алгоритм обучения — RLCD (Reinforcement Learning for Calibrated Decisions)

Но детали, к сожалению, не раскрывают. Научной статьи тоже нет. Поэтому пока что приходится верить на слово. Однако стартап немного раскрывает свои эвалы, по которым оценивалась модель.

Мысли

Главная проблема этих ребят, честно говоря, — позиционирование. Они почему-то стали сразу наваливать на LLM, мол быстрее, выше, сильнее ЛЛМок. Мол AGI даже создали. Но вообще им бы хорошего продакта в команду 😁

Ведь они создали просто идеальный инструмент для LLM. Объективно, люди руками не будут придумывать классы для Jev и строить воркфлоу руками. Это в прошлом, умерло вместе с n8n. Теперь этим занимаются агенты.

А вот дать задачу агенту построить пайплайн с использованием Jev в качестве движка, и сэкономить таким образом тонну токенов и ускорить процесс в разы — это желанный брульянт всего рынка.

Сейчас это чудо заморское доступно только по листу ожидания. Заявочку я отправил, очень хочется потестить руками.

4