Нейросеть «для классификации» проиграла обычной DeepSeek: проверил на своём боте

Взял новую модель Jev, которую создали специально для классификации, и прогнал её на реальных сообщениях из Telegram-чатов рядом с тремя обычными нейросетями. Она оказалась последней, а одно решение у неё стоит вдвое дороже.

Нейросеть «для классификации» проиграла обычной DeepSeek: проверил на своём боте

У меня есть задача, которая выглядит как рекламный пример для Jev.

Мой бот «Держи лида» читает больше 300 рабочих чатов в Telegram и ищет в них заказы и вакансии для таргетологов и SMM-специалистов. Регулярные выражения отсекают очевидный мусор, а всё остальное решает нейросеть. Это около 1 600 решений в сутки.

Ответ всегда один из трёх: заказ, вакансия или мусор. Плюс список рекламных площадок, если они упомянуты. Писать ничего не нужно, нужно выбрать.

Jev продаётся ровно под такие задачи. Я проверил его рядом с тремя обычными нейросетями. Он оказался последним.

Что такое Jev

Jev — модель компании TypeSafe. Она вышла 18 сентября 2026 года и доступна через OpenRouter. TypeSafe называет такие модели System One: их работа — принимать решения, текст они не пишут.

Обычной нейросети вы даёте инструкцию и получаете ответ текстом, который потом разбирает программа. Jev вы даёте сообщение и анкету: «выбери один вариант из списка», «да или нет», «поставь оценку по шкале». В ответ приходит выбор и вероятность каждого варианта. Без рассуждений и объяснений.

Нейросеть «для классификации» проиграла обычной DeepSeek: проверил на своём боте

TypeSafe обещает, что вероятности откалиброваны: если модель говорит «0,8», она права примерно в 80% случаев. Стоит Jev $0.042 за миллион входных токенов, ответ бесплатный. На бумаге это идеальный инструмент для моей задачи.

Как я тестировал

У бота есть набор из 47 тестов на реальных сообщениях из чатов: заказы, вакансии, мусор, спам. Правила классификации для всех моделей одни и те же. Они копились на реальных ошибках. Например:

  • слово «ищу» само по себе ничего не значит, важно, что после него: «ищу таргетолога» — это заказ, «ищу проект» — нет;
  • агентство, которое нанимает, — это вакансия, а агентство, которое продаёт свои услуги, — мусор;
  • монтажёр релевантен, только если ему нужно ещё и публиковать ролики в соцсетях;
  • всё, что похоже на наём «чаттеров» для казино и крипты, отбрасывается, даже если там написано «SMM».

Для Jev я переложил эти правила в анкету: один вопрос «заказ, вакансия или мусор» и восемь вопросов «упомянута ли площадка: VK, Instagram, Яндекс Директ…». Все четыре модели прогонялись в один день, на одном сервере, через один и тот же код бота.

Первый прогон: 40 из 47

Пять ошибок из семи пришлись на вакансии директолога. В правилах написано: если ищут директолога, площадка — Яндекс Директ, даже когда она не названа. А в вопросе про площадку я написал «площадка прямо названа в тексте».

Два указания противоречили друг другу. Обычные нейросети с теми же правилами такие тесты проходят: они выбирают более конкретное правило. Jev понял критерий буквально.

Нейросеть «для классификации» проиграла обычной DeepSeek: проверил на своём боте

Ошибка была моя. Но это важный урок: с Jev вы уже не пишете промпт, вы проектируете анкету. Каждая формулировка работает как строчка кода, и одна неточная строка стоила пять тестов. После исправления стало 45 из 47, дважды подряд.

Результат

Нейросеть «для классификации» проиграла обычной DeepSeek: проверил на своём боте

Лучший результат у DeepSeek V4.1 Flash: 47 из 47, дважды подряд. У GLM 5.3 Flash и у Xiaomi MiMo, которая до этого работала в боте, — 46. Jev последний с 45.

Одну ошибку делают почти все модели: длинный пост про «бизнес-трансформацию», который на самом деле вакансия. Вторую Jev сделал один. Сообщение «Для клиники нужен человек, который будет снимать и монтировать видео для таргета» по нашим правилам мусор: это видеограф, а не таргетолог. Обычные модели это правило применили, Jev — нет.

Разница — один-два теста из 47. Это не разгром. Но модель, созданная для классификации, на классификации не обошла ни одну дешёвую обычную нейросеть.

Дешёвый за токен, дорогой за решение

Самое неожиданное было в счёте.

Нейросеть «для классификации» проиграла обычной DeepSeek: проверил на своём боте

По прайсу Jev почти так же дёшев, как DeepSeek, а ответ у него вообще бесплатный. Но одно решение обходится вдвое дороже: $0.00032 против $0.00015. Причина в том, как Jev считает текст. Те же правила на русском у него занимают почти вдвое больше токенов, чем у обычных моделей. Бесплатный ответ не спасает: у обычной модели он и так занимает около сотни токенов.

На объёме бота это по прайсу примерно $15 в месяц против $7. Сумма небольшая, но экономии, ради которой стоило бы мириться с меньшей точностью, нет.

Скорость у Jev действительно впечатляет: 0,3 секунды против 1,5. Но бот разбирает сообщения из очереди, и полторы секунды там ничего не стоят.

Ещё одна деталь для тех, кто думает о проде. У Jev один провайдер, у DeepSeek — 27. Если единственный провайдер Jev упадёт, подменить его нечем.

Как Jev ведёт себя вне тестов

Кроме бота я прогнал Jev через отдельную серию проверок на числовых данных: 14 экспериментов, больше десяти тысяч запросов.

Нейросеть «для классификации» проиграла обычной DeepSeek: проверил на своём боте
  • Готовые поля он читает почти без ошибок. Если ответ лежит в данных в явном виде, Jev отвечает правильно. Одно поле-подсказка подняло точность с 49% до 93%.
  • Считать не умеет. Когда ответ нужно вывести из ряда чисел, модель ошибается. Знак изменения по ряду из 20 значений она определила верно в 25% случаев — хуже, чем подбрасывание монетки.
  • Меняет ответ на одинаковый запрос. Я отправил 200 одинаковых запросов дважды. В 13% случаев решение во второй раз было другим.
  • Зависит от формулировки. Если перефразировать вопрос, ответы совпадают с исходными лишь частично.
  • Калибровка хуже, чем у DeepSeek. Главное обещание Jev — точные вероятности — на практике уступило обычной модели.

Где Jev на своём месте

Jev силён, когда ответ прямо следует из переданного факта. Тип обращения в поддержку, язык сообщения, есть ли в тексте телефон, заполнено ли нужное поле. Вопрос короткий, критерии однозначные, решений много. Там он быстрый, аккуратный и дешёвый.

Классификация лидов только выглядит так же. На деле это применение длинного свода правил с исключениями, а сообщение часто нужно прочитать дважды: кто пишет, кого ищет, что продаёт. Обычная нейросеть с коротким рассуждением справляется с этим лучше. А раз правила длинные, Jev ещё и дороже.

Jev специализирован на форме ответа, а не на содержании задачи. Аккуратный ответ с вероятностями — удобный формат, но не гарантия точности в вашей задаче.

Что в итоге

В боте теперь работает DeepSeek V4.1 Flash, запасная модель — GLM 5.3 Flash. После переключения я прогнал через старую и новую модель 1 600 реальных сообщений за сутки. Решения совпали в 98,8% случаев, а медиана ответа упала с 24 секунд до полутора.

Нейросеть «для классификации» проиграла обычной DeepSeek: проверил на своём боте

Jev в прод не пошёл.

Что я вынес для себя:

  1. Прежде чем брать модель «под задачу», проверьте её на своих данных рядом с дешёвой обычной нейросетью. Название класса моделей ничего не говорит о том, как она справится с вашими правилами.
  2. Цена за миллион токенов — не цена за решение. Считайте, сколько стоит один ответ на вашем реальном промпте.
  3. Держите собственный набор тестов из реальных сообщений. 47 примеров хватило, чтобы за день сравнить четыре модели и спокойно сменить основную.

Полная версия с техническими деталями: pvolkov.com/articles/jev-classification

Про такие эксперименты с нейросетями пишу в Telegram-канале: t.me/sueta_localna