Нейросеть «для классификации» проиграла обычной DeepSeek: проверил на своём боте
Взял новую модель Jev, которую создали специально для классификации, и прогнал её на реальных сообщениях из Telegram-чатов рядом с тремя обычными нейросетями. Она оказалась последней, а одно решение у неё стоит вдвое дороже.
У меня есть задача, которая выглядит как рекламный пример для Jev.
Мой бот «Держи лида» читает больше 300 рабочих чатов в Telegram и ищет в них заказы и вакансии для таргетологов и SMM-специалистов. Регулярные выражения отсекают очевидный мусор, а всё остальное решает нейросеть. Это около 1 600 решений в сутки.
Ответ всегда один из трёх: заказ, вакансия или мусор. Плюс список рекламных площадок, если они упомянуты. Писать ничего не нужно, нужно выбрать.
Jev продаётся ровно под такие задачи. Я проверил его рядом с тремя обычными нейросетями. Он оказался последним.
Что такое Jev
Jev — модель компании TypeSafe. Она вышла 18 сентября 2026 года и доступна через OpenRouter. TypeSafe называет такие модели System One: их работа — принимать решения, текст они не пишут.
Обычной нейросети вы даёте инструкцию и получаете ответ текстом, который потом разбирает программа. Jev вы даёте сообщение и анкету: «выбери один вариант из списка», «да или нет», «поставь оценку по шкале». В ответ приходит выбор и вероятность каждого варианта. Без рассуждений и объяснений.
TypeSafe обещает, что вероятности откалиброваны: если модель говорит «0,8», она права примерно в 80% случаев. Стоит Jev $0.042 за миллион входных токенов, ответ бесплатный. На бумаге это идеальный инструмент для моей задачи.
Как я тестировал
У бота есть набор из 47 тестов на реальных сообщениях из чатов: заказы, вакансии, мусор, спам. Правила классификации для всех моделей одни и те же. Они копились на реальных ошибках. Например:
- слово «ищу» само по себе ничего не значит, важно, что после него: «ищу таргетолога» — это заказ, «ищу проект» — нет;
- агентство, которое нанимает, — это вакансия, а агентство, которое продаёт свои услуги, — мусор;
- монтажёр релевантен, только если ему нужно ещё и публиковать ролики в соцсетях;
- всё, что похоже на наём «чаттеров» для казино и крипты, отбрасывается, даже если там написано «SMM».
Для Jev я переложил эти правила в анкету: один вопрос «заказ, вакансия или мусор» и восемь вопросов «упомянута ли площадка: VK, Instagram, Яндекс Директ…». Все четыре модели прогонялись в один день, на одном сервере, через один и тот же код бота.
Первый прогон: 40 из 47
Пять ошибок из семи пришлись на вакансии директолога. В правилах написано: если ищут директолога, площадка — Яндекс Директ, даже когда она не названа. А в вопросе про площадку я написал «площадка прямо названа в тексте».
Два указания противоречили друг другу. Обычные нейросети с теми же правилами такие тесты проходят: они выбирают более конкретное правило. Jev понял критерий буквально.
Ошибка была моя. Но это важный урок: с Jev вы уже не пишете промпт, вы проектируете анкету. Каждая формулировка работает как строчка кода, и одна неточная строка стоила пять тестов. После исправления стало 45 из 47, дважды подряд.
Результат
Лучший результат у DeepSeek V4.1 Flash: 47 из 47, дважды подряд. У GLM 5.3 Flash и у Xiaomi MiMo, которая до этого работала в боте, — 46. Jev последний с 45.
Одну ошибку делают почти все модели: длинный пост про «бизнес-трансформацию», который на самом деле вакансия. Вторую Jev сделал один. Сообщение «Для клиники нужен человек, который будет снимать и монтировать видео для таргета» по нашим правилам мусор: это видеограф, а не таргетолог. Обычные модели это правило применили, Jev — нет.
Разница — один-два теста из 47. Это не разгром. Но модель, созданная для классификации, на классификации не обошла ни одну дешёвую обычную нейросеть.
Дешёвый за токен, дорогой за решение
Самое неожиданное было в счёте.
По прайсу Jev почти так же дёшев, как DeepSeek, а ответ у него вообще бесплатный. Но одно решение обходится вдвое дороже: $0.00032 против $0.00015. Причина в том, как Jev считает текст. Те же правила на русском у него занимают почти вдвое больше токенов, чем у обычных моделей. Бесплатный ответ не спасает: у обычной модели он и так занимает около сотни токенов.
На объёме бота это по прайсу примерно $15 в месяц против $7. Сумма небольшая, но экономии, ради которой стоило бы мириться с меньшей точностью, нет.
Скорость у Jev действительно впечатляет: 0,3 секунды против 1,5. Но бот разбирает сообщения из очереди, и полторы секунды там ничего не стоят.
Ещё одна деталь для тех, кто думает о проде. У Jev один провайдер, у DeepSeek — 27. Если единственный провайдер Jev упадёт, подменить его нечем.
Как Jev ведёт себя вне тестов
Кроме бота я прогнал Jev через отдельную серию проверок на числовых данных: 14 экспериментов, больше десяти тысяч запросов.
- Готовые поля он читает почти без ошибок. Если ответ лежит в данных в явном виде, Jev отвечает правильно. Одно поле-подсказка подняло точность с 49% до 93%.
- Считать не умеет. Когда ответ нужно вывести из ряда чисел, модель ошибается. Знак изменения по ряду из 20 значений она определила верно в 25% случаев — хуже, чем подбрасывание монетки.
- Меняет ответ на одинаковый запрос. Я отправил 200 одинаковых запросов дважды. В 13% случаев решение во второй раз было другим.
- Зависит от формулировки. Если перефразировать вопрос, ответы совпадают с исходными лишь частично.
- Калибровка хуже, чем у DeepSeek. Главное обещание Jev — точные вероятности — на практике уступило обычной модели.
Где Jev на своём месте
Jev силён, когда ответ прямо следует из переданного факта. Тип обращения в поддержку, язык сообщения, есть ли в тексте телефон, заполнено ли нужное поле. Вопрос короткий, критерии однозначные, решений много. Там он быстрый, аккуратный и дешёвый.
Классификация лидов только выглядит так же. На деле это применение длинного свода правил с исключениями, а сообщение часто нужно прочитать дважды: кто пишет, кого ищет, что продаёт. Обычная нейросеть с коротким рассуждением справляется с этим лучше. А раз правила длинные, Jev ещё и дороже.
Jev специализирован на форме ответа, а не на содержании задачи. Аккуратный ответ с вероятностями — удобный формат, но не гарантия точности в вашей задаче.
Что в итоге
В боте теперь работает DeepSeek V4.1 Flash, запасная модель — GLM 5.3 Flash. После переключения я прогнал через старую и новую модель 1 600 реальных сообщений за сутки. Решения совпали в 98,8% случаев, а медиана ответа упала с 24 секунд до полутора.
Jev в прод не пошёл.
Что я вынес для себя:
- Прежде чем брать модель «под задачу», проверьте её на своих данных рядом с дешёвой обычной нейросетью. Название класса моделей ничего не говорит о том, как она справится с вашими правилами.
- Цена за миллион токенов — не цена за решение. Считайте, сколько стоит один ответ на вашем реальном промпте.
- Держите собственный набор тестов из реальных сообщений. 47 примеров хватило, чтобы за день сравнить четыре модели и спокойно сменить основную.
Полная версия с техническими деталями: pvolkov.com/articles/jev-classification
Про такие эксперименты с нейросетями пишу в Telegram-канале: t.me/sueta_localna