Модель на 3 миллиарда параметров уделала гигантов в математике и коде

Модель на 3 миллиарда параметров уделала гигантов в математике и коде

Команда исследователей выпустила VibeThinker-3B, и цифры в техническом отчёте заставляют пересмотреть привычное правило «чем больше модель, тем умнее». Всего 3 миллиарда параметров, старый стек Qwen2.5-Coder-3B в основе, а результаты на математических и кодовых бенчмарках держатся на уровне моделей, которые в десятки раз тяжелее.

Главный сюрприз не в самой архитектуре, а в том, как модель дотренировали. Авторы собрали данные с высоким сигналом: математические задачи с проверяемыми решениями и код с тестами, через которые можно прогнать ответ. Для каждого ответа модель строила несколько путей рассуждения, а дальше начиналась жёсткая фильтрация всего, что не проходит проверку. Качество данных здесь оказалось важнее их объёма.

Дообучение шло в два этапа. Сначала широкая база на разнообразных примерах, потом тонкая настройка на сложных задачах с длинными цепочками рассуждений. Чекпоинты выбирали не по привычному значению функции потерь, а по целевой точности pass@k на валидации, то есть по тому, насколько часто модель в принципе способна найти верный ответ за несколько попыток.

На стадии обучения с подкреплением команда применила метод MGPO, вариацию GRPO с дополнительным взвешиванием. Оно подталкивает модель к примерам, которые для текущей политики не слишком просты и не слишком сложны, и именно на этой грани обучение идёт быстрее всего. Отдельно авторы отказались от постепенного расширения контекста и сразу учили на 64k токенов: ранняя обрезка длинных рассуждений ломала способность модели думать долго.

Важным оказался и порядок этапов. Сначала RL по математике, затем по коду, и только потом по естественным наукам. Именно такая последовательность дала лучший итоговый результат. А на самом конце, когда точность уже выжата, добавили фазу, которая поощряет более короткие верные решения. Модель становится экономнее по вычислениям, не теряя в качестве.

На бенчмарках AIME 2025 и 2026, LiveCodeBench v6, HMMT и IMO-AnswerBench крошечная модель идёт вровень с решениями, которые считаются фронтиром отрасли. Для разработчиков это прямой намёк: сильный ризонинг можно получить на модели, которая запускается локально и не требует дорогой инфраструктуры. Рецепт смещается от раздувания размера к аккуратному пост-тренингу и чистым данным.

Первые впечатления выглядят сильно, но остаётся главный вопрос: как VibeThinker-3B поведёт себя в реальных задачах, а не только на тестах. Ответ дадут ближайшие недели, когда модель начнут активно гонять на боевых сценариях.

Источник: https://t.me/ai_machinelearning_big_data/10431