27 млрд параметров теперь помещаются в 5,9 ГБ

PrismML выпустила Bonsai 2 27B — сжатую версию Qwen3.8-27B, которую можно запускать локально на обычном железе.

Главное здесь — размер. Полноценная версия модели в FP16 занимает около 54 ГБ, а Bonsai 2 27B — всего 5,9 ГБ. То есть модель стала примерно в 9 раз компактнее.

При этом разработчики заявляют, что после сжатия удалось сохранить 98,2% результата FP16-версии: средний показатель Bonsai 2 составил 84,78 против 86,32 у оригинала в 14 тестах с режимом рассуждения.

Что умеет модель:

  • 27,36 млрд параметров;
  • контекст до 262 тысяч токенов;
  • мультимодальный ввод с поддержкой изображений;
  • работа с кодом и рассуждениями;
  • локальный запуск через llama.cpp;
  • поддержка CUDA, Metal и CPU;
  • лицензия Apache 2.0.

Причём это не обычная агрессивная квантизация. В Bonsai используются тернарные веса −1, 0 и +1, а средняя точность хранения составляет около 1,72 бита на вес. Для запуска разработчики используют собственные низкоразрядные ядра llama.cpp.

Подпишитесь на Журнал КОД: https://t.me/kodjournal

Есть важный нюанс: обычный llama.cpp эти файлы не запустит — нужен форк PrismML с их специализированными ядрами.

😛 Модель и файлы для запуска уже доступны на Hugging Face.

29
4
2
1
1