27 млрд параметров теперь помещаются в 5,9 ГБ
PrismML выпустила Bonsai 2 27B — сжатую версию Qwen3.8-27B, которую можно запускать локально на обычном железе.
Главное здесь — размер. Полноценная версия модели в FP16 занимает около 54 ГБ, а Bonsai 2 27B — всего 5,9 ГБ. То есть модель стала примерно в 9 раз компактнее.
При этом разработчики заявляют, что после сжатия удалось сохранить 98,2% результата FP16-версии: средний показатель Bonsai 2 составил 84,78 против 86,32 у оригинала в 14 тестах с режимом рассуждения.
Что умеет модель:
- 27,36 млрд параметров;
- контекст до 262 тысяч токенов;
- мультимодальный ввод с поддержкой изображений;
- работа с кодом и рассуждениями;
- локальный запуск через llama.cpp;
- поддержка CUDA, Metal и CPU;
- лицензия Apache 2.0.
Причём это не обычная агрессивная квантизация. В Bonsai используются тернарные веса −1, 0 и +1, а средняя точность хранения составляет около 1,72 бита на вес. Для запуска разработчики используют собственные низкоразрядные ядра llama.cpp.
Подпишитесь на Журнал КОД: https://t.me/kodjournal
Есть важный нюанс: обычный llama.cpp эти файлы не запустит — нужен форк PrismML с их специализированными ядрами.
😛 Модель и файлы для запуска уже доступны на Hugging Face.