Квантованные LLM Bonsai до 1.125 бит на вес

🔹 PrismML-Eng/Bonsai-demo

Квантованные LLM Bonsai до 1.125 бит на вес

⭐ 1714 звёзд · Shell

Демо для локального запуска моделей семейства Bonsai на Mac (Metal), Linux/Windows (CUDA, Vulkan, ROCm) и CPU. Две линейки — Bonsai (1-bit) и Ternary-Bonsai (~1.7 бит, упаковано в 2-bit) в размерах 1.7B, 4B, 8B и 27B параметров с контекстом 256k+ токенов.

Bonsai-27B — первая в семействе vision-language модель: ест фото, скриншоты и PDF, умеет reasoning с настраиваемым уровнем усилий и tool calling в стиле OpenAI с полным round-trip и MCP-серверами. В 1-bit варианте 27B ужимается до ~1.125 бит на вес и влезает в память современного iPhone без выгрузки.

Формат Q1_0 уже смержен в mainline llama.cpp и работает на CPU, Metal, CUDA и Vulkan; Q2_0 (ternary) — на CPU и Metal, Vulkan в ревью. Веса раздают в GGUF и MLX, setup-скрипт сам ставит зависимости, качает модели и собирает бинарники.

Подписывайтесь на Telegram Полезная Репа.

1