Запуск 80‑миллиардной модели на ноутбуке звучит как магия — но что скрывается за этим заголовком?

В репозитории Swiftlet авторы показывают, что 80 B‑модель Qwen «упирается» в 4,3 GB RAM на macOS, а 35 B‑версия способна работать даже на iPhone. По их словам, всё достигается за счёт динамической выгрузки параметров и 8‑битной квантизации, без обращения к облачным сервисам.

Для меня, кто собирает AI‑агенты на бесплатном стеке, такие цифры вызывают двойственное чувство. С одной стороны, локальный запуск крупной LLM открывает двери к полной приватности и контролю расходов. С другой — полезность модели сильно зависит от задачи: в интерактивных чат‑ботах с коротким контекстом она может справиться, но при глубоком анализе или генерации длинных текстов узким местом становится не память, а пропускная способность CPU/GPU и латентность выгрузки‑загрузки слоёв. На обычном ноутбуке без дискретного ускорителя я бы отдал предпочтение более лёгким, но оптимизированным моделям, а Swiftlet рассматривал бы как экспериментальную площадку для проб квантизации и кастомных пайплайнов.

Источник: github.com/leonickson1/Swiftlet