Qwen3.8-Flash теперь можно запускать локально
125B MoE-модель доступна в GGUF от Unsloth и может работать примерно на 75 ГБ RAM.
Qwen3.8-Flash-Next рассчитана в том числе на CPU RAM и unified memory, позволяя получать скорость, близкую к работе из VRAM.
По заявленным результатам модель обходит Claude Opus 4.6 Max в ряде тестов.
Гайд:
https://unsloth.ai/docs/models/qwen3.8-next
GGUF:
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF