Qwen3.8-Flash теперь можно запускать локально

Qwen3.8-Flash теперь можно запускать локально

125B MoE-модель доступна в GGUF от Unsloth и может работать примерно на 75 ГБ RAM.

Qwen3.8-Flash-Next рассчитана в том числе на CPU RAM и unified memory, позволяя получать скорость, близкую к работе из VRAM.

По заявленным результатам модель обходит Claude Opus 4.6 Max в ряде тестов.

Гайд:

https://unsloth.ai/docs/models/qwen3.8-next

GGUF:

https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF

1