Крупнейший AI-прорыв года: Бесплатная Ling-3.0-Flash которая обходит 1T гигантов в 11 из 12 бенчмарков.
Alipay через свой ИИ-бренд Inclusion AI представила Ling-3.0-Flash — новую модель с революционным подходом к соотношению размера и интеллекта. При 124B общего и всего 5.1B активных параметров она обходит 1T-флагман Ring-2.6-1T в бенчмарках. Ling-3.0 - здесь
Технические характеристики
Модель построена на архитектуре Mixture-of-Experts (MoE) с общим объёмом 124 миллиарда параметров, из которых для каждого токена активируется всего 5.1 миллиарда. Это в 12 раз меньше, чем у предыдущего флагмана.
Ключевые параметры:
· Контекстное окно: 256K токенов нативно, с возможностью расширения до 1M
· Режимы работы: Thinking и Non-Thinking
· Архитектура: 5:1 KDA и MLA, 1/64 MoE
Производительность: меньше — значит лучше
Ling-3.0-Flash обходит 1T-флагмана Ring-2.6-1T в 11 из 12 бенчмарков. При этом она в 12 раз меньше по активным параметрам.
Ключевые улучшения:
· Интеллектуальная плотность: 5.1B активных параметров обеспечивают «выдающиеся традиционные рассуждения, следование инструкциям и работу с длинными текстами»
· Agent-задачи: расширена до 10 000+ интерактивных тренировочных сред для Coding, General и Deep Research
· Скорость: TTFT (время до первого токена) снижено на 60–80%+ для длинных входных данных благодаря кэшированию
Архитектурные инновации
Гибридная линейная архитектура внимания. С самого предобучения модель использует 5:1 KDA (Kimi Delta Attention) и MLA слоёв.
Улучшенный KDA с мелкозернистым диагональным стробированием. Это позволяет модели точнее запоминать ключевую информацию при работе с длинными документами и кодовыми базами.
Сжатие MoE до 1/64. Активные эксперты на токен сжаты вдвое по сравнению с предыдущим поколением, что даёт «более высокий рычаг эффективности».
Для агентов и продакшена
Модель нацелена на высокочастотные агентные рабочие процессы:
· Кодинг-агенты
· Работа с документами
· Длинные многошаговые взаимодействия
· Deep Research
Самоисправление и долгосрочное планирование. Модель обучалась на 10 000+ реальных интерактивных сред, что позволяет агентам не «сбиваться» при выполнении больших задач.
Мультиагентная координация. Обновлённая архитектура позволяет разным агентам распределять задачи и проверять друг друга, снижая риск ошибок.
Доступность: бесплатно до 3 августа, затем — Open Source
Ling-3.0-Flash доступна - здесь
Бесплатный период: до 3 августа 2026 года, 23:00 по пекинскому времени.
После бесплатного периода модель будет открыта — веса станут общедоступными.
Итог
Ling-3.0-Flash — пример того, что гонка ИИ смещается от простого наращивания параметров к интеллектуальной плотности. 5.1B активных параметров, обгоняющих 1T-флагмана, — это не просто технологический прорыв, а смена парадигмы: будущее за моделями, которые дают больше интеллекта на каждый затраченный ватт и доллар.
Ключевые выводы:
· 124B общих, 5.1B активных параметров
· Обгоняет 1T-модель Ring-2.6-1T в 11 из 12 тестов
· 256K контекст (до 1M)