Крупнейший AI-прорыв года: Бесплатная Ling-3.0-Flash которая обходит 1T гигантов в 11 из 12 бенчмарков.

Alipay через свой ИИ-бренд Inclusion AI представила Ling-3.0-Flash — новую модель с революционным подходом к соотношению размера и интеллекта. При 124B общего и всего 5.1B активных параметров она обходит 1T-флагман Ring-2.6-1T в бенчмарках. Ling-3.0 - здесь

Крупнейший AI-прорыв года: Бесплатная Ling-3.0-Flash которая обходит 1T гигантов в 11 из 12 бенчмарков.

Технические характеристики

Модель построена на архитектуре Mixture-of-Experts (MoE) с общим объёмом 124 миллиарда параметров, из которых для каждого токена активируется всего 5.1 миллиарда. Это в 12 раз меньше, чем у предыдущего флагмана.

Ключевые параметры:

· Контекстное окно: 256K токенов нативно, с возможностью расширения до 1M

· Режимы работы: Thinking и Non-Thinking

· Архитектура: 5:1 KDA и MLA, 1/64 MoE

Производительность: меньше — значит лучше

Ling-3.0-Flash обходит 1T-флагмана Ring-2.6-1T в 11 из 12 бенчмарков. При этом она в 12 раз меньше по активным параметрам.

Ключевые улучшения:

· Интеллектуальная плотность: 5.1B активных параметров обеспечивают «выдающиеся традиционные рассуждения, следование инструкциям и работу с длинными текстами»

· Agent-задачи: расширена до 10 000+ интерактивных тренировочных сред для Coding, General и Deep Research

· Скорость: TTFT (время до первого токена) снижено на 60–80%+ для длинных входных данных благодаря кэшированию

Архитектурные инновации

Гибридная линейная архитектура внимания. С самого предобучения модель использует 5:1 KDA (Kimi Delta Attention) и MLA слоёв.

Улучшенный KDA с мелкозернистым диагональным стробированием. Это позволяет модели точнее запоминать ключевую информацию при работе с длинными документами и кодовыми базами.

Сжатие MoE до 1/64. Активные эксперты на токен сжаты вдвое по сравнению с предыдущим поколением, что даёт «более высокий рычаг эффективности».

Для агентов и продакшена

Модель нацелена на высокочастотные агентные рабочие процессы:

· Кодинг-агенты

· Работа с документами

· Длинные многошаговые взаимодействия

· Deep Research

Самоисправление и долгосрочное планирование. Модель обучалась на 10 000+ реальных интерактивных сред, что позволяет агентам не «сбиваться» при выполнении больших задач.

Мультиагентная координация. Обновлённая архитектура позволяет разным агентам распределять задачи и проверять друг друга, снижая риск ошибок.

Доступность: бесплатно до 3 августа, затем — Open Source

Ling-3.0-Flash доступна - здесь

Бесплатный период: до 3 августа 2026 года, 23:00 по пекинскому времени.

После бесплатного периода модель будет открыта — веса станут общедоступными.

Итог

Ling-3.0-Flash — пример того, что гонка ИИ смещается от простого наращивания параметров к интеллектуальной плотности. 5.1B активных параметров, обгоняющих 1T-флагмана, — это не просто технологический прорыв, а смена парадигмы: будущее за моделями, которые дают больше интеллекта на каждый затраченный ватт и доллар.

Ключевые выводы:

· 124B общих, 5.1B активных параметров

· Обгоняет 1T-модель Ring-2.6-1T в 11 из 12 тестов

· 256K контекст (до 1M)

· Создана для продакшен-агентов


Ling-3.0 Flash бесплатно - здесь

5