Новая модель сделана под долгоживущих AI-агентов, coding-задачи и дешёвый inference. Внутри гибридная архитектура Mamba-2 + MoE + Attention, контекст до 1 млн токенов, а pretraining прошёл на более чем 20 трлн токенов.
Новая модель сделана под долгоживущих AI-агентов, coding-задачи и дешёвый inference. Внутри гибридная архитектура Mamba-2 + MoE + Attention, контекст до 1 млн токенов, а pretraining прошёл на более чем 20 трлн токенов.