Яндекс выложил Alice AI Foundation LLM в открытый доступ. Что умеет модель и зачем она нужна агентной Алисе

Модель на 80 млрд параметров, из которых в моменте работают только 3 млрд: гонка сместилась с размера на плотность
Модель на 80 млрд параметров, из которых в моменте работают только 3 млрд: гонка сместилась с размера на плотность

Утром увидел новость: Яндекс выложил в открытый доступ Alice AI Foundation LLM. Это претрейн новой большой языковой модели, которую обучили с нуля. Не чужой опенсорс с дообучением, а свой фундамент. Лицензия Apache 2.0: брать можно и в исследования, и в бизнес.

Ниже коротко: что выложили, что в этом важно и почему меня зацепило одно слово из релиза, агентные.

Что выложили

  • Архитектура MoE: 80 млрд параметров, из них в моменте работают только 3 млрд. Отсюда скорость и скромные требования к железу.
  • Модель умеет рассуждать и работать в агентных сценариях.
  • На русском отвечает лучше многих мировых аналогов, особенно в вопросах на факты.
  • Лицензия Apache 2.0: использовать можно свободно, в том числе в коммерции.
  • Вместе с моделью открыты два новых теста: WikiWebFacts и HardMultiQA.

Модель экспериментальная. На ней Яндекс обкатывает решения для будущей рассуждающей модели, одной на все сервисы. Именно она должна дать Алисе агентные умения: не просто отвечать, а выполнять поручения.

Цифры, на которые стоит смотреть

На олимпиадных задачах по математике модель делит первое место с Qwen3.5 и решает почти все задания. В написании кода она обходит модель NVIDIA, у которой активных параметров вчетверо больше.

В знании фактов картина та же. Она обгоняет открытую модель DeepSeek, где 284 млрд параметров против 80, и отвечает на уровне прошлой закрытой модели Яндекса, которая втрое крупнее.

Смысл простой: размер перестал быть главным. Важнее, сколько параметров работает на каждом шаге и насколько чистые данные в модель загрузили.

Бенчмарки на русском, которых раньше не было

Яндекс собрал два своих набора задач на русском. WikiWebFacts это короткие вопросы и короткие ответы: даты, определения, события, люди. HardMultiQA собран из обезличенных запросов к Алисе и уходит в редкие темы: медицина, право, IT, искусство.

Во втором наборе мало вспомнить один факт. Нужно выбрать несколько верных вариантов, перечислить сразу несколько фактов или найти ошибку в тексте. Англоязычные тесты такие знания не измеряют. Оба набора открыты вместе с моделью, с эталонными ответами и протоколом оценки.

Алиса давно перестала быть колонкой на кухне

Теперь личное наблюдение, ради которого я и сел писать. Алиса давно не один продукт. Она встроена в поиск, карты, телевизоры, машины, умный дом и в приложения партнёров. У многих новых сервисов она появляется прямо в интерфейсе.

Пока это голосовой помощник, он выдаёт короткую справку. Когда под ним окажется рассуждающая модель, человек перестанет листать выдачу и просто спросит: что выбрать, где купить, кому доверить задачу. Ответ ассистента станет единственным экраном.

Почему это упирается в нейровидимость бренда

Для компаний вывод такой: место в поисковой выдаче больше не равно месту в ответе ассистента. Появилась отдельная задача, попадать в ответы нейросетей. Её называют GEO. И русскоязычные ассистенты Яндекса тут уже не экзотика.

Свою видимость я смотрю через сторонний сервис brandfound, сайт brandfound.ai. Там Чат с Алисой AI и Поиск с Алисой подключаются отдельными источниками, рядом с ChatGPT, Gemini, Claude, Perplexity, Grok, DeepSeek, GigaChat и Google AI Mode, всего десять ассистентов. Видно, в каких формулировках бренд всплывает, кого называют рядом с ним и как о нём говорят.

Ассистент не показывает десять ссылок. Он называет два-три имени, и попадание в этот короткий список и есть нейровидимость бренда.

Что смотреть по Алисе уже сейчас:

  1. Называет ли ассистент ваш бренд, когда у него спрашивают про вашу нишу.
  2. Кого он ставит рядом с вами и в каком порядке.
  3. На какие источники он ссылается: какие ваши страницы и чужие статьи цитирует.
  4. Как меняется тон упоминаний после ваших публикаций.

Инженерная часть, которую стоит забрать себе

Два решения из релиза полезны любой команде. Первое: оптимизатор перестроили так, чтобы данные между видеокартами пересылались одновременно с вычислениями, и шаг обучения ускорился примерно вдвое. Второе: обучающие данные отбирают каскадом классификаторов, где каждая следующая модель тяжелее, но работает с меньшим числом документов.

Оценить весь корпус тяжёлой моделью стоило бы больше 200 тысяч часов работы видеокарт. Каскад сократил вычисления в десятки раз и сохранил около 95% полезных документов. Плюс базу знаний отдельно пополнили правом, медициной и математикой.

Что я об этом думаю

Претрейн выглядит скромнее громкого запуска продукта, но по сути это фундамент. Российские команды получили основу, на которой можно строить свои агентные продукты, не выпрашивая доступ к закрытому API.

А брендам это сигнал поторопиться. Агентная Алиса не спросит, у кого лучше SEO. Она назовёт короткий список имён. Попасть в него дешевле сейчас, пока конкуренты меряют позиции в выдаче.

11