Яндекс выложил Alice AI Foundation LLM в открытый доступ. Что умеет модель и зачем она нужна агентной Алисе
Утром увидел новость: Яндекс выложил в открытый доступ Alice AI Foundation LLM. Это претрейн новой большой языковой модели, которую обучили с нуля. Не чужой опенсорс с дообучением, а свой фундамент. Лицензия Apache 2.0: брать можно и в исследования, и в бизнес.
Ниже коротко: что выложили, что в этом важно и почему меня зацепило одно слово из релиза, агентные.
Что выложили
- Архитектура MoE: 80 млрд параметров, из них в моменте работают только 3 млрд. Отсюда скорость и скромные требования к железу.
- Модель умеет рассуждать и работать в агентных сценариях.
- На русском отвечает лучше многих мировых аналогов, особенно в вопросах на факты.
- Лицензия Apache 2.0: использовать можно свободно, в том числе в коммерции.
- Вместе с моделью открыты два новых теста: WikiWebFacts и HardMultiQA.
Модель экспериментальная. На ней Яндекс обкатывает решения для будущей рассуждающей модели, одной на все сервисы. Именно она должна дать Алисе агентные умения: не просто отвечать, а выполнять поручения.
Цифры, на которые стоит смотреть
На олимпиадных задачах по математике модель делит первое место с Qwen3.5 и решает почти все задания. В написании кода она обходит модель NVIDIA, у которой активных параметров вчетверо больше.
В знании фактов картина та же. Она обгоняет открытую модель DeepSeek, где 284 млрд параметров против 80, и отвечает на уровне прошлой закрытой модели Яндекса, которая втрое крупнее.
Смысл простой: размер перестал быть главным. Важнее, сколько параметров работает на каждом шаге и насколько чистые данные в модель загрузили.
Бенчмарки на русском, которых раньше не было
Яндекс собрал два своих набора задач на русском. WikiWebFacts это короткие вопросы и короткие ответы: даты, определения, события, люди. HardMultiQA собран из обезличенных запросов к Алисе и уходит в редкие темы: медицина, право, IT, искусство.
Во втором наборе мало вспомнить один факт. Нужно выбрать несколько верных вариантов, перечислить сразу несколько фактов или найти ошибку в тексте. Англоязычные тесты такие знания не измеряют. Оба набора открыты вместе с моделью, с эталонными ответами и протоколом оценки.
Алиса давно перестала быть колонкой на кухне
Теперь личное наблюдение, ради которого я и сел писать. Алиса давно не один продукт. Она встроена в поиск, карты, телевизоры, машины, умный дом и в приложения партнёров. У многих новых сервисов она появляется прямо в интерфейсе.
Пока это голосовой помощник, он выдаёт короткую справку. Когда под ним окажется рассуждающая модель, человек перестанет листать выдачу и просто спросит: что выбрать, где купить, кому доверить задачу. Ответ ассистента станет единственным экраном.
Почему это упирается в нейровидимость бренда
Для компаний вывод такой: место в поисковой выдаче больше не равно месту в ответе ассистента. Появилась отдельная задача, попадать в ответы нейросетей. Её называют GEO. И русскоязычные ассистенты Яндекса тут уже не экзотика.
Свою видимость я смотрю через сторонний сервис brandfound, сайт brandfound.ai. Там Чат с Алисой AI и Поиск с Алисой подключаются отдельными источниками, рядом с ChatGPT, Gemini, Claude, Perplexity, Grok, DeepSeek, GigaChat и Google AI Mode, всего десять ассистентов. Видно, в каких формулировках бренд всплывает, кого называют рядом с ним и как о нём говорят.
Ассистент не показывает десять ссылок. Он называет два-три имени, и попадание в этот короткий список и есть нейровидимость бренда.
Что смотреть по Алисе уже сейчас:
- Называет ли ассистент ваш бренд, когда у него спрашивают про вашу нишу.
- Кого он ставит рядом с вами и в каком порядке.
- На какие источники он ссылается: какие ваши страницы и чужие статьи цитирует.
- Как меняется тон упоминаний после ваших публикаций.
Инженерная часть, которую стоит забрать себе
Два решения из релиза полезны любой команде. Первое: оптимизатор перестроили так, чтобы данные между видеокартами пересылались одновременно с вычислениями, и шаг обучения ускорился примерно вдвое. Второе: обучающие данные отбирают каскадом классификаторов, где каждая следующая модель тяжелее, но работает с меньшим числом документов.
Оценить весь корпус тяжёлой моделью стоило бы больше 200 тысяч часов работы видеокарт. Каскад сократил вычисления в десятки раз и сохранил около 95% полезных документов. Плюс базу знаний отдельно пополнили правом, медициной и математикой.
Что я об этом думаю
Претрейн выглядит скромнее громкого запуска продукта, но по сути это фундамент. Российские команды получили основу, на которой можно строить свои агентные продукты, не выпрашивая доступ к закрытому API.
А брендам это сигнал поторопиться. Агентная Алиса не спросит, у кого лучше SEO. Она назовёт короткий список имён. Попасть в него дешевле сейчас, пока конкуренты меряют позиции в выдаче.