Яндекс открыл веса новой Алисы: что получает бизнес вместе с базовой моделью
21 сентября Яндекс объявил об открытии AliceAI-Foundation-80B-A3B-Base. Команда сообщает, что обучила модель с нуля, без стартовых весов сторонних моделей. Скачать результат можно на Hugging Face.
Для бизнеса интересна сама возможность взять новую российскую модель за основу собственного решения. Но между скачанными весами и сервисом, которому можно поручить работу с клиентами, остаётся отдельный проект.
Открытые веса модели и работа над собственным продуктом
Редакционная иллюстрация. Не интерфейс Алисы и не результат тестирования модели.
Что именно открыл Яндекс?
В официальной карточке указаны 80 млрд параметров, из которых при обработке каждого токена активируются 3 млрд. Заявленный контекст — до 262 144 токенов. Веса опубликованы под Apache 2.0.
Яндекс также выложил два фактологических бенчмарка с русскоязычным контекстом — WikiWebFacts и HardMultiQA. Компания приводит результаты внутренних сравнений с другими открытыми моделями. Это замеры разработчика: мы их самостоятельно не воспроизводили.
Слово Base в названии здесь существенно. Выпущенный вариант прошёл предобучение, но не последующие этапы post-training и alignment. Карточка прямо предупреждает:
«Она не является готовым решением для непосредственного использования в пользовательских продуктах и сервисах».
Модель предназначена прежде всего для исследований, экспериментов и дальнейшей доработки. Это описание опубликованного варианта весов, а не оценка возможностей приложения Алисы.
Какой вопрос теперь стоит перед заказчиком?
Наш редакционный вывод: обсуждать такой релиз полезнее с конкретной задачей в руках. Например, компания хочет разбирать обращения клиентов по внутренним категориям. Ей нужен ответ, попадает ли обращение в правильную очередь, а не только впечатление от красивого текста модели.
Для такого проекта команда может заранее подготовить обезличенные примеры и правильные ответы. Отдельно собрать неоднозначные обращения: два вопроса в одном сообщении, отсутствующие сведения, названия товаров с опечатками. Затем договориться, когда система должна передать случай человеку.
Это предлагаемый способ постановки задачи, а не проведённый нами тест AliceAI. Он помогает сформулировать, ради чего вообще брать базовую модель и вкладываться в её доработку.
Руководителю стоит попросить команду разделить смету на подготовку данных, обучение, развёртывание и дальнейшее сопровождение. Сам факт публикации весов не сообщает, сколько будет стоить конкретный сервис. Без нагрузки, требований к задержке и критериев качества такой расчёт останется предположением.
Кому стоит присмотреться к релизу?
По нашей оценке, прежде всего командам, которые уже рассматривают собственную модель или дообучение под определённую задачу. У них появился новый кандидат для сравнения. Проверять его разумно на том же наборе примеров, по которому принимаются остальные решения о продукте.
Если же задача — завтра дать сотрудникам готового помощника, сначала нужен выбор рабочего сервиса. Исследовательский проект с базовой моделью стоит планировать отдельно: с ответственным за результат и понятной причиной, почему существующие решения не подходят.
Релиз интересен возможностью выбирать. Насколько эта возможность полезна конкретной компании, покажут её данные, требования и результаты проверки.
provod.ai — обновляйте AI-стек, не переписывая продукт
Перед отдельным проектом дообучения полезно понять, как вашу задачу решают уже доступные модели. Подготовьте небольшой разрешённый набор примеров и одинаковые критерии оценки.
Зарегистрируйтесь в Provod, чтобы начать сравнение. Актуальные модели и их возможности смотрите в каталоге. Наличие AliceAI-Foundation в Provod здесь не заявляется; публикация открытых весов сама по себе не означает подключение модели к платформе.
Что для вашей команды стало бы достаточной причиной дообучать собственную модель: качество на специальных задачах, требования к развёртыванию или стоимость при большой нагрузке?