Xiaomi потратила около $2,6 млн на этап обучения MiMo через попытки, ошибки и обратную связь.

Xiaomi потратила около $2,6 млн на этап обучения MiMo через попытки, ошибки и обратную связь.

В отчёте MiMo-V2.6 команда разбирает, как масштабировать обучение с подкреплением для ИИ-агентов.

Модель решает задачи в рабочих средах, получает оценку результата и обучается на собранном опыте. Масштабируют сразу три компонента:

• количество попыток и пропускную способность;

• разнообразие задач: код, визуальные сценарии, работа с инструментами и кибербезопасность;

• вычисления на проверку решений.

Интересная деталь: проверяющие сравнивают решения внутри группы, помогая поощрять более качественные и короткие пути к результату. Отдельно предусмотрена защита от *reward hacking*, когда модель находит способ получить награду без полноценного решения задачи.

По данным Xiaomi, после этого этапа результат Pro на DeepSWE v1.1 вырос с 58,4% до 72,6%, а Flash с 48,8% до 65,7%. Команда также открыла веса, RL-фреймворк и более 7 000 тренировочных сред.

https://www.chapterpal.com/s/f8dd8d6f/mimo-v26-scaling-reinforcement-learning-towards-self-improvement

22
11