DeepMind масштабирует SIMA 2 на персистентные 3D-миры

DeepMind масштабирует SIMA 2 на персистентные 3D-миры

Google DeepMind анонсировала расширение пула игровых студий-партнеров для масштабного тестирования агентов семейства SIMA 2. В отличие от узкоспециализированных систем вроде AlphaStar, эта архитектура обучается действовать в произвольных 3D-средах исключительно через видеопоток и эмуляцию мыши с клавиатурой.

Спецификация vs Реальный прод

Декларируемый пайплайн опирается на мультимодальное ядро Gemini, которое связывает языковые инструкции игрока с низкоуровневым управлением. Агент получает сырые пиксели с частотой кадров рендера, удерживает контекстное окно визуальных эмбеддингов и возвращает координаты перемещения курсора без прямого доступа к API игрового движка.

На закрытых полигонах модель уверенно исполняет короткие цепочки команд. Однако в открытых персистентных песочницах вроде No Man’s Sky или Valheim вылезает классическая агентная болезнь. На длинных горизонтах планирования накапливается ошибка позиционирования, а цикл автономности начинает сбоить при динамической смене окружения и освещения.

Главный барьер для коммерческого внедрения сейчас упирается в инференс и задержки. Обработка десятков кадров в секунду через тяжелую мультимодальную модель создает ощутимый инпут-лаг, требуя значительных серверных мощностей на каждый активный инстанс.

Насколько оправдан перенос тяжелых мультимодальных агентов в реальный рендер ради адаптивности NPC, или гибридные скрипты с классическим деревом поведения пока останутся вне конкуренции?

Больше интересного в моем телеграм канале