DeepMind масштабирует SIMA 2 на персистентные 3D-миры
Google DeepMind анонсировала расширение пула игровых студий-партнеров для масштабного тестирования агентов семейства SIMA 2. В отличие от узкоспециализированных систем вроде AlphaStar, эта архитектура обучается действовать в произвольных 3D-средах исключительно через видеопоток и эмуляцию мыши с клавиатурой.
Спецификация vs Реальный прод
Декларируемый пайплайн опирается на мультимодальное ядро Gemini, которое связывает языковые инструкции игрока с низкоуровневым управлением. Агент получает сырые пиксели с частотой кадров рендера, удерживает контекстное окно визуальных эмбеддингов и возвращает координаты перемещения курсора без прямого доступа к API игрового движка.
На закрытых полигонах модель уверенно исполняет короткие цепочки команд. Однако в открытых персистентных песочницах вроде No Man’s Sky или Valheim вылезает классическая агентная болезнь. На длинных горизонтах планирования накапливается ошибка позиционирования, а цикл автономности начинает сбоить при динамической смене окружения и освещения.
Главный барьер для коммерческого внедрения сейчас упирается в инференс и задержки. Обработка десятков кадров в секунду через тяжелую мультимодальную модель создает ощутимый инпут-лаг, требуя значительных серверных мощностей на каждый активный инстанс.
Насколько оправдан перенос тяжелых мультимодальных агентов в реальный рендер ради адаптивности NPC, или гибридные скрипты с классическим деревом поведения пока останутся вне конкуренции?
Больше интересного в моем телеграм канале