Роботы получили локальный мозг. NVIDIA открыли Cosmos 3 Edge на 4 млрд параметров

NVIDIA выпустили Cosmos 3 Edge компактную открытую world model, созданную специально для роботов, беспилотных автомобилей и камер, которым некогда ждать ответа из облака.

Это не очередной чат-бот на четыре миллиарда параметров. Модель должна понимать, что происходит в физическом мире, прогнозировать последствия и сразу решать, какое действие выполнить дальше.

По сути, NVIDIA собрали локальный мозг для машин.

Увидел, подумал, сделал

Обычная модель компьютерного зрения умеет распознать предмет в кадре. Например, понять, что перед роботом лежит банан.

Cosmos 3 Edge идет дальше. Она определяет положение объекта, отслеживает движение манипулятора, прогнозирует момент контакта и выбирает действие, которое поможет успешно схватить банан и положить его на тарелку.

Одна модель умеет:

  • Понимать происходящее на изображениях и видео.
  • Прогнозировать, как сцена изменится через несколько секунд.
  • Симулировать последствия действий.
  • Восстанавливать действие по его результату.
  • Генерировать команды для роботов и автономных систем.

На вход можно отправлять текст, изображения, видео и траектории действий. На выходе получать объяснения, новые кадры, прогноз развития сцены или готовые управляющие команды.

Настоящий ИИ на краю

Главная фишка Cosmos 3 Edge локальный запуск рядом с камерами и сенсорами.

Модель работает на NVIDIA Jetson, DGX, RTX PRO и обычных GeForce RTX. Отдельный reasoning-модуль на два миллиарда параметров, построенный на Nemotron, можно запускать даже на Jetson Orin с 8 ГБ памяти.

В режиме управления роботом Cosmos обрабатывает картинку в разрешении 640×360, генерирует сразу 32 действия за один проход и работает на частоте 15 Гц на Jetson Thor.

Для физического ИИ это критично. Если робот тянется к человеку, машина перестраивается в соседний ряд, а камера замечает падение рабочего на заводе, ждать похода запроса в дата-центр и обратно никто не будет.

Мозг должен находиться там же, где происходят события.

Два трансформера под одним капотом

Внутри Cosmos 3 Edge работают сразу две башни:

  • Авторегрессионный трансформер отвечает за понимание изображения, текста и логические рассуждения.
  • Диффузионный трансформер прогнозирует и генерирует видео, звук и действия.

Они используют разные механизмы генерации, но связаны общим мультимодальным вниманием.

Если перевести с языка исследователей на человеческий, одна половина модели отвечает на вопрос «что сейчас происходит», а вторая симулирует «что произойдет дальше, если я сделаю вот это».

Благодаря общей картине мира модель связывает пиксели с движением, физикой, пространством и управляющими командами.

Роботы, автопилоты и камеры с мозгами

NVIDIA выделяет три основных сценария.

Робототехника. Cosmos можно дообучить на собственных данных робота и превратить в локальную политику управления для манипуляторов, складских машин и гуманоидов.

Автономный транспорт. Модель понимает дорожные сцены, рассуждает о ситуации в трафике и прогнозирует намерения пешеходов, водителей и других участников движения.

Умная инфраструктура. Камеры на заводах, складах и дорогах смогут не просто фиксировать видео, а анализировать поток в реальном времени: замечать аварии, опасное поведение, нарушения техники безопасности и логистические проблемы.

По данным NVIDIA, среди открытых моделей сопоставимого размера Cosmos 3 Edge занимает первое место в VANTAGE-Bench по анализу реальных видеосцен.

Роботы получили локальный мозг. NVIDIA открыли Cosmos 3 Edge на 4 млрд параметров

NVIDIA открыли не только веса

Вместе с моделью опубликованы:

  • Веса Cosmos 3 Edge.
  • Код и конфигурации.
  • Рецепты постобучения.
  • Инструменты для адаптации под собственных роботов и датасеты.
  • Версия Cosmos 3 Edge Policy, дообученная на наборе DROID для управления роботизированными манипуляторами.

Модель распространяется по лицензии OpenMDW 1.1 и разрешена для коммерческого и некоммерческого использования.

Главный сдвиг здесь даже не в рекорде очередного бенчмарка. До сих пор серьезный физический ИИ обычно требовал мощного сервера или постоянного подключения к облаку. NVIDIA пытаются уместить весь цикл «увидеть — понять — предсказать — действовать» непосредственно в устройство.

Теперь камера может рассуждать без отправки видео наружу, автомобиль — реагировать без задержки сети, а робот — самостоятельно представлять последствия своего следующего движения.

Похоже, после локальных языковых моделей начинается новая гонка, кто первым засунет полноценную модель мира в каждую машину, камеру и железную руку.

Доверили бы вы такой нейросети управлять автомобилем или роботом рядом с людьми?

Не отставайте от технологий! Подписывайтесь на Telegram-канал, чтобы быть в курсе последних трендов и лайфхаков.

3
1