PRISM: 5 000+ промышленных траекторий, где робот учится не только видеть, но и чувствовать контакт
Большинство крупных датасетов для robot learning собрано вокруг сравнительно простых бытовых задач: взять объект, перенести, положить. Для реального производства этого недостаточно
Подключить электронный разъём, установить подшипник или выполнить точную сборку — это уже contact-rich manipulation, где роботу нужно понимать усилие, момент, проскальзывание и небольшие отклонения, которые иногда почти невозможно определить только по камере
Исследователи из Peking University, Delta Intelligence и партнёрских организаций представили PRISM - мультимодальный датасет промышленных навыков:
🟢 25+ промышленных задач - assembly, подключение компонентов, упаковка, установка деталей, сортировка на конвейере;
🟢 5 000+ robot trajectories + 5 000 human demonstrations;
🟢 45+ часов демонстраций и около 27 млн изображений;
🟢 синхронизированные multi-view RGB-D, 6DoF force/torque, robot state и proprioception; tactile-данные доступны для части эпизодов;
🟢 данные собирали на нескольких embodiments: Franka, Realman и LEJU, используя exoskeleton, tracker и VR teleoperation.
Самое интересное - авторы сразу проверили датасет на ACT, Diffusion Policy и π₀.
Предобучение на 5 000 траекториях улучшило результаты π₀ до 85% success rate на упаковке штангенциркуля и 85% на сортировке с конвейера. Но на точном plug/unplug электронных компонентов результат составил всего 25%.То есть даже современные policies всё ещё заметно проседают там, где нужно точно регулировать физический контакт и усилие.
На мой взгляд, это и делает PRISM интересным: развитие Physical AI упирается не только в масштабирование RGB-видео и VLA-моделей. Для выхода роботов из демонстраций в реальное производство потребуется всё больше данных о самом физическом взаимодействии с миром - force, torque, tactile и contact dynamics
Сейчас доступны paper, project page и GitHub; публикация самого датасета на странице проекта пока отмечена как Dataset soon.