Axis Robotics открыла в открытый доступ Axis Sim Dataset V1 — один из крупнейших симуляционных датасетов для задач манипуляции манипулятором Franka. В открытом доступе размещён полный набор данных, код для обучения моделей и эталонные бенчмарки.
Версия V1 построена на основе более чем 50 000 телепоуправляемых человеком симуляционных траекторий по 207 задачам манипуляции и свыше 60 000 вариантов сцен на симулированном манипуляторе Franka Research 3.
На площадке Hugging Face этот набор уже собрал более 160 000 загрузок, став самым скачиваемым открытым симуляционным датасетом для манипуляций Franka. В бенчмарках непрерывное предобучение на V1 повысило метрику π0.5 и превзошло сопоставимый по объёму базовый датасет RoboCasa, причём все результаты открыты и поддаются проверке.

Axis Robotics строит масштабируемый «компаундинг»-движок данных для Physical AI — вертикально интегрированную систему, охватывающую крупномасштабную симуляцию, эгоцентричный сбор данных в реальном мире, локо-манипуляцию гуманоидов и постобучение по схеме DAgger с участием человека. На посевном раунде компания привлекла $12 млн во главе с Hack VC при участии Nomad Capital, Pi Network Ventures, 10K Ventures и ряда бизнес-ангелов.
Ставка против парадигмы «только чистые данные»
В робототехнике широко распространено убеждение, что демонстрации должны изначально быть почти оптимальными: отфильтровать только экспертные траектории, стандартизировать постановку эксперимента и выбросить весь «шум» до того, как модель начнёт чему‑то подражать. Axis выстраивает гипотезу наоборот: качество данных — это свойство распределения, а не отдельной траектории. Если достаточно большая и разнородная толпа операторов генерирует «шумные», далекие от оптимума траектории, а их ошибки некоррелированы, шум усредняется, и на обучении выживает работоспособная политика.
Axis Sim Dataset V1 делает эту гипотезу предметом публичной проверки. Траектории охватывают pick-and-place, штабелирование, переливание, управление сочленёнными объектами и работу с инструментами. Все данные собраны через браузерную платформу телеприсутствия Axis Hub распределённым сообществом операторов, а не единой командой экспертов. Над датасетом Axis работала совместно с исследователями из Калифорнийского университета в Беркли, Университета Джонса Хопкинса, Мичиганского университета и других академических центров.
Масштабируемые результаты
На бенчмарке LIBERO-Plus непрерывное предобучение на V1 повышает π0.5 с 83,9% до 88,8% и опережает сопоставимый по объёму базовый сценарий RoboCasa365 на 37,3 п.п. Производительность устойчиво растёт по мере увеличения доли данных предобучения с 25% до 100% датасета без признаков насыщения — это указывает на то, что выигрыш обеспечивается широтой и разнообразием данных, а не разовой «аномалией». Наибольший прирост достигается в условиях возмущений камеры, сенсорного шума и перестановки объектов в сцене — именно по этим осям Axis рандомизирует симуляции на этапе генерации.

Команда отмечает, что над V2 уже ведётся работа: масштаб увеличат до 1,2 млн траекторий по 1 200 задачам. В фокусе — обобщение через разные типы роботов (cross-embodiment) и результаты по нескольким VLA‑моделям, которые должны дополнительно подтвердить, что субоптимальные симуляционные данные позволяют обучать устойчивые политики управления.
Движок данных за пределами одного датасета
Опубликованный датасет — лишь один из выходов более крупного, постоянно самоукрупняющегося «движка» данных. В отличие от классического провайдера данных, который собирает данные под фиксированное ТЗ и останавливается, Axis использует качество работы моделей и их отказы для определения того, что нужно собирать дальше. Каждый цикл обучения задаёт повестку для следующего, формируя замкнутый контур.
Движок работает по гибридной стратегии сразу по четырём линиям данных, и все четыре уже масштабированы:
Симуляция: более 200 000 распределённых участников на Axis Hub — одном из трёх крупнейших dApp на сети Base — сгенерировали свыше 4,7 млн траекторий по 13 типам роботов.
Эгоцентричные данные: управляемая сеть из более чем 1 000 штатных, обученных контролю качества сборщиков, которые фиксируют действия от первого лица в реальных домах и бизнесах в 14 отраслях. Уже накоплено более 200 000 часов видео, причём объём растёт более чем на 4 000 часов в день; данные дополнены валидацией позы кисти по системе Vicon.
Локо-манипуляция: свыше 500 часов данных, сочетающих мобильность и манипуляцию на реальных гуманоидных платформах (Unitree G1, Booster T2) через аппаратно-агностичное телоуправление.
Постобучение DAgger с участием человека: более 500 часов корректировок «человек в контуре», сфокусированных на пограничных сценариях реального развёртывания.
Каждая задача и траектория фиксируются ончейн в сети Base для подтверждения происхождения, а участники вознаграждаются за проверенное качество работы.
От открытых данных к коммерческим внедрениям
Помимо открытой публикации симуляционных данных, Axis напрямую работает с компаниями — производителями роботов, строя для них кастомные, «под тело» робота конвейеры данных и модельные прайоры.
В качестве первого партнёра по симуляционным данным для Booster Robotics Axis воссоздала рабочее пространство Booster в виде цифрового двойника, точно отражающего реальные задачи, и привлекла распределённых операторов для сбора более 42 000 симуляционных эпизодов. На их основе был дистиллирован прайор‑модель, специфичный для роботов Booster. Лишь при помощи 30 демонстраций на реальном роботе этот прайор достиг 87,5% успешных выполнений задач против 37,5% у стандартного π0.5, фактически сравнявшись с π0.5 при вдвое меньшем числе реальных демонстраций.
Среди других партнёров — производители роботов (Feagine Robotics), разработчики моделей (Manycore Tech, Dexmal) и промышленные заказчики автоматизации (Lotus Cars, Geely Auto). Axis также поставляет данные для ончейн‑сетей робототехники: BitRobot в экосистеме Solana и OpenRoboto в сети Bittensor.
Переосмысление базы данных для Physical AI
«Будущее Physical AI — это не статичный датасет, который вы один раз скачали», — говорит основатель Axis Robotics Крис Фэн. — «Это движок, который постоянно генерирует именно те данные, которые модели нужны дальше. Масштаб даёт широкое покрытие. Диверсификация делает шум несмещённым. Замкнутый контур превращает каждый провал в прогресс. Именно это и даёт компаунд‑эффект».
Axis основана исследователями из UC Berkeley, CMU, Georgia Tech и Шанхайского университета Цзяо Тун (SJTU), а также серийными предпринимателями, выводившими потребительские платформы на аудиторию более 30 млн пользователей. Научным консультантом компании выступает доцент Georgia Tech Дзячэнь Ли (Jiachen Li).
Ссылка на статью: https://arxiv.org/abs/2607.21588
Страница проекта: https://axisaiorg.github.io/AXIS-V1/
Ссылка на датасет: https://huggingface.co/datasets/axisrobotics/Franka-Dataset
Репозиторий с кодом: https://github.com/AxisAIOrg/Axis-V1-Training
