Axis Robotics відкриває один із найбільших симуляційних датасетів для маніпулятора Franka у сфері Physical AI

Axis Robotics відкрила великий симуляційний датасет Franka, показавши масштабовані виграші від «шумних» даних і побудувавши двигун даних для Physical AI.
1 годину тому
Axis Robotics відкриває один із найбільших симуляційних датасетів для маніпулятора Franka у сфері Physical AI

Axis Robotics оприлюднила Axis Sim Dataset V1 — один із найбільших відкритих симуляційних датасетів для маніпуляцій маніпулятором Franka, де у вільному доступі весь масив даних, навчальний код і бенчмарки. V1 сформовано з понад 50 000 телероботизованих людиною симуляційних траєкторій для 207 завдань маніпуляції та понад 60 000 варіантів сцен на віртуальному маніпуляторі Franka Research 3.

Датасет вже зібрав понад 160 000 завантажень, ставши найбільш скачуваним відкритим симуляційним набором для маніпулятора Franka на Hugging Face. У бенчмарках безперервне попереднє навчання на V1 підняло показник π0.5 і перевершило об’ємно зіставний базовий сценарій RoboCasa; усі результати відкриті й піддаються незалежній верифікації.

Снимок экрана 2026-09-04 в 11.20.48.png

Axis Robotics вибудовує «компаундинг»-двигун даних для Physical AI — вертикально інтегровану систему, що охоплює великомасштабну симуляцію, егоцентричний збір реальних даних, локо-маніпуляцію гуманоїдів і посттренування за схемою DAgger із залученням людини. Компанія залучила $12 млн seed-фінансування, раунд очолив Hack VC за участі Nomad Capital, Pi Network Ventures, 10K Ventures та низки ангельських інвесторів.

Ставка проти «тільки чистих даних»

У робототехніці часто виходять із припущення, що демонстрації мають бути майже оптимальними з самого початку: відфільтрувати лише експертні траєкторії, стандартизувати сетап і прибрати будь-який шум до того, як на даних можна буде безпечно навчатися. Теза Axis йде в протилежний бік: якість даних визначається на рівні розподілу, а не окремої траєкторії. Коли достатньо велика й різноманітна спільнота генерує «шумні», субоптимальні траєкторії, а їхні помилки некорельовані, шум усереднюється, і життєздатна політика зберігається в процесі навчання.

Axis Sim Dataset V1 виносить цю тезу на публічний тест. Траєкторії охоплюють pick-and-place, складання, наливання рідин, роботу з артикуляційними об’єктами та інструментами — і всі вони зібрані через браузерну платформу телероботики Axis Hub розподіленою спільнотою, а не однією командою експертів. Над датасетом працювали дослідники з UC Berkeley, Університету Джонса Гопкінса, Університету Мічигану та інших інституцій.

Результати, що масштабуються

У бенчмарку LIBERO-Plus безперервне попереднє навчання на V1 підвищує π0.5 з 83,9% до 88,8% успішності та на 37,3% перевершує базу RoboCasa365 за однакового обсягу даних. Продуктивність стабільно зростає в міру масштабування обсягу попереднього навчання з 25% до 100% датасету без жодних ознак насичення — це свідчить про те, що виграш забезпечують саме різноманіття й покриття, а не разовий ефект. Найбільші покращення спостерігаються за умов змін камери, шумів сенсорів та варіацій розкладки сцени — саме за цими осями Axis випадково змінює умови в процесі генерації.

Снимок экрана 2026-09-04 в 11.21.00.png

За словами команди, V2 уже в роботі: масштабування до 1,2 млн траєкторій по 1 200 завданнях, із крос-інкарнаційною (cross-embodiment) генералізацією та результатами на кількох VLA-моделях, що додатково підтверджують: субоптимальні симуляційні дані здатні навчати стійкі політики.

Двигун, що стоїть за датасетом

Датасет — це лише один із виходів більшого, активно «компаундингового» двигуна даних. Якщо класичний провайдер даних збирає масив за фіксованою специфікацією й зупиняється, Axis використовує продуктивність моделі та кейси відмов для визначення, що збирати далі, щоб кожен цикл навчання інформував наступний. Цей двигун працює за гібридною стратегією на чотирьох потоках даних, і всі чотири вже масштабовано:

Simulation: понад 200 000 розподілених учасників у Axis Hub, який входить до топ-3 dApp на Base, згенерували понад 4,7 млн траєкторій у 13 типах роботизованих тіл.

Egocentric: керована мережа з понад 1 000 повноцінних збирачів даних із QC-контролем фіксує першоособовий досвід у реальних домогосподарствах і бізнесах у 14 галузях. Уже нагромаджено понад 200 000 годин відео, обсяг зростає більш ніж на 4 000 годин щодня, із Vicon-перевіреною позицією кисті.

Loco-manipulation: понад 500 годин даних, що поєднують мобільність і спритну маніпуляцію на реальних гуманоїдах (Unitree G1, Booster T2) через апаратно-агностичну телероботику.

Human-gated DAgger post-training: понад 500 годин корекції «людина в контурі», сфокусованої на крайових сценаріях розгортання.

Кожне завдання і кожна траєкторія записані on-chain у мережі Base для підтвердження походження, а контриб’ютори отримують винагороду за підтверджену якість роботи.

Від відкритих даних до комерційних впроваджень

Окрім відкритого доступу до симуляційних даних, Axis безпосередньо співпрацює з виробниками робототехнічних платформ, вибудовуючи кастомні, специфічні для конкретного «тіла» пайплайни даних і модельні пріори.

Як перший партнер Booster Robotics із симуляційних даних, Axis відтворила реальний робочий простір Booster у вигляді «цифрового двійника», вирівняного під завдання, залучила розподілених учасників до збору понад 42 000 симуляційних епізодів і дистилювала їх у спеціальний Booster-пріор моделі. Всього на 30 демонстраціях із реальним роботом цей пріор досяг 87,5% успіху проти 37,5% у стандартної моделі π0.5 «з коробки», зрівнявшись із π0.5 за вдвічі меншої кількості реальних демонстрацій.

Серед інших партнерів — виробники робототехнічних платформ (Feagine Robotics), модельні компанії (Manycore Tech, Dexmal) та гравці промислової автоматизації (Lotus Cars, Geely Auto). Axis також постачає дані для on-chain-мереж робототехніки: BitRobot у Solana та OpenRoboto в Bittensor.

Переосмислення бази даних для Physical AI

«Майбутнє Physical AI — це не статичний датасет, який ви один раз завантажили», — каже засновник Axis Robotics Кріс Фенг. — «Це двигун, який безперервно генерує саме ті дані, які моделі потрібні далі. Масштаб дає широке покриття. Різноманіття тримає шум незміщеним. Замкнений цикл перетворює кожен збій на прогрес. Саме це й компаундується».

Axis заснована дослідниками з UC Berkeley, CMU, Georgia Tech і SJTU, а також серійними підприємцями, які вже масштабували споживчі платформи до понад 30 млн користувачів. Науковим радником компанії виступає доцент Georgia Tech Цзячен Лі (Jiachen Li).

Посилання на публікацію: https://arxiv.org/abs/2607.21588

Сторінка проєкту: https://axisaiorg.github.io/AXIS-V1/

Посилання на датасет: https://huggingface.co/datasets/axisrobotics/Franka-Dataset

Кодова база на Github: https://github.com/AxisAIOrg/Axis-V1-Training

Відмова від відповідальності: Це контент третьої сторони, наданий емітентом і опублікований виключно з інформаційною метою. Yellow не перевіряє наведені тут твердження та не несе відповідальності за помилки чи пропуски. Нічого з наведеного не є інвестиційною, юридичною, бухгалтерською або податковою порадою чи закликом купувати або продавати будь-які активи.
Останні пресрелізи
Показати всі пресрелізи
Останні новини
Показати всі новини