Axis Robotics publie en open source l’un des plus vastes jeux de données de simulation pour bras Franka dédiés à l’IA incarnée

Axis Robotics ouvre un vaste jeu de données de simulation Franka pour l’IA physique, misant sur la quantité et la diversité plutôt que sur des démos « parfaites ».
il y a 1 heure
Axis Robotics publie en open source l’un des plus vastes jeux de données de simulation pour bras Franka dédiés à l’IA incarnée

Axis Robotics a mis en ligne en open source Axis Sim Dataset V1, l’un des plus grands jeux de données de simulation dédiés à la manipulation avec un bras Franka. Le jeu comprend l’intégralité des données, le code d’entraînement ainsi que les benchmarks, tous accessibles publiquement. V1 agrège plus de 50 000 trajectoires de simulation téléopérées par des humains, couvrant 207 tâches de manipulation et plus de 60 000 variantes de scènes sur un bras Franka Research 3 simulé.

Le jeu de données a déjà dépassé les 160 000 téléchargements, ce qui en fait aujourd’hui le dataset de simulation open source le plus téléchargé sur Hugging Face pour la manipulation avec un bras Franka. Sur les benchmarks, un pré-entraînement continu sur V1 améliore nettement les performances du modèle π0.5 et dépasse une base RoboCasa de taille équivalente, avec des résultats entièrement ouverts et vérifiables.

Снимок экрана 2026-09-04 в 11.20.48.png

Axis Robotics ambitionne de bâtir un moteur de données cumulatif de référence pour l’IA physique : une chaîne intégrée verticalement qui va de la simulation à grande échelle à la capture egocentrique dans le monde réel, en passant par la loco‑manipulation humanoïde et un post‑entraînement DAgger supervisé par l’humain. La société a levé 12 millions de dollars en amorçage, dans un tour mené par Hack VC, avec la participation de Nomad Capital, Pi Network Ventures, 10K Ventures et plusieurs business angels.

Un pari contre le dogme du « clean data only »

Dans la robotique, l’idée dominante veut que les démonstrations doivent être quasi optimales : filtrer pour ne garder que les trajectoires d’experts, standardiser les conditions de collecte et éliminer tout signal bruité avant d’oser imiter. La thèse d’Axis prend le contre‑pied : la qualité des données se joue au niveau de la distribution, pas de la trajectoire isolée. Si une foule suffisamment large et diversifiée produit des trajectoires bruitées et sous‑optimales, mais dont les erreurs ne sont pas corrélées, le bruit se compense statistiquement et une politique efficace émerge à l’entraînement.

Axis Sim Dataset V1 met cette thèse à l’épreuve, en public. Les trajectoires couvrent du pick‑and‑place, de l’empilage, du versement de liquide, la manipulation d’objets articulés et l’usage d’outils, toutes collectées via la plateforme de téléopération dans le navigateur de la société, Axis Hub, par une communauté distribuée de contributeurs plutôt que par une unique équipe d’experts. Le dataset a été élaboré en collaboration avec des chercheurs de UC Berkeley, Johns Hopkins, l’Université du Michigan et d’autres institutions.

Des résultats qui passent à l’échelle

Sur la suite de benchmarks LIBERO-Plus, le pré‑entraînement continu sur V1 fait passer le taux de succès de π0.5 de 83,9 % à 88,8 % et surclasse de 37,3 % un baseline RoboCasa365 de volume similaire. Les performances progressent de façon régulière à mesure que le volume de données de pré‑entraînement passe de 25 % à 100 % du jeu, sans signe de saturation, ce qui suggère que les gains proviennent de la diversité et de la couverture, et non d’un simple effet ponctuel. Les améliorations les plus marquées apparaissent sous perturbations de caméra, de bruit capteur et de configuration de scène — précisément les axes que la génération de données d’Axis randomise systématiquement.

Снимок экрана 2026-09-04 в 11.21.00.png

L’équipe indique qu’une version V2 est déjà en préparation, visant 1,2 million de trajectoires sur 1 200 tâches, avec généralisation multi‑embodiments et résultats sur plusieurs modèles VLA, pour démontrer que des données de simulation non optimales peuvent entraîner des politiques robustes.

Le moteur derrière le dataset

Ce dataset n’est qu’un des produits d’un moteur de données plus vaste et cumulatif. Là où un fournisseur traditionnel collecte selon un cahier des charges figé puis s’arrête, Axis utilise la performance des modèles et leurs cas d’échec pour déterminer quelles données collecter ensuite, de sorte que chaque cycle d’entraînement alimente le suivant. Ce moteur repose sur une stratégie hybride articulée autour de quatre grandes lignes de données, toutes aujourd’hui passées à l’échelle :

Simulation : plus de 200 000 contributeurs distribués sur Axis Hub, l’une des trois principales dApps sur Base, ont généré plus de 4,7 millions de trajectoires couvrant 13 types d’embodiments.

Egocentrique : un réseau géré de plus de 1 000 collecteurs à plein temps, formés et contrôlés qualité, capture des activités en vue à la première personne dans des logements et des sites professionnels de 14 secteurs d’activité. Plus de 200 000 heures sont déjà enregistrées, et le flux croît de plus de 4 000 heures par jour, avec une pose de la main validée par Vicon.

Loco‑manipulation : plus de 500 heures combinant mobilité et dextérité sur des humanoïdes réels (Unitree G1, Booster T2) via de la téléopération agnostique au matériel.

Post‑entraînement DAgger sous contrôle humain : plus de 500 heures de corrections « human‑in‑the‑loop » ciblant les cas limites rencontrés en déploiement.

Chaque tâche et chaque trajectoire est enregistrée on‑chain sur Base pour assurer la traçabilité, et les contributeurs sont rémunérés en fonction de la qualité vérifiée de leur travail.

De l’open data au déploiement industriel

Au‑delà de l’open source en simulation, Axis collabore directement avec des fabricants de robots pour bâtir des pipelines de données sur mesure, adaptés à chaque embodiment, ainsi que des priors de modèles spécifiques.

En tant que premier partenaire de Booster Robotics sur la simulation, Axis a reconstruit l’environnement opérationnel réel de Booster en jumeau numérique aligné sur les tâches, puis fait collecter par des contributeurs distribués plus de 42 000 épisodes de simulation dans cet environnement, distillés ensuite en un prior de modèle spécifique à Booster. Avec seulement 30 démonstrations sur robot réel, ce prior a atteint un taux de succès de 87,5 %, contre 37,5 % pour un π0.5 standard pré‑entraîné, soit des performances équivalentes à π0.5 avec deux fois moins de démonstrations dans le monde réel.

Les autres partenaires couvrent des sociétés d’embodiments (Feagine Robotics), des éditeurs de modèles (Manycore Tech, Dexmal) et des industriels de l’automatisation (Lotus Cars, Geely Auto). Axis alimente également des réseaux de robotique on‑chain : BitRobot sur Solana et OpenRoboto sur Bittensor.

Redéfinir la base de données de l’IA physique

« L’avenir de l’IA physique, ce n’est pas un dataset statique que l’on télécharge une fois », explique Chris Feng, fondateur d’Axis Robotics. « C’est un moteur qui produit en continu les données dont le modèle a besoin ensuite. L’échelle apporte une couverture large. La diversité garantit un bruit non biaisé. La boucle fermée transforme chaque échec en progrès. C’est ce qui crée l’effet de composition. »

Axis a été fondée par des chercheurs issus de UC Berkeley, CMU, Georgia Tech et SJTU, aux côtés de serial entrepreneurs ayant déjà porté des plateformes grand public au‑delà de 30 millions d’utilisateurs. Les travaux de recherche de la société sont conseillés par Jiachen Li, professeur assistant à Georgia Tech.

Lien vers l’article : https://arxiv.org/abs/2607.21588

Page du projet : https://axisaiorg.github.io/AXIS-V1/

Lien vers le dataset : https://huggingface.co/datasets/axisrobotics/Franka-Dataset

Code source sur Github : https://github.com/AxisAIOrg/Axis-V1-Training

Avertissement : Il s’agit d’un contenu tiers fourni par l’émetteur et publié à titre informatif. Yellow ne vérifie pas indépendamment les déclarations ici présentes et n’assume aucune responsabilité pour les erreurs ou omissions. Rien de ce qui précède ne constitue un conseil en investissement, juridique, comptable ou fiscal, ni une sollicitation d’achat ou de vente d’un actif.
Derniers communiqués de presse
Afficher tous les communiqués de presse
Dernières nouvelles
Voir toutes les nouvelles