A Axis Robotics publicou o Axis Sim Dataset V1, um dos maiores conjuntos de dados abertos de simulação para manipulação com braço Franka, com dataset completo, código de treinamento e benchmarks totalmente disponíveis ao público. O V1 foi construído a partir de mais de 50.000 trajetórias de simulação teleoperadas por humanos, cobrindo 207 tarefas de manipulação e mais de 60.000 variações de cena em um braço Franka Emika Research 3 simulado.
O dataset já ultrapassou 160.000 downloads, tornando-se o conjunto de simulação aberta para manipulação com Franka mais baixado no Hugging Face. Em benchmarks, o pré-treinamento contínuo no V1 elevou o desempenho de π0.5 e superou um baseline RoboCasa de mesmo volume, com todos os resultados abertos e auditáveis.

A Axis Robotics está construindo um “motor de dados” composto para IA física, um sistema verticalmente integrado que abrange simulação em larga escala, captura egocêntrica no mundo real, loco-manipulação em humanoides e pós-treinamento DAgger com supervisão humana. A empresa levantou US$ 12 milhões em rodada seed liderada pela Hack VC, com participação de Nomad Capital, Pi Network Ventures, 10K Ventures e investidores-anjo.
Uma aposta contra o “só dado limpo”
Um pressuposto comum em robótica é que demonstrações precisam ser quase ótimas desde o início — filtrar apenas trajetórias de especialista, padronizar o setup e jogar fora tudo que pareça ruidoso antes de imitar. A tese da Axis vai na direção oposta: qualidade de dados é uma propriedade da distribuição, não de cada trajetória isolada. Quando uma base ampla e diversa de usuários gera trajetórias ruidosas e subótimas, mas com erros não correlacionados, o ruído tende a se anular em média e uma política funcional emerge no treinamento.
O Axis Sim Dataset V1 coloca essa tese em teste público. Suas trajetórias cobrem tarefas de pega-e-coloca, empilhamento, despejar líquidos, manipulação de objetos articulados e uso de ferramentas, tudo coletado via a plataforma de teleoperação em navegador Axis Hub, por uma multidão distribuída, e não por um time único de especialistas. O dataset foi desenvolvido em parceria com pesquisadores da UC Berkeley, Johns Hopkins, Universidade de Michigan e outras instituições.
Resultados em escala
No benchmark LIBERO-Plus, o pré-treinamento contínuo com o V1 eleva a taxa de sucesso de π0.5 de 83,9% para 88,8% e supera um baseline RoboCasa365 de mesmo volume em 37,3%. O desempenho melhora de forma consistente conforme o volume de pré-treinamento cresce de 25% a 100% do dataset, sem sinal de saturação — evidência de que os ganhos vêm de diversidade e cobertura, não de um pico pontual. As maiores melhorias aparecem justamente sob perturbações de câmera, ruído de sensor e mudanças de layout, os eixos que a Axis randomiza na geração.

A equipe afirma que o V2 já está em desenvolvimento, escalando para 1,2 milhão de trajetórias em 1.200 tarefas, com generalização entre diferentes corpos robóticos (cross-embodiment) e resultados em múltiplos modelos VLA, mostrando que dados subótimos de simulação conseguem treinar políticas robustas.
O motor por trás do dataset
O dataset é apenas uma das saídas de um motor de dados maior e em constante composição. Enquanto um fornecedor tradicional coleta até cumprir uma especificação fixa e para, a Axis usa o desempenho do modelo e seus casos de falha para decidir o que deve ser coletado a seguir — cada rodada de treinamento alimenta a próxima. Esse motor opera com uma estratégia híbrida em quatro frentes de dados, todas já rodando em escala:
Simulação: mais de 200.000 contribuidores distribuídos no Axis Hub, um dos três principais dApps na Base, gerando mais de 4,7 milhões de trajetórias em 13 tipos de robôs.
Egocêntrico: uma rede gerenciada de mais de 1.000 coletores em tempo integral, treinados em controle de qualidade, registrando atividades em primeira pessoa em casas e empresas reais de 14 setores diferentes: mais de 200.000 horas já acumuladas e crescimento de mais de 4.000 horas por dia, com pose de mãos validada por Vicon.
Loco-manipulação: mais de 500 horas combinando mobilidade e destreza em humanoides reais (Unitree G1, Booster T2) via teleoperação agnóstica a hardware.
Pós-treinamento DAgger com supervisão humana: mais de 500 horas de correções com humano no loop, voltadas a casos de borda em produção.
Cada tarefa e trajetória é registrada on-chain na Base para garantir procedência, e os contribuidores são remunerados de acordo com a qualidade verificada do trabalho.
Do open data ao uso comercial
Além de abrir dados de simulação, a Axis trabalha diretamente com fabricantes de robôs para construir pipelines de dados e priors de modelo específicos para cada plataforma física.
Como primeira parceira de simulação da Booster Robotics, a Axis reconstruiu o ambiente real de trabalho da Booster como um gêmeo digital alinhado às tarefas, mobilizou contribuidores distribuídos para coletar mais de 42.000 episódios de simulação nesse gêmeo e destilou os dados em um prior de modelo dedicado à Booster. Com apenas 30 demonstrações em robôs reais, esse prior atingiu 87,5% de sucesso, contra 37,5% de um π0.5 padrão, igualando o π0.5 com metade das demonstrações no mundo real.
Outros parceiros incluem fabricantes de robôs (Feagine Robotics), empresas de modelos (Manycore Tech, Dexmal) e clientes de automação industrial (Lotus Cars, Geely Auto). A Axis também fornece dados para redes de robótica on-chain, como BitRobot na Solana e OpenRoboto na Bittensor.
Redefinindo a base de dados da IA física
“O futuro da IA física não é um dataset estático que você baixa uma vez”, diz Chris Feng, fundador da Axis Robotics. “É um motor que continua produzindo os dados de que o modelo precisa em seguida. Escala garante cobertura ampla. Diversidade mantém o ruído não enviesado. O loop fechado transforma cada falha em progresso. É isso que se compõe.”
A Axis foi fundada por pesquisadores da UC Berkeley, CMU, Georgia Tech e SJTU, ao lado de empreendedores seriais que já escalaram plataformas de consumo para mais de 30 milhões de usuários. A pesquisa da empresa conta com a consultoria de Jiachen Li, professor assistente na Georgia Tech.
Link do paper: https://arxiv.org/abs/2607.21588
Página do projeto: https://axisaiorg.github.io/AXIS-V1/
Link do dataset: https://huggingface.co/datasets/axisrobotics/Franka-Dataset
Código no Github: https://github.com/AxisAIOrg/Axis-V1-Training
