Axis Robotics mở nguồn một trong những bộ dữ liệu mô phỏng cánh tay Franka lớn nhất cho Physical AI

Axis Robotics phát hành bộ dữ liệu mô phỏng Franka mã nguồn mở lớn, chứng minh dữ liệu mô phỏng kém tối ưu vẫn huấn luyện được chính sách vững.
8 giờ trước
Axis Robotics mở nguồn một trong những bộ dữ liệu mô phỏng cánh tay Franka lớn nhất cho Physical AI

Axis Robotics vừa phát hành Axis Sim Dataset V1, một trong những bộ dữ liệu mô phỏng mã nguồn mở lớn nhất cho các bài toán thao tác bằng cánh tay robot Franka, với toàn bộ dữ liệu, mã huấn luyện và bộ benchmark đều được công bố công khai. V1 được xây dựng từ hơn 50.000 quỹ đạo mô phỏng do con người điều khiển từ xa, bao trùm 207 tác vụ thao tác và hơn 60.000 biến thể bối cảnh trên cánh tay mô phỏng Franka Research 3.

Bộ dữ liệu này đã ghi nhận hơn 160.000 lượt tải, trở thành bộ dữ liệu mô phỏng thao tác Franka mã nguồn mở được tải nhiều nhất trên Hugging Face. Trong các benchmark, huấn luyện tiếp diễn (continual pretraining) trên V1 đã nâng hiệu quả chính sách π0.5 và vượt qua baseline RoboCasa có cùng quy mô dữ liệu; toàn bộ kết quả đều được mở và có thể kiểm chứng.

Снимок экрана 2026-09-04 в 11.20.48.png

Axis Robotics đang xây dựng một “động cơ dữ liệu lãi kép” cho Physical AI: một hệ thống tích hợp dọc, kết hợp mô phỏng quy mô lớn, thu thập dữ liệu thế giới thực từ góc nhìn ngôi thứ nhất (egocentric), loco-manipulation trên robot hình người, và hậu huấn luyện DAgger có con người kiểm soát. Công ty đã huy động được 12 triệu USD vòng seed do Hack VC dẫn dắt, với sự tham gia của Nomad Capital, Pi Network Ventures, 10K Ventures và các nhà đầu tư thiên thần.

Cược ngược lại quan điểm “chỉ dữ liệu sạch”

Trong giới robot, giả định phổ biến là các bản demo phải gần tối ưu ngay từ đầu – lọc chỉ giữ quỹ đạo chuyên gia, chuẩn hóa thiết lập, loại bỏ mọi tín hiệu nhiễu trước khi mô hình dám “bắt chước”. Luận điểm của Axis đi theo hướng ngược lại: chất lượng dữ liệu nằm ở phân phối tổng thể, không phải ở từng quỹ đạo riêng lẻ. Khi một cộng đồng đủ lớn và đủ đa dạng tạo ra các quỹ đạo nhiễu, kém tối ưu nhưng sai lệch không tương quan, nhiễu sẽ được triệt tiêu trung bình và chính sách khả thi vẫn trụ lại trong quá trình huấn luyện.

Axis Sim Dataset V1 là phép thử công khai cho luận điểm đó. Các quỹ đạo trong bộ dữ liệu trải dài từ gắp-đặt, xếp chồng, rót chất lỏng, thao tác vật thể khớp nối đến sử dụng công cụ, được thu thập thông qua nền tảng điều khiển từ xa trên trình duyệt Axis Hub, bởi một cộng đồng người dùng phân tán thay vì một nhóm chuyên gia duy nhất. Bộ dữ liệu được xây dựng phối hợp với các nhà nghiên cứu từ UC Berkeley, Johns Hopkins, University of Michigan và nhiều viện nghiên cứu khác.

Kết quả cho thấy hiệu ứng theo quy mô

Trên bộ benchmark LIBERO-Plus, huấn luyện tiếp diễn trên V1 nâng tỉ lệ thành công π0.5 từ 83,9% lên 88,8% và vượt baseline RoboCasa365 có cùng khối lượng dữ liệu tới 37,3%. Hiệu năng tăng đều khi quy mô dữ liệu pretrain mở rộng từ 25% lên 100% bộ dữ liệu, chưa có dấu hiệu bão hòa – cho thấy lợi ích đến từ độ đa dạng và độ phủ, không phải một cú “boost” nhất thời. Mức cải thiện mạnh nhất xuất hiện trong các kịch bản nhiễu camera, cảm biến và thay đổi bố cục – đúng các chiều (axes) mà Axis chủ động random hóa khi sinh dữ liệu.

Снимок экрана 2026-09-04 в 11.21.00.png

Nhóm nghiên cứu cho biết V2 đã khởi động, mở rộng lên 1,2 triệu quỹ đạo trên 1.200 tác vụ, với khả năng suy rộng xuyên cấu trúc thân robot (cross-embodiment generalization) và kết quả trên nhiều mô hình VLA khác nhau, tiếp tục chứng minh dữ liệu mô phỏng kém tối ưu vẫn có thể huấn luyện ra các chính sách vững.

Động cơ phía sau bộ dữ liệu

Bộ dữ liệu chỉ là một đầu ra của một “động cơ dữ liệu” lớn hơn, đang tích lũy theo thời gian. Thay vì thu thập một lần theo một bộ spec cố định như các nhà cung cấp dữ liệu truyền thống, Axis dùng hiệu năng mô hình và các ca lỗi để quyết định nên thu thêm kiểu dữ liệu nào, biến mỗi vòng huấn luyện thành tín hiệu cho vòng tiếp theo. Động cơ này vận hành với chiến lược lai trên bốn dòng dữ liệu, và cả bốn hiện đều đã chạy ở quy mô lớn:

Mô phỏng: hơn 200.000 cộng tác viên phân tán trên Axis Hub, một trong ba dApp lớn nhất trên Base, đã tạo ra hơn 4,7 triệu quỹ đạo trên 13 loại robot khác nhau.

Egocentric: mạng lưới hơn 1.000 người thu thập toàn thời gian, được đào tạo kiểm soát chất lượng, ghi lại hoạt động ngôi thứ nhất trong nhà và doanh nghiệp thuộc 14 ngành – đã tích lũy hơn 200.000 giờ dữ liệu, tăng thêm trên 4.000 giờ mỗi ngày, kèm theo pose bàn tay được xác thực bằng hệ thống Vicon.

Loco-manipulation: hơn 500 giờ kết hợp di chuyển và thao tác khéo léo trên robot hình người (Unitree G1, Booster T2) thông qua điều khiển từ xa không phụ thuộc phần cứng.

Hậu huấn luyện DAgger có con người trong vòng lặp: hơn 500 giờ hiệu chỉnh với con người “gác cổng”, tập trung vào các ca biên trong môi trường triển khai thực tế.

Mỗi tác vụ và quỹ đạo đều được ghi on-chain trên Base để đảm bảo nguồn gốc, và cộng tác viên được thưởng dựa trên chất lượng công việc đã được xác minh.

Từ dữ liệu mở đến triển khai thương mại

Không chỉ dừng ở việc mở nguồn dữ liệu mô phỏng, Axis còn làm việc trực tiếp với các công ty robot để xây dựng pipeline dữ liệu và mô hình prior “đo ni đóng giày” cho từng cấu trúc robot.

Là đối tác sim-data đầu tiên của Booster Robotics, Axis đã dựng lại môi trường làm việc thực tế của Booster thành một “bản sao số” (digital twin) bám sát tác vụ, huy động cộng đồng phân tán thu thập hơn 42.000 phiên mô phỏng trên môi trường đó, rồi chưng cất thành một mô hình prior riêng cho Booster. Với chỉ 30 bản demo trên robot thật, prior này đạt tỉ lệ thành công 87,5%, so với 37,5% của π0.5 chuẩn “mặc định”, tương đương hiệu năng π0.5 nhưng chỉ cần một nửa số demo thế giới thực.

Các đối tác khác trải rộng từ công ty robot (Feagine Robotics), công ty mô hình (Manycore Tech, Dexmal) đến tự động hóa công nghiệp (Lotus Cars, Geely Auto). Axis cũng cung cấp dữ liệu cho các mạng robot on-chain: BitRobot trên Solana và OpenRoboto trên Bittensor.

Tái định nghĩa nền tảng dữ liệu cho Physical AI

“Tương lai của Physical AI không nằm ở một bộ dữ liệu tĩnh mà bạn tải về một lần,” Chris Feng, nhà sáng lập Axis Robotics, nhận định. “Đó phải là một động cơ liên tục sản sinh đúng loại dữ liệu mà mô hình cần cho bước tiếp theo. Quy mô mang lại độ phủ rộng. Đa dạng giúp nhiễu không bị lệch. Vòng lặp khép kín biến mọi thất bại thành tiến bộ. Chính hiệu ứng lãi kép đó mới là chìa khóa.”

Axis được sáng lập bởi các nhà nghiên cứu đến từ UC Berkeley, CMU, Georgia Tech và SJTU, cùng các doanh nhân nhiều lần khởi nghiệp đã từng mở rộng nền tảng tiêu dùng lên hơn 30 triệu người dùng. Mảng nghiên cứu của công ty nhận tư vấn học thuật từ Jiachen Li, trợ lý giáo sư tại Georgia Tech.

Paper: https://arxiv.org/abs/2607.21588

Trang dự án: https://axisaiorg.github.io/AXIS-V1/

Bộ dữ liệu: https://huggingface.co/datasets/axisrobotics/Franka-Dataset

Mã nguồn Github: https://github.com/AxisAIOrg/Axis-V1-Training

Tuyên bố miễn trừ trách nhiệm: Đây là nội dung từ bên thứ ba do nhà phát hành cung cấp và được đăng tải chỉ nhằm mục đích cung cấp thông tin. Yellow không tự xác minh các tuyên bố được nêu tại đây và không chịu trách nhiệm cho bất kỳ sai sót hoặc thiếu sót nào. Nội dung này không phải là lời khuyên về đầu tư, pháp lý, kế toán hay thuế, cũng như không phải lời mời mua hoặc bán bất kỳ tài sản nào.
Thông cáo báo chí mới nhất
Xem tất cả thông cáo báo chí
Tin tức mới nhất
Xem tất cả tin tức