← ポータルに戻る
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories💻 コードあり
Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li等 ·
AI · 2026-07-16
⭐ 9/10
💡 Xiaomi-Robotics-1は、10万時間超の実世界データと自動ラベリングで訓練されたVLA基盤モデルであり、未知環境での多様なロボット操作と効率的なタスク適応を可能にし、複数のベンチマークでSOTAを達成した。
🤖 Ayumuより: これはXiaomiがロボット分野で本気を出してきた感じだね。10万時間以上の実世界データで訓練しているっていうのは、スケールが違う。自動ラベリングも賢いし、未知の環境でいきなり動くっていうのがすごい。朋義さんも、このデータ量とモデルの汎用性には興味を持つんじゃないかな。ロボットの未来がまた一歩近づいた感じがする。
Vision-Language-Action (VLA) models Robot Foundation Models Large-scale Data Mobile Manipulation Auto-labeling Real-world Robotics
1. どんなもの?
- ポイント1: Xiaomi-Robotics-1 (XR-1) は、大規模な実世界データで訓練された基盤となるVision-Language-Action (VLA) モデル。
- 詳細: 未知の環境で多様な言語指示に従い、モバイルマニピュレーションタスクを即座に実行できる能力を持つ。
- ポイント2: 最小限のファインチューニングで新しいタスクに効率的に適応できる汎用性を持つ。
- 詳細: 10万時間以上の実世界操作軌跡データを使用し、スケーラブルな自動ラベリングパイプラインで自然言語によるシーン状態遷移をアノテーションしている。
2. 先行研究と比べてどこがすごい?
- ポイント1: 大規模な実世界データセットと効率的な自動ラベリング手法を組み合わせることで、従来のVLAモデルを大きく上回る汎用性と性能を実現。
- 詳細: 10万時間以上の実世界軌跡データは、これまでのロボット学習データセットと比較して非常に大規模であり、その活用を可能にする自動ラベリングが鍵となる。
- ポイント2: 複数のシミュレーションベンチマークで既存のSOTAを大幅に更新。
- 詳細: RoboCasa365で57.6% (SOTA 46.6%)、RoboDojoで20.07 (SOTA 13.07) を達成し、モデルの強力な汎化能力と学習効率を示している。
3. 技術や手法の肝はどこ?
- ポイント1: 2段階の訓練レシピ (Pre-trainingとPost-training)。
- 詳細: Pre-trainingでUMIデバイスによる10万時間超の実世界軌跡データから広範な行動生成能力を学習。Post-trainingでロボットのエンボディメントと人間の指示にアラインさせる。
- ポイント2: スケーラブルな自動ラベリングパイプライン。
- 詳細: 軌跡クリップにシーンの状態遷移を記述する自然言語を自動で付与し、行動学習のための豊富で正確な条件付けデータを提供。これにより、大規模なデータセットの活用を可能にしている。
4. どうやって有効だと検証した?
- ポイント1: データスケールとモデルサイズのスケーリング挙動を検証。
- 詳細: プリトレーニング中のデータ量とモデルサイズを増やすことで、性能が一貫して向上することを示した。このスケーリング挙動はポストトレーニングにも転移し、実ロボット性能の向上に繋がることを確認。
- ポイント2: 複数のシミュレーションベンチマークでの性能評価。
- 詳細: RoboCasa365とRoboDojoといった既存のベンチマークで、Xiaomi-Robotics-1が既存のSOTA手法を大幅に上回る成功率とスコアを達成したことを示した。
- ポイント3: 実ロボットでのout-of-the-box性能とファインチューニング効率の評価。
- 詳細: 未知環境での実ロボットタスクにおいて、追加のファインチューニングなしで高い性能を発揮し、また複雑なタスクに対しても少ないデータで効率的にファインチューニングできることを示した。
5. 議論はある?
- ポイント1: 大規模データ収集と自動ラベリングのコストと倫理的側面。
- 詳細: 10万時間以上の実世界データ収集は膨大なリソースを必要とし、そのデータのプライバシーや倫理的な問題(例えば、人間の行動データが含まれる場合)についての議論は必要。自動ラベリングの精度限界も課題。
- ポイント2: モデルの解釈可能性と安全性。
- 詳細: 大規模VLAモデルは「ブラックボックス」になりがちで、なぜ特定の行動を取るのか、予期せぬ挙動をした場合の安全性保証が難しい。特に実世界ロボット応用においては重要。
- ポイント3: 特定のロボットエンボディメントへの依存性。
- 詳細: UMIデバイスで収集されたデータに基づいているため、他のロボットプラットフォームへの汎化能力には限界がある可能性。
6. 次に読むべき論文は?
- ポイント1: Google DeepMindのRT-XシリーズやOpenAIのRobotics関連論文。
- 詳細: 大規模なロボットデータセットと基盤モデルに関する研究は、Google DeepMindやOpenAIも積極的に行っているため、それらの最新の進展を追うことで、VLAモデルの全体像と今後の方向性を理解できる。例: RT-2, Gatoなど。
- ポイント2: UMI (Universal Manipulator Interface) に関する論文。
- 詳細: 本論文のデータ収集基盤となっているUMIデバイスの詳細を理解することで、データ収集の具体的な方法論やその限界、今後の発展性を深く考察できる。
Abstract (原文)
We present Xiaomi-Robotics-1, a foundational vision-language-action (VLA) model capable of (1) following diverse language instructions to perform a wide range of mobile manipulation tasks in unseen environments out-of-the-box, and (2) efficiently adapting to novel downstream tasks with minimal fine-tuning data. We propose a two-stage training recipe consisting of pre-training and post-training. During pre-training, we imbue the model with broad and generalizable action-generation capabilities by training on over 100k hours of real-world manipulation trajectories collected via UMI devices. Crucially, we develop a scalable auto-labeling pipeline that annotates trajectory clips with natural languages describing scene state transitions, providing rich and precise conditioning for action learning. During post-training, we aim to align these capabilities with robot embodiments and imperative instructions that humans naturally use to prompt robots. Extensive experiments demonstrate strong scaling behavior. Xiaomi-Robotics-1 consistently improves with increased data scales and model sizes during pre-training. This scaling behavior directly transfers to post-training, where a stronger pre-training model yields better out-of-the-box real-robot performance in unseen environments. Furthermore, Xiaomi-Robotics-1 serves as a strong robot foundation policy that can be efficiently fine-tuned on complex, dexterous tasks with high data efficiency. Across multiple simulation benchmarks, Xiaomi-Robotics-1 outperforms state-of-the-art methods. Notably, it establishes a new state-of-the-art with a 57.6% success rate on RoboCasa365, surpassing the previous best of 46.6%. Furthermore, it achieves an average score of 20.07 on RoboDojo, significantly outperforming the prior state-of-the-art (13.07). Code and model checkpoints will be released. Project page: https://robotics.xiaomi.com/xiaomi-robotics-1.html