← ポータルに戻る

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining💻 コードあり

Hao Li, Ganlong Zhao, Yufei Liu, Haotian Hou, Guoquan Ye等 · Vision-Language-Action models, egocentric human videos, robot trajectory collection · 2026-06-15 ⭐ 8/10
💡 高コストなロボットデータと大規模な一人称視点人間動画を、統一されたアクション表現と信頼性認識型学習で統合し、VLAモデルの事前学習を効率化するフレームワーク。
🤖 Ayumuより: この論文、ロボット学習のデータ問題にめちゃくちゃ良いアプローチしてるね!高価なロボットデータと、大量にあるけどノイズだらけの人間動画を賢く統合するって発想が最高。特に、人間動画から「ロボットがどう動くか」を推測して、さらにノイズを考慮して学習するってところが技術的に面白い。朋義さんも、異種データ統合の難しさと、それをどう解決したかに注目すると面白いと思うよ!
Vision-Language-Action models Egocentric human videos Robot learning Data unification Pseudo-action Reliability-aware training
1. どんなもの?
  • VLAモデルの事前学習フレームワーク「ACE-EGO-0」
  • 高コストなロボットデータと、大規模だがノイズの多い一人称視点人間動画データを統合して活用します。
  • 人間動画からロボット形式の擬似アクションを生成し、統一されたアクション表現と信頼性認識型学習で効率的に学習させます。
2. 先行研究と比べてどこがすごい?
  • 既存研究では、アクション空間、エンボディメント構造、時間ダイナミクス、教師信号品質の相違から、人間とロボットデータの共同学習が困難でした。
  • ACE-EGO-0はこれらの課題を克服し、異種データを効果的に共同学習させることで、VLAモデルの性能を大幅に向上させます。
  • 特に、大規模な一人称視点人間動画を、実用的なロボット学習の教師信号として活用するパイプラインと学習戦略を確立した点が画期的です。
3. 技術や手法の肝はどこ?
  • **スケーラブルな一人称視点動画-to-アクションパイプライン**: 生の人間動画から、ロボットが実行可能な形式の擬似アクション軌道を自動生成します。
  • **統一されたアクション表現**: エンボディメントの違いを吸収するカメラ空間アクション、ロボットの形態情報を考慮する形態条件付け、時間ダイナミクスの違いに対応する時間同期アクションチャンキングを組み合わせます。
  • **信頼性認識型学習目的関数と人間補助損失**: ノイズの多い擬似アクション教師信号の中から、信頼性の高い信号に集中して学習を進めることで、ロバストな学習を実現します。
4. どうやって有効だと検証した?
  • 4.53K時間のロボット・シミュレーションデータと、1.48K時間の擬似アクションラベル付き一人称視点人間データを組み合わせて学習を行いました。
  • 信頼性認識重み付けの下で大規模な人間教師信号を組み込むことで、統一された共同事前学習と教師ありファインチューニングの両方で一貫した性能向上を確認しました。
  • RoboCasa GR1 TableTopとRoboTwin 2.0のベンチマークで最先端(SOTA)の性能を達成し、実世界の両手操作タスクへの強力な転移能力も実証しました。
5. 議論はある?
  • 擬似アクション生成パイプラインの精度や、生成される擬似アクションのノイズレベルが、学習効果に与える影響は依然として重要な課題です。
  • 提案手法の「信頼性認識型学習」はノイズを完全に除去するわけではなく、信頼性の高い信号に集中させるアプローチであるため、その限界や、より根本的なノイズ対策の可能性が議論の余地として残ります。
  • 異なるロボットプラットフォームや、より多様なタスクへの汎用性についても、さらなる検証が求められます。
6. 次に読むべき論文は?
  • RT-1, RT-2, GATOなど、Vision-Language-Action (VLA) モデルの基礎となる論文。
  • 一人称視点動画からの行動認識や模倣学習に関する研究(例: Ego4Dデータセット関連論文)。
  • マルチモーダル学習における異種データ統合やノイズ耐性に関する研究。
  • RoboCasa GR1 TableTopやRoboTwin 2.0といった、本論文でSOTAを達成したベンチマークの元論文。

Abstract (原文)

Vision-Language-Action (VLA) models benefit from large-scale and diverse embodied data, yet scaling robot trajectory collection is costly and labor-intensive. Recent advances show that large-scale egocentric human videos provide complementary real-world supervision in pretraining. However, joint training on human and robot data remains challenging due to divergences in action spaces, embodiment structures, temporal dynamics, and supervision quality. We introduce ACE-EGO-0, a unified VLA pretraining framework jointly leveraging heterogeneous data sources. To extract large-scale pretraining supervision from egocentric human videos, we build a scalable egocentric video-to-action pipeline that converts raw human videos into robot-format pseudo-action trajectories. To make these labels comparable with robot demonstrations, ACE-EGO-0 uses a unified action representation based on camera-space actions, morphology conditioning, and time-aligned action chunking. To robustly leverage noisy pseudo-action supervision from egocentric human videos, we formulate a reliability-aware training objective with a human auxiliary loss that concentrates supervision on reliable signals. We instantiate ACE-EGO-0 on 4.53K hours of robot and simulation data, together with 1.48K hours of pseudo-action-labeled egocentric human data. Experiments show that incorporating large-scale human supervision under reliability-aware weighting consistently improves both unified joint pretraining and supervised fine-tuning. ACE-EGO-0 achieves state-of-the-art performance on RoboCasa GR1 TableTop and RoboTwin 2.0, while demonstrating strong transfer to real-world bimanual manipulation.