← ポータルに戻る

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning💻 コードあり

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen等 · AI · 2026-07-15 ⭐ 8/10
💡 スマートフォンで大規模に収集された一人称視点操作データと、ロボット学習のためのデータ処理からモデルトレーニングまでを包括的にサポートするオープンなツールチェーン。
🤖 Ayumuより: これ、めっちゃ面白いじゃん!スマホでこんなに大規模な操作データ集められるってすごいよね。ロボットが人間みたいに器用に動くようになるためのデータ基盤として、めちゃくちゃ重要だと思う。朋義さんも、これ使って何か新しいロボットの動きとか、ワールドモデルの学習とか試してみたら面白そうじゃない?
Egocentric Manipulation Embodied Learning Dataset Toolchain Robot Learning Smartphone Capture Hand Pose VLA World Models Open Science
1. どんなもの?
  • 大規模なオープン一人称視点操作データセット「Open-AoE」
  • 約2,000時間分の操作ビデオを、500人以上の貢献者が400台以上のスマートフォンを使って自然環境下で収集。
  • テキストアノテーション、MANOベースの手のポーズ、カメラ軌跡、時間的に局所化された原子アクションなどの詳細なメタデータを含む。
  • データ収集からモデルトレーニングまでをカバーする包括的なオープンツールチェーン
  • 生の録画を構造化された学習サンプルに変換するデータ処理パイプライン(時間的アクションセグメンテーション、意味的アノテーション、手再構築、カメラ軌跡再構築)。
  • 可視化、クロスエンボディメントリターゲティング、モデル固有データ変換、VLAポリシー・WAMs・World Modelsのトレーニングレシピをサポートするダウンストリームツールチェーン。
2. 先行研究と比べてどこがすごい?
  • 低コストでスケーラブルなデータ収集と、操作レベルの構造化アノテーションを両立している点
  • スマートフォンを活用することで、大規模かつ多様な実環境での一人称視点操作データを効率的に収集可能。既存リソースはラボ環境や限定的なタスクに偏りがちだった。
  • データセットだけでなく、データ処理からモデルトレーニング、ロボットへの転送まで一貫したオープンなパイプラインとツールチェーンを提供
  • これにより、データ貢献者と再利用者の双方にとっての障壁を大幅に低減し、身体化された学習の研究開発を加速させる。
  • MANOベースの手のポーズや原子アクションなど、詳細かつ多角的なアノテーションを大規模データに付与している点
  • ロボット学習や人間からロボットへの転送に必要な豊富な情報を提供。
3. 技術や手法の肝はどこ?
  • スマートフォンを活用した分散型・低コストなデータ収集フレームワーク
  • 多数の貢献者が自然環境で実世界データを収集できる仕組みを構築し、データ量のスケーラビリティと多様性を確保。
  • 生のビデオデータから構造化された学習サンプルを生成するデータ処理パイプライン
  • 時間的アクションセグメンテーション、意味的アノテーション、MANOベースの手のポーズ再構築、カメラ軌跡再構築といった複数のモジュールを統合し、生のデータを機械学習モデルが利用しやすい形式に変換。
  • ダウンストリームタスク(VLA、WAMs、World Modelsなど)に対応する汎用的なツールチェーン
  • 可視化機能、異なる身体(人間とロボット)間での動作リターゲティング機能、特定のモデルに合わせたデータ変換、そして主要なモデルアーキテクチャのトレーニングレシピを提供。
4. どうやって有効だと検証した?
  • アブストラクトからは具体的な実験結果や定量的な検証の記述は直接読み取れない。
  • しかし、「VLA policies, WAMs, and World Models」のトレーニングレシピをサポートすると明記されており、これらの最先端の身体化モデルを実際に学習させるための実用的な基盤として機能することを示唆している。
  • 「データ貢献と再利用の障壁を低減する」という目的自体が、その有効性の一つの指標であり、オープンなインフラとしてコミュニティに貢献することで、その価値が検証されると期待される。
5. 議論はある?
  • アブストラクトからは直接的な議論点や課題は読み取れない。
  • 一般的に、大規模なユーザー生成データセットにおいては、プライバシー保護、アノテーション品質のばらつき、データ収集におけるバイアスの可能性などが課題となり得る。自然環境での収集は多様性をもたらす一方で、データのノイズや制御の難しさも伴う可能性がある。
6. 次に読むべき論文は?
  • Ego4D: A Large-Scale Egocentric Video Dataset and Benchmark for Egocentric Perception, Forecasting, and Interaction
  • EPIC-KITCHENS: A Large-Scale Dataset for Egocentric Action Recognition
  • RT-X: A Vision-Language-Action Model for General-Purpose Robot Learning (Google Robotics Transformer X関連論文)
  • Gato: A Generalist Agent (DeepMindの汎用エージェントに関する論文)

Abstract (原文)

Egocentric videos of human manipulation provide scalable supervision for embodied intelligence, yet existing resources rarely combine low-cost continuous capture, manipulation-level structured annotations, and reusable tools for robot learning. We present Open-AoE, an open, community-oriented egocentric manipulation dataset and toolchain spanning the full pipeline from smartphone capture to model training. Its first release contains approximately 2,000 hours of manipulation video collected in natural environments by 500+ contributors using 400+ smartphones. The dataset provides text annotations, MANO-based hand poses, camera trajectories, and temporally localized atomic actions. Open-AoE further includes a data processing pipeline that transforms raw recordings into structured samples through temporal action segmentation, semantic annotation, hand reconstruction, and camera trajectory reconstruction. Meanwhile, we provide a separate downstream toolchain supports visualization, cross-embodiment retargeting, model-specific data conversion, and training recipes for VLA policies, WAMs, and World Models. By integrating scalable capture, structured processing, and downstream adaptation, Open-AoE reduces the barriers to both data contribution and reuse, providing practical open infrastructure for embodied model training, human-to-robot transfer, and world modeling.