← ポータルに戻る

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence💻 コードあり

Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang等 · closed-loop embodied harness, code-based runtime critics, recovery skills · 2026-08-17 ⭐ 8/10
💡 Zettaは、固定された基本ポリシーのまま、コードベースのクリティクスとリカバリースキルをオンラインで自己進化させる閉ループのロボット学習フレームワークだよ。
🤖 Ayumuより: Zettaは、ロボットが物理世界でリアルタイムに自己進化する閉ループ学習を実現したんだね。従来のオープンループなアプローチの課題を解決し、実行中に自律的にクリティクスやリカバリースキルを改善していくのがすごいよ。特に、基本ポリシーを固定したまま進化させる点や、複数の時間スケールで制御する仕組みは、効率的で堅牢なロボット学習の新しい道を開く可能性を感じるな。朋義さんも、このリアルタイム適応と自己進化のアイデアは面白いと思うんじゃないかな。
closed-loop embodied harness self-evolving physical intelligence code-based runtime critics recovery skills robot learning online adaptation
1. どんなもの?
  • ポイント1: 物理世界で自己進化する閉ループのロボット制御フレームワーク「Zetta」
  • 詳細: Zettaは、固定された基本ポリシーを維持しつつ、コードベースのランタイムクリティクス(実行時評価基準)とリカバリースキル(回復スキル)をオンラインで進化させることで、物理的なインタラクションにおけるリアルタイムな学習と適応を実現します。
  • ポイント2: 3つの時間スケールで分離されたループと専用インフラ「Z-Infra」
  • 詳細: アクション周波数ガバナンス、ロールアウトレベルのクリティック・リカバリー提案、検証ゲート付きスキル更新という3つのループを通じて、高速な物理環境での意思決定と学習を可能にします。また、Z-Infraはエージェントロジックと多様な実行リソースを分離し、効率的なロールアウトを支えます。
2. 先行研究と比べてどこがすごい?
  • ポイント1: 既存のオープンループな学習からの脱却とリアルタイム適応
  • 詳細: 従来のロボット学習システムは、エピソード終了後にしか反省できず、物理的なリアルタイムな変化に即座に対応できませんでした。Zettaは、実行中にリアルタイムで学習・適応する「閉ループ学習」を実現し、この課題を解決します。
  • ポイント2: 大規模エージェントモデルでは困難な高速な物理インタラクションへの対応
  • 詳細: ロボットと環境の急速に変化する状態を追跡する意思決定は、今日の大規模エージェントモデルの処理能力を超えます。Zettaは、アクション周波数ガバナンスやオンラインでのスキル進化により、この高速な要求に応えます。
3. 技術や手法の肝はどこ?
  • ポイント1: 3つの時間スケール分離ループによる閉ループ学習
  • 詳細: 高速なアクション周波数ガバナンス、中速のロールアウトレベルでのクリティック・リカバリー提案、低速の検証ゲート付きスキル更新という階層的なループにより、異なる時間スケールの課題に効率的に対応し、オンラインでの自己進化を可能にします。
  • ポイント2: コードベースのランタイムクリティクスとリカバリースキルのオンライン進化
  • 詳細: 基本ポリシーは固定したまま、実行中に動的にコードを生成・修正することで、問題点を検知するクリティクスと、失敗から回復するためのリカバリースキルを自律的に学習・改善します。
  • ポイント3: Z-Infraによる効率的かつスケーラブルな実行基盤
  • 詳細: エージェントのロジックと、物理ロボットやシミュレーターといった多様な実行リソースを分離するインフラにより、効率的かつスケーラブルな学習と検証を可能にします。
4. どうやって有効だと検証した?
  • ポイント1: 複数のロボットタスクベンチマークでのSOTA達成と高速化
  • 詳細: LIBERO-ProとRoboCasaという2つの主要なロボットタスクベンチマークにおいて、それぞれ90.8%と93.6%の成功率を達成し、既存手法を上回るSOTA(State-of-the-Art)性能を示しました。また、推論速度も11.1倍向上しました。
  • ポイント2: 自己探索によるスケーラビリティと汎化能力の証明
  • 詳細: 自己探索経験が増えるにつれて成功率が向上し続けることを示し、学習したスキルが未知のタスクにもゼロショットで転移可能であることを確認しました。
  • ポイント3: ロボットの「Aha Moments」の出現
  • 詳細: 学習過程で、ロボットが自律的に問題解決策を発見する、人間でいう「ひらめき」のような「Aha Moments」が明確に観察されたと報告されています。
5. 議論はある?
  • ポイント1: 基本ポリシーの固定化による限界
  • 詳細: Zettaは基本ポリシーを固定したままクリティクスとリカバリースキルを進化させるため、基本ポリシー自体の根本的な改善や、より複雑なタスクにおける高レベルな計画能力の進化については、今後の課題となる可能性があります。
  • ポイント2: 「Aha Moments」の定量的分析の必要性
  • 詳細: ロボットの「Aha Moments」という概念は興味深いですが、その発生メカニズムや、それがタスク成功にどの程度寄与しているかといった定量的かつ詳細な分析は、アブストラクトからは読み取れません。
  • ポイント3: ロールアウト予算と計算コスト
  • 詳細: 「現在のロールアウト予算」という記述があり、非常に大規模な環境や、より長期間にわたる学習における計算リソースやコストの制約については、さらなる検討の余地があるかもしれません。
6. 次に読むべき論文は?
  • ポイント1: ロボットの閉ループ学習やオンライン適応に関する最新研究
  • 詳細: 物理世界でのリアルタイムなフィードバックを活用し、環境変化に動的に適応するロボット学習手法に関する論文を読むと、Zettaの文脈をより深く理解できるでしょう。
  • ポイント2: LLMを用いたコード生成によるエージェントの行動計画・修正に関する研究
  • 詳細: 「コードベースのランタイムクリティクス」というZettaの核となるアイデアに関連して、大規模言語モデル(LLM)がロボットの行動を制御するためのコードを生成・修正するアプローチの論文は、今後の発展方向を示唆するかもしれません。
  • ポイント3: ロボットのリカバリースキル学習や失敗からの学習に関する研究
  • 詳細: 失敗を検知し、そこから回復するためのスキルを自律的に学習するメカニズムに焦点を当てた論文は、Zettaのリカバリースキルの進化と関連が深く、興味深いでしょう。

Abstract (原文)

Embodied agents are increasingly used to close the gap left by end-to-end policy models. Yet the agentic path has not realized closed-loop learning in physical execution: existing harnesses remain largely open-loop, following fixed skills during rollout and reflecting only after an episode completes. Such post-hoc reflection cannot govern execution as it unfolds, because physical interaction requires decisions to track rapidly changing robot-environment states at a frequency beyond today's large agentic models. We present Zetta, a closed-loop embodied harness that evolves code-based runtime critics and recovery skills online while keeping the base policy frozen. Through three timescale-separated loops, Zetta provides action-frequency governance, rollout-level critic-recovery proposal, and validation-gated skill updates. Together with Z-Infra, a rollout infrastructure decoupling agent logic from heterogeneous execution resources, Zetta achieves state-of-the-art success on LIBERO-Pro and RoboCasa under our current rollout budget, reaching 90.8% and 93.6%, with an 11.1x inference speedup; success continues to scale with self-exploration experience; learned skills transfer zero-shot, and clear robotic "Aha Moments" emerge. These results show that closed-loop harness self-evolution opens a scaling path for reliable physical intelligence.