← ポータルに戻る

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory💻 コードあり

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai等 · video world model, persistent dynamic object memory, viewpoint exploration · 2026-07-02 ⭐ 8/10
💡 LLMで3D軌跡とカメラを制御し、永続的なオブジェクト記憶と高制御性を実現した新しいビデオワールドモデル。
🤖 Ayumuより: このWorldDirector、LLMで3Dの動きとカメラを操るって発想がめちゃくちゃ面白いね!従来のワールドモデルが苦手だった「視界から消えたオブジェクトを覚えておく」って問題を解決してるのがすごい。これなら、もっと複雑で長い物語をAIが作れるようになるかも。朋義さんも、AIが物理世界をどう理解してシミュレートするかって観点から、きっと楽しめると思うよ!
video world model persistent dynamic object memory viewpoint exploration LLM 3D trajectories controllable video generation
1. どんなもの?
  • WorldDirectorは、永続的な動的オブジェクトメモリと無制限の視点探索を可能にする、高度に制御可能なビデオワールドモデルフレームワークです。
  • 既存のワールドモデルとは異なり、物理ダイナミクスとピクセルレンダリングを分離し、意味的な動きのオーケストレーションと視覚生成を明示的にデカップリングしています。
  • LLM(大規模言語モデル)を活用して、3D空間におけるオブジェクトの軌跡とカメラの動きを調整し、これらをビデオ生成の制御信号として用います。
2. 先行研究と比べてどこがすごい?
  • 既存のワールドモデルは、物理ダイナミクスとピクセルレンダリングが密接に結合しており、動きを維持するために連続的な視覚観察に依存していました。
  • WorldDirectorは、LLMによる高レベルな指示から3D軌跡とカメラパスを生成することで、意味的な動きのオーケストレーションと視覚生成を分離し、厳密な物理ロジックと外観の安定性を確保します。
  • これにより、長時間視界から外れた動的エンティティが再登場しても、その正確な視覚的アイデンティティを維持できる「永続的な動的オブジェクトメモリ」を実現しています。
  • 前例のない制御可能性と永続的なオブジェクトメモリにより、複雑で拡張されたイベントの合成をサポートします。
3. 技術や手法の肝はどこ?
  • **モジュラーなデカップリング**: 意味的な動きのオーケストレーション(オブジェクトの3D軌跡とカメラパスの生成)と視覚生成を明確に分離するアーキテクチャが核です。
  • **LLMによる高レベル制御**: LLMがユーザーの指示を解釈し、3D空間内でのオブジェクトの動き(軌跡)とカメラの動きを生成・調整します。これにより、物理的に一貫性のあるシナリオを構築します。
  • **軌跡ベースの制御信号**: LLMによって生成された3D軌跡とカメラパスが、下流のビデオ生成モデルへの直接的な制御信号として機能し、生成される映像の物理的正確性と一貫性を保証します。
  • **永続的なオブジェクト表現**: オブジェクトの3D軌跡とIDを継続的に管理することで、視界外に出たオブジェクトの存在と特性を記憶し、再登場時に一貫した外観と振る舞いを維持します。
4. どうやって有効だと検証した?
  • 論文のアブストラクトでは、「実験結果は、本手法が前例のない制御可能性と永続的な動的オブジェクトメモリを備えた複雑で拡張されたイベントの合成をサポートすることを示している」と述べられています。
  • 具体的な評価指標やデータセットについてはアブストラクトからは読み取れませんが、プロジェクトページ(https://worlddirector.github.io/)で詳細なデモンストレーションや定性的・定量的な評価が示されていると推測されます。
5. 議論はある?
  • アブストラクトからは直接的な議論は読み取れませんが、一般的なワールドモデルの課題として、生成されるコンテンツのリアリズム、複雑な物理相互作用のモデリング、計算コストなどが挙げられます。本手法がこれらの課題をどの程度克服しているか、あるいは新たな課題を生み出しているかは論文本体で確認する必要があります。
  • LLMの指示解釈能力や、生成される3D軌跡の精度が全体の品質に大きく影響する可能性があり、そのロバスト性や汎用性に関する議論が考えられます。
6. 次に読むべき論文は?
  • LLMを用いた3Dシーン生成や物理シミュレーションに関する論文(例: Google Genieなど)。
  • 永続的なオブジェクトIDを扱うビデオ生成モデルや、長期的な一貫性を保つための手法に関する研究。
  • NeRFや3D Gaussian Splattingなど、新しい3D表現を用いたワールドモデルやシーン生成に関する論文。
  • より大規模なビデオ生成モデルにおける制御性やインタラクティブ性に関する研究。

Abstract (原文)

We present WorldDirector, a highly controllable video world model framework designed for persistent dynamic object memory and unrestricted viewpoint exploration. Unlike existing world models that entangle physical dynamics with pixel rendering and rely on continuous visual observation to sustain motion, our framework explicitly decouples semantic motion orchestration from visual generation. By leveraging an LLM to coordinate 3D trajectories with camera movements and subsequently employing these orchestrated trajectories as control signals for video generation, our approach ensures strict physical logic and appearance stability, successfully preserving the exact visual identities of dynamic entities even when they re-enter the scene after prolonged periods out of view. Experimental results demonstrate that our method supports the synthesis of complex and extended events with unprecedented controllability and persistent dynamic object memory. Project Page: https://worlddirector.github.io/