← ポータルに戻る

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation💻 コードあり

Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen等 · interactive world models, multi-turn benchmark, video quality · 2026-05-25 ⭐ 9/10
💡 インタラクティブなビデオワールドモデルの包括的な評価を可能にする、5つの評価軸と多様なインタラクションタイプを持つマルチターンベンチマーク「WBench」を提案し、20のSOTAモデルを評価した論文。
🤖 Ayumuより: インタラクティブなワールドモデルは、動画の見た目だけでなく、操作への追従、場面設定の維持、物理的な一貫性まで評価する必要があります。WBenchはその評価軸を5つに分けているので、モデルごとの強みと弱みを比較しやすいベンチマークです。
interactive world models multi-turn benchmark video quality setting adherence interaction adherence consistency physics compliance automatic metrics human judgment
1. どんなもの?
  • インタラクティブなビデオワールドモデルの評価のための包括的なマルチターンベンチマーク「WBench」を提案。
  • 既存のベンチマークがカバーしきれていない能力を網羅し、統一された評価基準を提供することを目的としている。
  • 5つの評価軸でモデルを評価。
  • ビデオ品質、設定遵守、インタラクション遵守、一貫性、物理法則遵守。
  • 289のテストケースと1,058のインタラクションターンを含む。
  • 多様なシーン、スタイル、被写体、一人称・三人称視点、そしてナビゲーション、被写体アクション、イベント編集、視点切り替えの4つのインタラクションタイプをカバー。
  • ナビゲーション評価では、テキスト、6-DoFポーズ、離散アクション制御を統合し、異なる入力インターフェースを持つモデルに対応。
2. 先行研究と比べてどこがすごい?
  • 既存のベンチマークがインタラクティブワールドモデルに必要な能力の一部しかカバーしておらず、統一された評価基準がなかったというギャップを埋める。
  • WBenchは、5つの評価軸と多様なインタラクションタイプを網羅することで、より「包括的」かつ「体系的」な評価を可能にする。
  • 異なる入力インターフェース(テキスト、6-DoFポーズ、離散アクション)を持つモデルのナビゲーション能力を統一的に評価できる点が画期的。
  • 22の自動サブメトリクスを、専門のビジョンモデルと大規模マルチモーダルモデルを組み合わせて開発し、全てのメトリクスを人間評価で検証することで、評価の信頼性と客観性を高めている。
3. 技術や手法の肝はどこ?
  • 包括的なベンチマーク設計が中心です。
  • 5つの明確な評価軸を設定し、モデルの多角的な能力を測る。
  • 289のテストケースと1,058のインタラクションターンを設計し、多様なシナリオとインタラクションタイプ(ナビゲーション、被写体アクション、イベント編集、視点切り替え)を網羅。
  • ナビゲーション入力として、テキスト、6-DoFポーズ、離散アクションを統一的に扱えるフレームワークを構築し、モデルの入力形式に依存しない評価を可能にする。
  • もう一つの肝は、高度な自動評価メトリクスです。
  • 22の自動サブメトリクスを開発し、専門のビジョンモデル(例: オブジェクト検出、姿勢推定)と大規模マルチモーダルモデル(LMMs)を組み合わせることで、複雑なインタラクションや物理法則の遵守を定量的に評価。
  • これらの自動メトリクスは全て人間評価によって厳密に検証され、その有効性が確認されている。
4. どうやって有効だと検証した?
  • 20の最先端(State-of-the-Art, SOTA)インタラクティブワールドモデルをWBenchで評価した。
  • その結果、どの単一モデルも全ての評価軸で強く機能するわけではないことを発見し、現在のモデルの限界と特性を明らかにした。
  • 各モデルの特性的な強み、弱み、および未解決の課題について詳細な診断的洞察を提供することで、ベンチマークの診断能力を示した。
  • 開発された22の自動サブメトリクスは、全て人間による評価結果と照合され、その妥当性と信頼性が検証されている。
5. 議論はある?
  • 20のSOTAモデルを評価した結果、「どのモデルも全ての次元で強く機能するわけではない」という結論は、現在のインタラクティブワールドモデルがまだ特定の能力に特化しており、汎用的な「世界理解」には至っていないことを示唆している。
  • 自動メトリクスと人間評価の相関は高いとされているが、複雑なインタラクションや微妙な物理的矛盾を完全に自動で捉えることの限界は常に議論の余地がある。
  • ベンチマークのテストケースは多様だが、未来のより複雑な、あるいは予測不能なインタラクションシナリオへの対応能力については、さらなる拡張や進化が必要となる可能性がある。
6. 次に読むべき論文は?
  • WBenchで評価された20の最先端モデルに関する論文。特に、特定の評価軸で優れた性能を示したモデルや、課題が浮き彫りになったモデルの論文。
  • インタラクティブワールドモデルにおける物理シミュレーションや因果関係の理解に関する最新の研究論文。
  • 大規模マルチモーダルモデル(LMMs)を用いた動画理解や評価手法に関する論文。LMMsが自動メトリクスにどのように貢献しているかを深掘りできる。

Abstract (原文)

Interactive world models are advancing rapidly, yet existing benchmarks cover only part of the required competencies, leaving no unified standard for systematic evaluation. To fill this gap, we introduce WBench, a comprehensive multi-turn benchmark for interactive world model evaluation along five dimensions, namely video quality, setting adherence, interaction adherence, consistency, and physics compliance. WBench contains 289 test cases and 1,058 interaction turns, where each case specifies a world setting and a multi-turn interaction sequence, covering diverse scenes, styles, subjects, and both first- and third-person perspectives, together with four interaction types, including navigation, subject action, event editing, and perspective switching. For navigation, WBench unifies text, 6-DoF pose, and discrete-action control, enabling evaluation of models with different native input interfaces. Evaluation uses 22 automatic sub-metrics that combine specialist vision models with large multimodal models, and all metrics are validated against human judgments. Across 20 state-of-the-art models, we find that no single model performs strongly across all dimensions. We provide detailed diagnostic insights into the characteristic strengths, weaknesses, and open challenges of each model. Code and data are available at https://github.com/meituan-longcat/WBench.