← ポータルに戻る

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence💻 コードあり

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan等 · vision-language model, OneVision-Encoder, Windowed Attention · 2026-05-25 ⭐ 8/10
💡 LLaVA-OneVision-2は、codec-stream tokenizationとWindowed Attentionを特徴とし、効率的な長尺ビデオ処理と統一的な知覚能力で既存VLMを凌駕する次世代VLM。
🤖 Ayumuより: LLaVA-OV-2は面白いね。ビデオのトークン化をビットコストストリームでやるっていう発想がうまい。長い動画でもイベント発生箇所にトークンを集中させるから、無駄なく効率的に処理できるのがすごい。JumpScoreっていう新しいベンチマークでQwen3-VL-8Bを大きく上回っているのも、その実力を物語っていると思う。朋義さんも、このビデオ処理の効率化と、統一的な知覚能力にはきっと興味を持つはず。特に、ビデオ圧縮の知識とAIを組み合わせるアプローチは、新しい研究の方向性を示唆していると思うな。
LLaVA Vision-Language Model Codec-stream Tokenization Windowed Attention Video Understanding Temporal Grounding JumpScore
1. どんなもの?
  • ポイント1: LLaVA-OneVisionシリーズの最新かつ最も高性能なVision-Language Model (VLM)。
  • 詳細: LLaVA-OneVision-2 (LLaVA-OV-2) は、幅広いマルチモーダルベンチマークで優れた性能を発揮し、ビデオ理解、時間・空間グラウンディング、操作トレース推論といった多様な知覚タスクを統一的に処理できる。
  • ポイント2: 効率的なビデオ処理とトークン化を実現する新しいアーキテクチャ。
  • 詳細: ネイティブなOneVision-EncoderとWindowed Attentionを基盤とし、特に「codec-stream tokenization」という手法で、圧縮ビデオをビットコストストリームとして扱い、適応的に重要な時空間情報を抽出してトークン化する。
2. 先行研究と比べてどこがすごい?
  • ポイント1: 既存のVLM(例: Qwen3-VL-8B)を大幅に上回る性能。
  • 詳細: 新しいJumpScoreベンチマークでQwen3-VL-8Bを+44.8 mAPポイントも凌駕。標準ベンチマークでもビデオタスクで+4.3ポイント、空間タスクで+5.3ポイント、トラッキングタスクで+15.6ポイントの改善を達成。
  • ポイント2: 長尺ビデオの効率的かつ安定したトークン圧縮。
  • 詳細: 固定フレームサンプリングではなく、ビデオのビットコスト動態とモーション残差に基づいて適応的に重要な情報を抽出するcodec-stream tokenizationにより、限られたトークン予算をイベント発生コンテンツに集中させ、より安定した圧縮を実現。これにより、時間グラウンディング性能が向上。
  • ポイント3: 新しいベンチマーク「JumpScore」の導入。
  • 詳細: 高頻度で密に繰り返される動きにおけるきめ細かい時間グラウンディングを評価するJumpScoreベンチマークを導入し、既存評価の不足点を補完した。
3. 技術や手法の肝はどこ?
  • ポイント1: Codec-stream tokenization。
  • 詳細: 圧縮ビデオを連続的なビットコストストリームとして解釈し、ビットコストの動的変化から適応的な時間グループを決定。さらに、モーション残差キューを用いて、重要な空間的証拠をコンパクトな視覚キャンバス(トークン)として選択することで、イベント発生箇所にトークン予算を集中させる。
  • ポイント2: OneVision-EncoderとWindowed Attention。
  • 詳細: ネイティブなOneVision-Encoderをベースに、Windowed Attentionを導入することで、ネイティブ解像度を維持しつつ、効率的な局所計算を可能にする。
  • ポイント3: 統一された時空間座標系と大規模データ。
  • 詳細: 共有3D RoPE (Rotary Positional Embedding) を用いて、codecキャンバス、サンプリングフレーム、画像を統一された時空間座標系に配置。また、約8Mの再キャプションされたビデオサンプルと4Mの空間コーパスからなる大規模なオープン教師データでモデルを事前学習・ファインチューニング。
4. どうやって有効だと検証した?
  • ポイント1: 新規ベンチマーク「JumpScore」での評価。
  • 詳細: 高頻度・高密度な動きにおける時間グラウンディング性能を測るJumpScoreベンチマークで、LLaVA-OV-2-8BがQwen3-VL-8Bを+44.8 mAPポイントで大きく上回ることを示した。
  • ポイント2: 標準的なマルチモーダルベンチマークでの評価。
  • 詳細: ビデオ理解、空間グラウンディング、トラッキングなど、幅広い標準ベンチマークでQwen3-VL-8Bを含む既存モデルを上回る性能を示した。
  • ポイント3: アブレーションスタディによる主要技術の有効性検証。
  • 詳細: 同じ視覚トークン予算の下で、codec-stream入力がフレームサンプリングよりも時間グラウンディングを+9.7ポイント改善することを示し、codec-stream tokenizationの有効性を実証した。
5. 議論はある?
  • ポイント1: Codec-stream tokenizationの汎用性とロバスト性。
  • 詳細: 特定のビデオ圧縮形式や品質にどの程度依存するのか、あるいは様々な圧縮設定やノイズに対するロバスト性については、アブストラクトからは詳細が不明。
  • ポイント2: 新規ベンチマーク「JumpScore」のカバー範囲。
  • 詳細: JumpScoreが既存評価の不足点を補うとされているが、JumpScore自体がカバーしきれない他のビデオ理解の側面や、その限界については言及されていない。
  • ポイント3: 計算リソースと実用化への課題。
  • 詳細: 大規模なデータセットでの学習や、複雑なトークン化プロセスは、依然として高い計算コストを伴う可能性があり、より広範な実用化に向けた効率化の余地があるかもしれない。
6. 次に読むべき論文は?
  • LLaVAシリーズの初期論文(例: LLaVA-1.5: Improved Baselines with Visual Instruction Tuning)
  • Qwen-VLシリーズの論文(比較対象モデルの詳細理解のため)
  • ビデオ圧縮技術とAIの統合に関する論文(codec-stream tokenizationの背景技術理解のため)
  • Windowed Attentionや3D Rotary Positional Embedding (RoPE) の基盤論文

Abstract (原文)

We introduce LLaVA-OneVision-2 (LLaVA-OV-2), the most capable vision-language model in the LLaVA-OneVision series to date, achieving superior performance across a broad range of multimodal benchmarks. The model builds on a native OneVision-Encoder and incorporates Windowed Attention for efficient local computation while maintaining native resolution. Its key advance is codec-stream tokenization: it treats compressed video as a continuous bit-cost stream, where bit-cost dynamics determine adaptive temporal groups, and motion-residual cues select salient spatial evidence into compact visual canvases. This allocation concentrates a limited token budget on event-bearing content, enabling more stable long-video token compression than fixed groups of pictures. A shared 3D RoPE further places codec canvases, sampled frames, and images in a unified spatiotemporal coordinate system. Furthermore, we build the LLaVA-OV-2 data and training stack around large-scale open supervision: approximately 8M re-captioned video samples for pretraining, a 4M-sample spatial corpus for fine-tuning. We also introduce JumpScore, a temporal-localization benchmark targeting fine-grained grounding in high-frequency, densely repeated motion, a regime underrepresented by existing video evaluations. A standout capability of LLaVA-OV-2 is its unified perception across video understanding, temporal grounding, spatial grounding, and manipulation-trace reasoning. On JumpScore, LLaVA-OneVision-2-8B reaches 74.9 JumpScore mAP, surpassing Qwen3-VL-8B (30.1) by +44.8 points; under matched visual-token budgets on the same benchmark, codec-stream inputs improve temporal grounding over frame sampling by +9.7 points. Across standard benchmarks, LLaVA-OneVision-2-8B further outperforms Qwen3-VL-8B by +4.3 average points on video tasks, +5.3 on spatial tasks, and +15.6 average J&F on tracking tasks.