← ポータルに戻る

Kwai Keye-VL-2.0 Technical Report💻 コードあり

Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao等 · Mixture-of-Experts, multimodal foundation model, DeepSeek Sparse Attention · 2026-06-09 ⭐ 9/10
💡 Kwai Keye-VL-2.0は、DeepSeek Sparse Attentionと独自の蒸留手法を組み合わせることで、超長尺動画理解とマルチモーダルエージェント知能においてSOTAを達成したオープンソースのMoE基盤モデル。
🤖 Ayumuより: これは超長尺動画を理解できるっていうのがすごいね。256Kコンテキストをロスレスで処理するとか、DSAをマルチモーダルに持ってきたのがいい。しかも、エージェントが自分で修正できるっていうのも未来感がある。朋義さんも、このDSAとMoEの組み合わせがどうやって効率と性能を両立させているか、気になるんじゃないかな。
Mixture-of-Experts multimodal foundation model DeepSeek Sparse Attention Long-video understanding Agentic intelligence On-Policy Distillation
1. どんなもの?
  • Kwai Keye-VL-2.0-30B-A3Bは、オープンソースのMixture-of-Experts (MoE) マルチモーダル基盤モデルです。
  • 長尺動画(時間単位)の理解とエージェント知能の向上を目的としています。
  • 超長コンテキスト(256Kトークン)、情報冗長性、高計算コストといった長尺動画特有の課題を解決します。
  • コード、ツール、検索シナリオにおいて、マルチモーダルな自己修正を伴う高度なエージェントコラボレーションを可能にします。
2. 先行研究と比べてどこがすごい?
  • DeepSeek Sparse Attention (DSA) をGQAベースのマルチモーダルアーキテクチャに初めて適応し、256Kの超長コンテキストをロスレスで処理できるようになった点です。
  • 複数タスクアライメント時の壊滅的忘却(catastrophic forgetting)問題を、Cross-Modal Multi-Teacher On-Policy Distillation (MOPD) とContext-RL/Video-RLの組み合わせで克服した点です。
  • 3Bパラメータしか活性化しないMoEバックボーンでありながら、同規模のモデルと比較して動画理解、時間的グラウンディング、推論、STEM、エージェントベンチマークでSOTA性能を達成しています。
  • 特に、TimeLensでのきめ細かい時間的局所化、Video-MME-v2とLongVideoBenchでの長尺動画理解で優れた性能を示します。
3. 技術や手法の肝はどこ?
  • **DeepSeek Sparse Attention (DSA) の導入**: GQAベースのマルチモーダルモデルにDSAを適用することで、256Kの超長コンテキストを効率的かつロスレスに処理し、長尺動画の重要なフレームや長距離の時間的依存関係を捉えます。
  • **最適化されたトレーニング・推論インフラ**: スケーラブルなビデオI/O、異種ViT-LM並列処理、カスタムDSAカーネルを導入し、スループットを最大化し計算オーバーヘッドを最小化します。
  • **Cross-Modal Multi-Teacher On-Policy Distillation (MOPD)**: Context-RLとVideo-RLと組み合わせることで、壊滅的忘却を防ぎつつマルチタスクアライメントを実現します。オンポリシーロールアウトからの密なトークンレベルの教師フィードバックを、3Bパラメータのみを活性化するMoEバックボーンに蒸留し、エージェントの自己修正能力を強化します。
4. どうやって有効だと検証した?
  • 広範なベンチマークで評価を行いました。
  • **動画理解**: Video-MME-v2とLongVideoBenchにおいて、長尺動画理解でSOTA性能を達成しました。
  • **時間的グラウンディング**: TimeLensベンチマークで、きめ細かい時間的局所化において優れた性能を示しました。
  • **その他**: 推論、STEM、エージェントベンチマークでも評価を行い、同規模のモデルの中でSOTA性能を達成していることを示しました。
5. 議論はある?
  • アブストラクトからは直接的な議論の記述はありませんが、技術報告書であるため、モデルの限界や今後の展望が本文で詳細に議論されている可能性があります。
  • MoEモデルの推論コストは一般的に高いですが、本モデルは3Bパラメータ活性化とカスタムカーネルで最適化しているため、その効率性に関する詳細な分析や他手法との比較が議論の対象となりえます。
  • 長尺動画理解における「重要なフレーム」の定義や、DSAがそれをどのように捉えているかについての詳細な分析は、さらなる議論の余地があるかもしれません。
  • MOPDの汎用性や、異なるドメインへの適用可能性も議論の対象となりうるでしょう。
6. 次に読むべき論文は?
  • **DeepSeek Sparse Attention (DSA) の元論文**: DSAのメカニズムと性能を深く理解するため。
  • **MoE (Mixture-of-Experts) の基盤論文**: MoEアーキテクチャの原理と課題について。
  • **長尺動画理解に関するSOTA論文**: Video-MME-v2, LongVideoBench, TimeLensなどのベンチマークでKeye-VL-2.0と比較されている他のモデルや、これらのベンチマーク自体に関する論文。
  • **エージェントAIにおけるマルチモーダル学習や強化学習の論文**: Context-RL, Video-RL, MOPDに関連する手法や、エージェントの自己修正に関する研究。

Abstract (原文)

We introduce Kwai Keye-VL-2.0-30B-A3B, an open-source Mixture-of-Experts (MoE) multimodal foundation model designed to advance long-video understanding and agentic intelligence. To address the challenges of ultra-long contexts, information redundancy, and prohibitive computational costs inherent in hour-level videos, Keye-VL-2.0 is the first to adapt DeepSeek Sparse Attention (DSA) to GQA-based multimodal architectures, enabling lossless 256K context processing while capturing critical frames and long-range temporal dependencies. This architecture is underpinned by a highly optimized training and inference infrastructure, including scalable video I/O, heterogeneous ViT-LM parallelism, and custom DSA kernels that significantly maximize throughput and minimize computational overhead. Furthermore, to overcome the algorithmic dilemma of catastrophic forgetting during multi-task alignment, we introduce Cross-Modal Multi-Teacher On-Policy Distillation (MOPD) paired with Context-RL and Video-RL. By distilling dense token-level teacher feedback from on-policy rollouts back into the MoE backbone, which activates only 3B parameters, Keye-VL-2.0 natively empowers advanced agent collaboration across Code, Tool, and Search scenarios with multimodal self-correction. Extensive evaluations across video understanding, temporal grounding, reasoning, STEM, and agent benchmarks demonstrate that Keye-VL-2.0-30B-A3B achieves state-of-the-art performance among models of similar scale, particularly excelling in fine-grained temporal localization on TimeLens and long-video comprehension on Video-MME-v2 and LongVideoBench. We release our model checkpoints to accelerate community progress toward scalable and robust multimodal agentic applications.