← ポータルに戻る
KVAE: Family of Tokenizers for Multimodal Generative Models💻 コードあり
Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov等 ·
AI · 2026-08-06
⭐ 9/10
💡 KVAEは、音声、画像、動画の各モダリティに対応し、テキスト条件付き生成のために設計された高性能なトークナイザーファミリーであり、既存の最先端モデルと同等かそれ以上の再構築・生成品質を達成する。
🤖 Ayumuより: このKVAEは、音声、画像、動画と幅広いモダリティに対応したトークナイザーファミリーなんだね。潜在拡散モデルの性能を左右するトークナイザーの重要性を考えると、これはすごく実用的な研究だと思うよ。特に、既存の最先端モデルを超える性能を出している点や、開発の詳細を公開しているのは、コミュニティにとって大きな貢献になるんじゃないかな。朋義さんも、マルチモーダル生成の基盤技術として注目する価値があると思うよ。
KVAE トークナイザー マルチモーダル生成 潜在拡散モデル 音声生成 画像生成 動画生成
1. どんなもの?
- マルチモーダル生成モデルのための新しいトークナイザーファミリー「KVAE」を提案。
- 音声、画像、動画の各モダリティに対応する専用トークナイザー(KVAE-Audio, KVAE-2D, KVAE-3D)を含む。
- これらはすべて、後続のテキスト条件付き生成のために設計されている。
- 各トークナイザーの具体的な特徴:
- KVAE-Audio: 48 kHzのフルバンド音声を、64チャンネルの50 Hz潜在表現に圧縮する連続トークナイザー。
- KVAE-3D: 4x16x16と4x8x8の2種類の圧縮率を持つ、因果的な動画トークナイザー。
- KVAE-2D: 入力を8倍に圧縮し、32チャンネルを持つ画像モデル。
2. 先行研究と比べてどこがすごい?
- 再構築品質と生成品質の両方で、既存の最先端オープンソーストークナイザー(Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio, MMAudioなどのVAE)と同等かそれ以上。
- 客観的指標(PSNR, LPIPS, PESQ, Frechet Distance, CLIP score, CLAP scoreなど)と主観的評価(サイドバイサイド評価)の両方で優位性を示している。
- マルチモーダル(音声、画像、動画)にわたる統一されたトークナイザーファミリーを提供している点が特徴。
- 開発の難しさを考慮し、トレーニングの詳細、モデル選択方法、設計選択に関するアブレーション研究をコミュニティと共有している。
- コードが公開されている(https://github.com/kandinskylab/kvae と https://github.com/kandinskylab/kvae-audio)。
3. 技術や手法の肝はどこ?
- KVAEという名前からVariational Autoencoder (VAE) の一種であることが示唆されるが、アブストラクトからは具体的なアーキテクチャの新規性は読み取れない。
- 各モダリティ(音声、画像、動画)に特化した設計がされている点が肝。
- KVAE-Audioは連続的な潜在表現とフルバンド音声に対応。
- KVAE-3Dは因果的な動画トークナイザーで異なる圧縮率を提供。
- KVAE-2Dは画像の8倍圧縮と32チャンネルを持つ。
- これらの設計が、テキスト条件付き生成において高い性能を発揮するように最適化されていると考えられる。
4. どうやって有効だと検証した?
- 再構築性能と生成性能の両面から評価。
- 再構築性能: 画像(PSNR, LPIPS)、音声(PESQなど)の指標を使用。
- 生成性能: 画像/動画(Frechet Distance, CLIP score)、音声(CLAP scoreなど)の指標を使用。
- 主観的評価: 人間によるサイドバイサイド評価も実施。
- 比較対象として、Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio, MMAudioなどの最先端オープンソーストークナイザー(VAEベース)を用いた。
5. 議論はある?
- アブストラクトからは直接的な議論点や限界は読み取れないが、マルチモーダルモデルのトークナイザーは、異なるモダリティ間の潜在空間の整合性や、テキストとのアラインメントが課題となる。
- 各モダリティに特化したトークナイザーの開発・最適化プロセスは複雑であり、設計選択には圧縮率と再構築品質、計算コストとのバランスなどのトレードオフが存在する可能性がある。
6. 次に読むべき論文は?
- 論文中で比較対象として挙げられている、各モダリティの最先端オープンソーストークナイザーの論文。
- Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio, MMAudioなど。
- 潜在拡散モデル(LDM)の基盤となる論文。
- テキスト条件付きマルチモーダル生成に関する最新の研究。
Abstract (原文)
Latent diffusion modeling (LDM), a prominent paradigm, utilizes tokenizers to map input signal to compressed representation. This dependency positions tokenizer as an integral part of generation process itself, since it affects learning speed, quality of synthesized samples and lay foundation for later applications. This report presents series of KVAE tokenizers for audio, image and video, all designed for subsequent text-conditioned generation: KVAE-Audio, a continuous full-band 48 kHz tokenizer with a 50 Hz latent of 64 channels; KVAE-3D -- two causal video tokenizers for 4x16x16 and 4x8x8 compression; KVAE-2D, an image model, compressing input by factor of 8 with 32 channels. We demonstrate that reconstruction (PSNR, LPIPS, PESQ, etc.) and generation results on objective (Frechet Distance, CLIP score, CLAP score, etc.) and subjective (side-by-side evaluation) metrics matches or surpasses frontier opensource tokenizers, such as VAEs from Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio and MMAudio. Considering difficulty of development, we share with community training details, model selection method and ablation on design choices. The code is publicly available at https://github.com/kandinskylab/kvae and https://github.com/kandinskylab/kvae-audio.