← ポータルに戻る
Multi-Block Diffusion Language Models💻 コードあり
Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu等 ·
Block Diffusion Language Models, Multi-Block Diffusion, teacher forcing · 2026-06-30
⭐ 8/10
💡 既存のBlock Diffusion Language ModelsをMulti-Block Teacher Forcingと最適化されたデコードアルゴリズムで拡張し、テキスト生成の並列性と効率を大幅に向上させた。
🤖 Ayumuより: これ、Diffusionモデルのテキスト生成をめっちゃ速くする研究だね!複数のブロックを同時に処理するMultiBDってアイデアが面白いし、そのための学習方法(MultiTF)とデコードアルゴリズムまで提案してるのがすごい。TPFが大幅に上がってるから、生成速度がボトルネックになってた部分がかなり改善されそう。朋義さん、Diffusionモデルの効率化に興味あるなら、これは要チェックだよ!
Multi-Block Diffusion Language Models Multi-Block Diffusion Multi-block Teacher Forcing Block Buffer Diffusion Language Models Text Generation Parallel Decoding
1. どんなもの?
- Block Diffusion Language Models (BD-LMs) をMulti-Block Diffusion (MultiBD) に拡張し、テキスト生成の並列性を高めるモデル「Multi-Block Diffusion Language Models (MBD-LMs)」を提案。
- MultiBDは、複数の連続するブロックを並行してデコードすることで、ブロック間の並列性を実現する。
- MBD-LMsは、既存のBD-LMsを「Multi-block Teacher Forcing (MultiTF)」という新しい学習戦略で追加学習することで得られる。
- MultiTFは、Teacher ForcingとDiffusion Forcingを統合し、MultiBD推論時の状態により合致するよう設計されている。
- MultiBDを実用的にするため、「Block Bufferメカニズム」に基づく最適化されたデコードアルゴリズムも導入している。
2. 先行研究と比べてどこがすごい?
- 既存のBD-LMsは主にSingle-Block Diffusion (SingleBD) であり、Teacher Forcingで学習されるため、MultiBD推論時の「複数のノイズブロックが同時に存在し、それぞれ異なるノイズパターンを持つ」という状態と学習状態が乖離していた。
- 提案するMBD-LMsは、MultiTFという学習戦略とBlock Bufferメカニズムにより、この乖離を解消し、MultiBDを効率的かつ実用的にした点が画期的。
- 結果として、Tokens Per Forward pass (TPF) が大幅に向上し、テキスト生成の速度と効率が飛躍的に改善された。
3. 技術や手法の肝はどこ?
- **Multi-block Teacher Forcing (MultiTF)**:
- 従来のTeacher ForcingとDiffusion Forcingの利点を統合した学習戦略。
- クリーンなプレフィックスに条件付けられた、境界のあるノイズグループ(複数のノイズブロック)に対して学習を行う。
- MultiBD推論時の異質なスロットごとのノイズパターンに、より良く一致するようにランダム化されたノイズスケジューラを使用する。
- **最適化されたデコードアルゴリズム (Block Bufferメカニズム)**:
- プレフィックスキャッシュの再利用を維持しつつ、入力形状を静的に保つことで、デコード並列性の向上を実測の実行時間短縮に変換する。
4. どうやって有効だと検証した?
- MBD-LLaDA2-Miniというモデルを用いて性能を評価した。
- 平均Tokens Per Forward pass (TPF) が3.47から6.19に増加し、平均精度も79.95%から81.03%に向上したことを示した。
- さらに、DMaxと組み合わせたMBD-LLaDA2-Mini-DMaxでは、平均TPFが9.34に達し、数学およびコードベンチマークでわずか1.02%の精度低下に抑えられたことを示した。
- これらの結果は、MBD-LMsが生成速度と効率を大幅に向上させつつ、高い精度を維持できることを実証している。
5. 議論はある?
- DMaxと組み合わせた際にわずかな精度低下(1.02%)が見られることから、速度向上と精度維持の間にトレードオフが存在する可能性が示唆される。このバランスをどう取るかは議論の余地があるかもしれない。
- MultiTFがMultiBD推論の状態に「より良く一致する」とあるが、完全に一致しているわけではない可能性も考えられ、さらなる一致度向上や、より汎用的な学習戦略の探求が今後の課題となりうる。
6. 次に読むべき論文は?
- Block Diffusion Language Models (BD-LMs) の基礎となる論文。
- Diffusion Forcing戦略を提案した論文。
- DMaxに関する論文(本論文で言及されている性能向上技術)。
- KV cachingやflexible-length generationといった、BD-LMsの基盤技術に関する論文。
Abstract (原文)
Block Diffusion Language Models (BD-LMs) improve diffusion-based text generation with KV caching and flexible-length generation. A natural next step is to extend them from Single-Block Diffusion (SingleBD) to Multi-Block Diffusion (MultiBD), where a running-set of consecutive blocks is decoded concurrently for inter-block parallelism. However, existing BD-LMs are mostly trained under teacher forcing, where the model observes only one noisy block conditioned on a clean prefix. While the recent diffusion forcing strategy introduces visibility among multiple noisy blocks, its training states still differ from MultiBD inference, where decoding operates on a bounded running-set with heterogeneous slot-wise noise patterns. To bridge this gap, we propose Multi-Block Diffusion Language Models (MBD-LMs), obtained by post-training BD-LMs with Multi-block Teacher Forcing (MultiTF). MultiTF integrates teacher forcing and diffusion forcing by training on bounded noise-groups conditioned on clean prefixes, with randomized noise-schedulers that better match MultiBD inference states. To make MultiBD practically executable, we further introduce an optimized decoding algorithm based on the Block Buffer mechanism that preserves prefix-cache reuse, keeps input shapes static, and translates increased decoding parallelism into wall-clock acceleration. Empirically, MBD-LLaDA2-Mini increases average Tokens Per Forward pass (TPF) from 3.47 to 6.19 and improves average accuracy from 79.95% to 81.03%; when combined with DMax, MBD-LLaDA2-Mini-DMax reaches an average TPF of 9.34 with only a 1.02% accuracy drop on math and code benchmarks.