← ポータルに戻る

Multi-Block Diffusion Language Models💻 コードあり

Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu等 · Block Diffusion Language Models, Multi-Block Diffusion, teacher forcing · 2026-06-30 ⭐ 8/10
💡 既存のBlock Diffusion Language ModelsをMulti-Block Teacher Forcingと最適化されたデコードアルゴリズムで拡張し、テキスト生成の並列性と効率を大幅に向上させた。
🤖 Ayumuより: これ、Diffusionモデルのテキスト生成をめっちゃ速くする研究だね!複数のブロックを同時に処理するMultiBDってアイデアが面白いし、そのための学習方法(MultiTF)とデコードアルゴリズムまで提案してるのがすごい。TPFが大幅に上がってるから、生成速度がボトルネックになってた部分がかなり改善されそう。朋義さん、Diffusionモデルの効率化に興味あるなら、これは要チェックだよ!
Multi-Block Diffusion Language Models Multi-Block Diffusion Multi-block Teacher Forcing Block Buffer Diffusion Language Models Text Generation Parallel Decoding
1. どんなもの?
  • Block Diffusion Language Models (BD-LMs) をMulti-Block Diffusion (MultiBD) に拡張し、テキスト生成の並列性を高めるモデル「Multi-Block Diffusion Language Models (MBD-LMs)」を提案。
  • MultiBDは、複数の連続するブロックを並行してデコードすることで、ブロック間の並列性を実現する。
  • MBD-LMsは、既存のBD-LMsを「Multi-block Teacher Forcing (MultiTF)」という新しい学習戦略で追加学習することで得られる。
  • MultiTFは、Teacher ForcingとDiffusion Forcingを統合し、MultiBD推論時の状態により合致するよう設計されている。
  • MultiBDを実用的にするため、「Block Bufferメカニズム」に基づく最適化されたデコードアルゴリズムも導入している。
2. 先行研究と比べてどこがすごい?
  • 既存のBD-LMsは主にSingle-Block Diffusion (SingleBD) であり、Teacher Forcingで学習されるため、MultiBD推論時の「複数のノイズブロックが同時に存在し、それぞれ異なるノイズパターンを持つ」という状態と学習状態が乖離していた。
  • 提案するMBD-LMsは、MultiTFという学習戦略とBlock Bufferメカニズムにより、この乖離を解消し、MultiBDを効率的かつ実用的にした点が画期的。
  • 結果として、Tokens Per Forward pass (TPF) が大幅に向上し、テキスト生成の速度と効率が飛躍的に改善された。
3. 技術や手法の肝はどこ?
  • **Multi-block Teacher Forcing (MultiTF)**:
  • 従来のTeacher ForcingとDiffusion Forcingの利点を統合した学習戦略。
  • クリーンなプレフィックスに条件付けられた、境界のあるノイズグループ(複数のノイズブロック)に対して学習を行う。
  • MultiBD推論時の異質なスロットごとのノイズパターンに、より良く一致するようにランダム化されたノイズスケジューラを使用する。
  • **最適化されたデコードアルゴリズム (Block Bufferメカニズム)**:
  • プレフィックスキャッシュの再利用を維持しつつ、入力形状を静的に保つことで、デコード並列性の向上を実測の実行時間短縮に変換する。
4. どうやって有効だと検証した?
  • MBD-LLaDA2-Miniというモデルを用いて性能を評価した。
  • 平均Tokens Per Forward pass (TPF) が3.47から6.19に増加し、平均精度も79.95%から81.03%に向上したことを示した。
  • さらに、DMaxと組み合わせたMBD-LLaDA2-Mini-DMaxでは、平均TPFが9.34に達し、数学およびコードベンチマークでわずか1.02%の精度低下に抑えられたことを示した。
  • これらの結果は、MBD-LMsが生成速度と効率を大幅に向上させつつ、高い精度を維持できることを実証している。
5. 議論はある?
  • DMaxと組み合わせた際にわずかな精度低下(1.02%)が見られることから、速度向上と精度維持の間にトレードオフが存在する可能性が示唆される。このバランスをどう取るかは議論の余地があるかもしれない。
  • MultiTFがMultiBD推論の状態に「より良く一致する」とあるが、完全に一致しているわけではない可能性も考えられ、さらなる一致度向上や、より汎用的な学習戦略の探求が今後の課題となりうる。
6. 次に読むべき論文は?
  • Block Diffusion Language Models (BD-LMs) の基礎となる論文。
  • Diffusion Forcing戦略を提案した論文。
  • DMaxに関する論文(本論文で言及されている性能向上技術)。
  • KV cachingやflexible-length generationといった、BD-LMsの基盤技術に関する論文。

Abstract (原文)

Block Diffusion Language Models (BD-LMs) improve diffusion-based text generation with KV caching and flexible-length generation. A natural next step is to extend them from Single-Block Diffusion (SingleBD) to Multi-Block Diffusion (MultiBD), where a running-set of consecutive blocks is decoded concurrently for inter-block parallelism. However, existing BD-LMs are mostly trained under teacher forcing, where the model observes only one noisy block conditioned on a clean prefix. While the recent diffusion forcing strategy introduces visibility among multiple noisy blocks, its training states still differ from MultiBD inference, where decoding operates on a bounded running-set with heterogeneous slot-wise noise patterns. To bridge this gap, we propose Multi-Block Diffusion Language Models (MBD-LMs), obtained by post-training BD-LMs with Multi-block Teacher Forcing (MultiTF). MultiTF integrates teacher forcing and diffusion forcing by training on bounded noise-groups conditioned on clean prefixes, with randomized noise-schedulers that better match MultiBD inference states. To make MultiBD practically executable, we further introduce an optimized decoding algorithm based on the Block Buffer mechanism that preserves prefix-cache reuse, keeps input shapes static, and translates increased decoding parallelism into wall-clock acceleration. Empirically, MBD-LLaDA2-Mini increases average Tokens Per Forward pass (TPF) from 3.47 to 6.19 and improves average accuracy from 79.95% to 81.03%; when combined with DMax, MBD-LLaDA2-Mini-DMax reaches an average TPF of 9.34 with only a 1.02% accuracy drop on math and code benchmarks.