← ポータルに戻る
Improved Large Language Diffusion Models💻 コードあり
Shen Nie, Qiyang Min, Shaoxuan Xu, Zihao Huang, Yuxuan Song等 ·
masked diffusion language model, bidirectional attention, autoregressive factorization · 2026-06-24
⭐ 9/10
💡 自己回帰型が主流のLLMにおいて、完全に双方向アテンションを持つマスク型拡散モデル「iLLaDA」が、大規模学習とSFTにより既存モデルを凌駕する性能を示し、新たなLLM開発の道を拓いた。
🤖 Ayumuより: 自己回帰型が主流のLLM界に、拡散モデルでここまで食い込んでくるのは面白いね。双方向アテンションでコードや数学に強いっていうのが特にいいところ。朋義さん、素粒子論のデータ補完とか、シミュレーション結果の生成とかに応用できるかもしれないよ。並列計算の恩恵も大きいだろうし、新しいアプローチとしてチェックしてみてほしいな。
Masked Diffusion Language Model Bidirectional Attention Non-autoregressive iLLaDA Large Language Models
1. どんなもの?
- iLLaDA (Improved Large Language Diffusion Models) という、80億パラメータを持つ新しい言語モデルです。
- 従来のLLMが主流とする自己回帰型(左から右へ順に生成)ではなく、マスク型拡散モデルとして設計されています。
- 完全に双方向のアテンション機構を採用しており、全てのトークンが互いに参照し合って文脈を理解します。
- 事前学習から教師ありファインチューニング(SFT)まで一貫してマスク型拡散目的で訓練されており、事前学習は12兆トークン、SFTは250億トークンの命令コーパスで12エポック行われました。
- 効率的な推論のために可変長生成を導入し、多肢選択評価の精度向上のために信頼度ベースのスコアリング手法も提案しています。
2. 先行研究と比べてどこがすごい?
- 従来のLLMが自己回帰型と因果的アテンションに依存しているのに対し、iLLaDAは完全に双方向の拡散モデルという異なるアプローチで、非常に強力な性能を達成しています。
- 先行研究であるLLaDAと比較して、汎用、数学、コードの各ベンチマークで大幅な性能向上を示しました。
- 例えば、iLLaDA-BaseはBBHで21.6点、ARC-Challengeで14.9点向上。iLLaDA-InstructはMATHで14.5点、HumanEvalで16.5点向上しています。
- 非自己回帰型訓練にもかかわらず、自己回帰型の強力なモデルであるQwen2.5 7Bと複数のベンチマークで競争力のある性能を発揮しています。
3. 技術や手法の肝はどこ?
- **マスク型拡散言語モデル**: 入力シーケンスの一部をマスクし、そのマスクされた部分を予測・復元する拡散プロセスを言語モデルの訓練目的としています。
- **完全に双方向のアテンション**: 自己回帰型モデルのような左から右への情報フローの制約がなく、シーケンス内の全てのトークンが互いの情報を利用して文脈を構築します。これにより、より深い文脈理解が可能になります。
- **一貫した訓練目的**: 事前学習からSFTまで、マスク型拡散目的を継続して使用することで、モデルが一貫した学習パラダイムで能力を向上させます。
- **可変長生成**: 推論時の効率性を高めるために、生成されるシーケンスの長さを動的に調整する手法を導入しています。
- **信頼度ベースのスコアリング**: 多肢選択問題の評価において、モデルの出力の信頼度を考慮に入れることで、より正確な評価を可能にします。
4. どうやって有効だと検証した?
- 大規模なデータセットを用いた訓練を実施しました。具体的には、12兆トークンでの事前学習と、250億トークンの命令コーパスでの12エポックにわたるSFTを行いました。
- 汎用的な推論能力を測るBBHやARC-Challenge、数学的推論能力を測るMATH、コード生成能力を測るHumanEvalなど、多岐にわたる標準的なベンチマークで性能を評価しました。
- これらのベンチマークにおいて、先行研究であるLLaDAモデルと比較し、顕著な性能向上を実証しました。
- さらに、自己回帰型モデルの代表格であるQwen2.5 7Bと比較し、非自己回帰型であるiLLaDAが競争力のある性能を示すことを確認しました。
5. 議論はある?
- アブストラクトからは直接的な議論の記述はありませんが、非自己回帰型モデルは一般的に、生成の流暢さや一貫性において自己回帰型モデルに劣るという課題が指摘されがちです。iLLaDAがQwen2.5 7Bと競合する性能を示したことは、これらの課題を克服した、あるいはそれに迫る性能を出したことを示唆しており、この点に関する詳細な分析や議論が期待されます。
- 完全に双方向のアテンションは、計算コストやメモリ要件が増大する可能性があり、その効率性やスケーラビリティに関する議論も考えられます。
6. 次に読むべき論文は?
- **LLaDA**: iLLaDAのベースとなったモデルに関する論文を読むことで、改善点や進化の経緯を深く理解できます。
- **Qwen2.5 7B**: 比較対象として挙げられている自己回帰型モデルの論文を読むことで、異なるアプローチ間の性能比較やトレードオフをより詳細に検討できます。
- **BERT (Bidirectional Encoder Representations from Transformers)**: 双方向アテンションの先駆けとなったモデルであり、マスク型言語モデルの基礎を理解する上で重要です。
- **Diffusion Models for Language Generation**: 言語生成に拡散モデルを適用する他の研究論文を読むことで、この分野の動向や課題を把握できます。
Abstract (原文)
Modern large language models are predominantly trained with autoregressive factorization and causal attention. We present iLLaDA, an 8B masked diffusion language model trained from scratch with fully bidirectional attention. iLLaDA keeps the masked diffusion objective throughout pre-training and supervised fine-tuning (SFT), scaling pre-training to 12T tokens and fine-tuning on a 25B-token instruction corpus for 12 epochs. We further use variable-length generation for efficiency and introduce confidence-based scoring for multiple-choice evaluation. Compared with LLaDA, iLLaDA improves broadly across general, mathematical, and code benchmarks; for example, iLLaDA-Base improves by 21.6 points on BBH and 14.9 points on ARC-Challenge, while iLLaDA-Instruct improves by 14.5 points on MATH and 16.5 points on HumanEval. Despite its non-autoregressive training, iLLaDA also remains competitive with Qwen2.5 7B on several benchmarks. These results show that fully bidirectional diffusion training from scratch is a competitive path toward strong language models. Model weights and codes: https://github.com/ML-GSAI/LLaDA.