← ポータルに戻る

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling💻 コードあり

Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li等 · AI · 2026-08-03 ⭐ 8/10
💡 テキスト生成において、高容量な連続潜在表現を直接学習する新しい拡散モデルAURORA-LMを提案し、高い性能を達成した論文。
🤖 Ayumuより: 連続潜在空間での言語モデルは、テキストの表現力を高める可能性があって面白いね。特に、高容量な潜在表現をそのまま扱いつつ、拡散モデルでうまく学習させる工夫がすごいと思うよ。画像や音声のように、テキストもより滑らかな生成ができるようになる未来が見えるかな。朋義さんには、この「連続潜在空間」というアプローチが、テキストの構造や意味をどう捉えるのか、その哲学的な側面も面白いんじゃないかな。
AURORA-LM 連続潜在空間 拡散モデル 言語モデル Query-based Encoder-Decoder Block-causal Diffusion Transformer フローマッチング 自己軌道一貫性
1. どんなもの?
  • 連続潜在空間を用いた新しい拡散ベース言語モデル「AURORA-LM」を提案
  • 画像や音声のように、テキストも離散トークンではなく連続的な潜在表現で生成することを目指す。既存の連続言語モデルが抱える課題(生成・デコードに適さない埋め込み空間、忠実度を犠牲にした潜在表現の圧縮)を克服する。
  • 高容量でデコード可能なテキスト潜在表現の構築と、その分布モデリングを分離
  • Query-based Encoder-Decoderがテキストを高容量でプレフィックスアラインされた潜在シーケンスに変換し、Block-causal Diffusion Transformerがフローマッチングを通じてその分布を学習し、テキストを生成する。
2. 先行研究と比べてどこがすごい?
  • 既存の連続言語モデルが、生成とデコードに適さない埋め込み空間を使ったり、拡散モデルのために潜在表現を圧縮してトークンレベルの忠実度を犠牲にしていたのに対し、AURORA-LMは高容量でデコード可能な潜在表現をそのまま維持し、その分布を直接学習する拡散モデルを設計した点。
  • 特に、拡散モデルが扱いにくい高容量潜在空間に対応するため、ノイズ入力経路のみを制限し、クリーンな潜在予測ターゲットはフル幅を維持することで、デコーダ側の容量を減らさずに拡散モデルの学習を可能にした点が新しい。
  • OpenWebTextの自由生成とXSum要約タスクにおいて、評価された連続および拡散ベースの言語モデルの中で最高の性能を達成し、より大規模な既存モデルをも上回る。
3. 技術や手法の肝はどこ?
  • **高容量・デコード可能な潜在表現の維持:** 既存手法のように潜在表現を圧縮せず、デコーダに直接向き合う高忠実度な表現をそのまま扱う。
  • **Query-based Encoder-Decoder:** テキストを高容量でプレフィックスアラインされた潜在シーケンスに変換し、テキストの構造を効率的に捉える。
  • **Block-causal Diffusion Transformer:** フローマッチングを用いて潜在表現の分布を学習。生成はブロック単位で左から右に進め、各ブロック内では位置を並列にデノイズする、効率的な生成戦略を採用。
  • **ノイズ入力経路の制限とフル幅クリーン潜在予測:** 拡散モデルの学習を容易にするため、ノイズが加えられる入力経路のみを制限しつつ、モデルが予測すべきクリーンな潜在表現はフル幅を維持することで、デコーダへの情報量を最大化する。
  • **ノイズレベル分布のキャリブレーション:** 潜在幅に合わせてノイズレベル分布を調整し、学習の安定性を向上させる。
  • **自己軌道一貫性 (self-trajectory consistency):** トレーニング時の独立したノイズサンプリングと、推論時の反復デノイズの間のギャップを埋めることで、生成品質を高める。
4. どうやって有効だと検証した?
  • **評価タスク:** OpenWebTextでの自由生成と、XSumでの要約タスクの2つの主要なテキスト生成タスクで性能を評価した。
  • **比較対象:** 既存の連続および拡散ベースの言語モデルと比較を行った。
  • **性能結果:** AURORA-LMが両タスクにおいて、比較対象のモデルの中で最高の性能を達成したことを示した。
  • **スケーリング効果:** 1Bパラメータにスケールアップし、約1500 EFLOPsの計算量でさらに性能が向上することを確認した。
  • **既存大規模モデルとの比較:** より大規模な公開されている潜在拡散言語モデルを、一致した評価プロトコル下で上回る性能を示した。
  • **ハードウェア:** 全ての実験はAscend NPUで実施された。
5. 議論はある?
  • アブストラクトからは直接的な限界や議論は読み取れないが、高容量の潜在空間を扱うモデルは一般的に計算コストが高くなる傾向があるため、その効率性やスケーラビリティに関する詳細な分析は今後の議論の余地があるかもしれない。
  • 「ノイズ入力経路のみを制限」という独自のアプローチが、特定の種類のテキスト生成や非常に長いシーケンスにおいてどのような影響を与えるか、さらなる検証が求められる可能性もある。
  • Ascend NPUでの実験結果が、他の一般的なGPU環境での性能や再現性にどう影響するかは、興味深い点だね。
6. 次に読むべき論文は?
  • Query-based Encoder-Decoderの具体的なアーキテクチャやその効果に関する詳細な論文。
  • Flow Matchingを用いた拡散モデルの理論的背景や応用例に関する論文。
  • テキスト生成における拡散モデルの最新の進展やサーベイ論文。
  • 連続潜在空間を用いた画像や音声生成モデルの論文を読んで、分野横断的なアプローチを比較検討するのも面白いかもしれないね。

Abstract (原文)

Language remains an outlier in generative modeling: while images, video, and audio are increasingly modeled in continuous latent spaces, text generation still relies predominantly on discrete tokens. Existing continuous language models either inherit embedding spaces not designed for joint generation and decoding, or compress autoencoded latents to ease diffusion, sacrificing token-level fidelity. Instead of simplifying the representation to suit the generative model, we preserve a high-capacity, decodable text latent and design the diffusion model to learn its distribution directly. We introduce AURORA-LM, a continuous-latent diffusion language model that separates the construction of a decodable text representation from the modeling of its distribution. A Query-based Encoder-Decoder organizes text into a high-capacity, prefix-aligned latent sequence, and a Block-causal Diffusion Transformer learns its distribution through flow matching, generating blocks left to right while denoising positions within each block in parallel. Because such a latent is harder for diffusion to model, AURORA-LM restricts only the noisy-input pathway while retaining the full clean-latent prediction target, accommodating full-width latents without reducing decoder-facing capacity. We further calibrate the noise-level distribution to the latent width, and introduce self-trajectory consistency to bridge independently sampled training noise and iterative denoising at inference. AURORA-LM achieves the strongest performance among evaluated continuous and diffusion-based language models on OpenWebText free generation and XSum summarization. Scaling to 1B parameters with about 1500 EFLOPs of total compute yields further gains, surpassing a larger publicly released latent-diffusion language model under a matched evaluation protocol. All experiments are conducted on Ascend NPUs.