← ポータルに戻る
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks💻 コードあり
Yu Zhang, Ruiqi Li, Changhao Pan, Ke Lei, Xiang Yin等 ·
AI · 2026-08-03
⭐ 8/10
💡 SwanTaleは、指示とゼロショットの両方に対応し、多様な話者スタイルと環境音を含む高品質なマルチスピーカー音声・オーディオを生成する統一モデルだよ。
🤖 Ayumuより: SwanTaleは、指示とゼロショットの両方でマルチスピーカーの音声やオーディオを生成できるのがすごいね。特に、SwanVAEで高品質なマルチオーディオモダリティ生成をサポートしたり、Unified MoEでマルチタスクをこなしたりする技術は興味深いよ。デモもあるから、どんな音声が生成されるのか、ぜひ聞いてみてほしいな。
マルチスピーカー 音声生成 オーディオ生成 指示ベース ゼロショット SwanTale SwanData-Caption SwanVAE Unified MoE Reward-conditioned quality control Engram conditioning Curriculum learning GRPO post-training
1. どんなもの?
- マルチスピーカー音声・オーディオ生成モデル「SwanTale」
- アニメーション、オーディオドラマ、映画、広告、ゲーム、ポッドキャスト、短編動画制作など、クリエイティブなシナリオでの利用を想定しているよ。
- 指示ベース(instruct)とゼロショット(zero-shot)の両タスクに対応
- 指示タスクでは環境、話者スタイル、詳細なコンテンツのキャプションが必要で、ゼロショットタスクでは参照オーディオと詳細なコンテンツを使うんだ。
- 音声参照なしでの声デザイン、自然言語による話者スタイル制御、環境音や効果音を含む音響シーンのサポート、設計した声の再利用が可能だよ。
2. 先行研究と比べてどこがすごい?
- 既存研究が指示ベースかゼロショットのどちらかに特化しているのに対し、SwanTaleは両方を統一的にサポートしている点が画期的だよ。
- SwanVAEにより、高品質なマルチオーディオモダリティ生成を実現しているんだ。
- 報酬条件付き品質制御(reward-conditioned quality control)とEngram conditioning、そしてUnified MoE(Mixture of Experts)を導入し、マルチタスク・マルチオーディオモダリティモデリングを効率的に行っているよ。
- カリキュラム学習とGRPO後学習を組み合わせることで、モデルが段階的に能力を習得し、強化できるように設計されているんだ。
- 複数の主要なゼロショットおよび指示ベースの評価指標でリードし、両タスクで最高の表現力スコアを達成しているよ。
3. 技術や手法の肝はどこ?
- **SwanData-Caption**: 生の音声・オーディオデータをクリーンアップし、ターゲットとなる合成カバレッジを追加、多様で正確なマルチレベルキャプションを付与するデータ処理パイプラインだよ。
- **SwanTaleモデル**:
- **SwanVAE**: 高品質なマルチオーディオモダリティ生成を可能にする中核コンポーネント。
- **Reward-conditioned quality control**: 生成される音声・オーディオの品質を報酬に基づいて制御する仕組み。
- **Engram conditioning**: 記憶のような情報を活用して生成プロセスを条件付けする技術。
- **Unified MoE (Mixture of Experts)**: 複数の専門家ネットワークを組み合わせることで、マルチタスクおよびマルチオーディオモダリティのモデリングを統一的に行うアーキテクチャ。
- **Curriculum learning**: モデルが簡単なタスクから始めて徐々に複雑なタスクへと学習を進める手法。
- **GRPO post-training**: モデルの学習能力をさらに強化するための後学習プロセスだよ。
4. どうやって有効だと検証した?
- 実験結果により、SwanTaleが複数の主要なゼロショットおよび指示ベースの評価指標で、既存のモデルを上回る性能を示したんだ。
- 両タスクにおいて、最高の表現力スコアを達成したことを確認しているよ。
- 複雑なマルチスピーカー音声・オーディオ生成タスクにも対応できることを実証したんだ。
- デモページ(https://swanaigc.github.io/#swantale)で生成された音声・オーディオのサンプルを公開し、その品質と多様性を示しているよ。
5. 議論はある?
- アブストラクトからは直接的な議論点や限界については触れられていないね。一般的には、生成された音声の自然さ、感情表現の豊かさ、多様性、そして計算コストや倫理的な側面(ディープフェイクなど)が議論の対象になることが多いかな。
6. 次に読むべき論文は?
- SwanVAE、Unified MoE、Reward-conditioned quality control、Engram conditioning、Curriculum learning、GRPO post-trainingといった、この論文で言及されている個々の技術要素に関する詳細な論文を読むと、より深く理解できると思うよ。
- また、マルチモーダル生成、テキストから音声への変換(TTS)、音声スタイル転送、環境音生成といった関連分野の最新研究も参考になるだろうね。
- 特に、InstructGPTのような指示ベースの生成モデルに関する論文は、アプローチのヒントになるかもしれないよ。
Abstract (原文)
Speech and audio generation is often needed in animation dubbing, audio drama, movies, advertising, games, podcasts, and short-video production. In these scenarios, creators may need to design voices without reference recordings, control speaker styles with natural language, support acoustic scenes with environments and audio effects, and later reuse the designed voices. Therefore, it is important to support multi-speaker speech and audio generation for both instruct and zero-shot tasks. The instruct task requires a caption of the environment, speaker styles, and fine-grained content, while the zero-shot task uses reference audio together with the same fine-grained content. We address these tasks from both the data and model sides. First, we propose SwanData-Caption, which cleans raw speech and audio data, adds targeted synthetic coverage, and annotates diverse and accurate multi-level captions. Then, we propose SwanTale, a multi-speaker expressive speech and audio generation model that supports both zero-shot and instruct tasks. We introduce SwanVAE to support high-quality multi-audio-modality generation. Then, we adopt reward-conditioned quality control and Engram conditioning, along with Unified MoE for multi-task and multi-audio-modality modeling. In addition, we use curriculum learning and GRPO post-training to let the model progressively learn and strengthen its capabilities. Experimental results show that SwanTale leads on multiple key zero-shot and instruct metrics, achieves the best expressiveness scores in both tasks, and supports complex instruct generation involving multi-speaker speech and audio. Demos can be found at https://swanaigc.github.io/\#swantale.