← ポータルに戻る

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning💻 コードあり

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen等 · AI · 2026-07-16 ⭐ 9/10
💡 LLMエージェントが自身の失敗から自然言語で「後知恵スキル」を生成し、それを自己進化的にポリシーに蒸留することで、疎な報酬問題を克服し効率的に学習するフレームワーク。
🤖 Ayumuより: LLMエージェントのRLって、報酬設計が難しいのがネックだったんだよね。このSEEDは、エージェント自身に「こうすればよかった」っていう後知恵スキルを自然言語で考えさせて、それを学習に使うってのが面白い!しかも、ポリシーが賢くなるとスキルの分析も上手くなるっていう自己進化ループがすごいね。朋義さん、これってLLMの自己改善能力をRLに組み込む良い例じゃないかな?
Reinforcement Learning LLM Agents Skill Distillation On-Policy Learning Hindsight Skills Self-Evolving Natural Language Skills
1. どんなもの?
  • LLMエージェントの長期間タスクにおける「疎な報酬問題」を解決する自己進化型オンポリシー蒸留フレームワーク「SEED」を提案。
  • 従来のOutcome-based RLでは、エピソードレベルの疎な報酬が中間決定に十分なガイダンスを与えられず、ポリシー学習との間にギャップがあった。
  • エージェントが完了した行動履歴(オンポリシートラジェクトリ)から「自然言語の後知恵スキル」を生成し、その行動効果をポリシー学習に蒸留する。
  • スキルは再利用可能なワークフロー、決定的な観測、失敗回避ルールなどを自然言語で表現する。
2. 先行研究と比べてどこがすごい?
  • 従来のOutcome-based RLが抱える「エピソードレベルの疎な報酬」と「トークンレベルのポリシー学習」の間の教師なしギャップを、密なトークンレベルの蒸留信号で埋める。
  • ポリシーモデル自身がトラジェクトリを分析し、自然言語で後知恵スキルを生成するため、人間が理解しやすい形で学習を促進し、外部からの複雑な報酬設計が不要。
  • ポリシーの更新が意思決定とスキル分析の両方を改善する「自己進化」の仕組みにより、後知恵の教師信号が常に現在のポリシーにアラインされ、学習が進むにつれてより質の高いスキルが生成される。
  • スキルによって誘発されるアクション確率のシフトを密な蒸留信号として利用することで、サンプル効率とパフォーマンスを大幅に向上させる。
3. 技術や手法の肝はどこ?
  • **自己進化型スキル生成:**
  • まず、ポリシーモデルをファインチューニングし、完了したトラジェクトリから「なぜ成功/失敗したか」「どうすればよかったか」といった後知恵を自然言語スキルとして生成させる。
  • RLの学習ループ中、現在のポリシーがトラジェクトリを収集するだけでなく、それらを分析してスキルを抽出する「アナライザー」としても機能。これにより、ポリシーの改善がスキル分析能力の向上にもつながり、教師信号がポリシーと共に進化する。
  • **オンポリシー蒸留:**
  • 生成されたスキルをコンテキストとしてポリシーに与え、通常コンテキストでのアクション確率とスキル拡張コンテキストでのアクション確率を比較。
  • このスキルによって誘発される確率シフトを「密なトークンレベルの蒸留信号」として抽出し、ポリシーの損失関数に組み込む。
  • この蒸留信号は、結果ベースのRLの報酬と共同で最適化され、補助的な教師信号が常に現在のトラジェクトリ分布に整合するように保たれる。
4. どうやって有効だと検証した?
  • **実験タスク:** テキストベースのエージェントタスク(ALFWorld, WebShop)とビジョンベースのエージェントタスク(MiniWoB)という、多様なエージェント環境で広範な実験を実施。
  • **評価指標:** 各タスクにおける成功率やサンプル効率を主要な評価指標とした。
  • **比較対象:** Outcome-based RLのみのベースライン、および他のスキル学習やプロンプティング手法と比較。
  • **結果:** SEEDは、すべての実験タスクにおいて、ベースラインや他の手法と比較して一貫して高いパフォーマンスと優れたサンプル効率を示した。また、未見のシナリオに対しても堅牢な汎化能力を持つことを確認した。
5. 議論はある?
  • アブストラクトからは直接的な議論点や限界は読み取れないが、一般的にLLMベースのスキル生成の品質がポリシー性能に直結するため、生成されるスキルの解釈性、多様性、および誤ったスキルが生成された場合の頑健性に関する詳細な分析は重要となる。
  • 自己進化のプロセスが、局所最適に陥ったり、不安定になったりする可能性も考えられる。進化の安定性や収束性に関する理論的保証や詳細な実証が必要かもしれない。
  • スキル生成のためのファインチューニングや、蒸留プロセスの計算コストが、大規模なLLMや複雑な環境においてどの程度現実的かという点も考慮すべきだろう。
6. 次に読むべき論文は?
  • **Hindsight Experience Replay (HER):** 疎な報酬問題を扱うRLの古典的な手法で、完了したエピソードの目標を後から変更することで学習を効率化する。SEEDの「後知恵」の概念と関連が深い。
  • **Chain-of-Thought (CoT) Prompting and Self-Refine:** LLMが推論過程を生成し、自己修正するプロンプト技術。SEEDのポリシーがスキルを生成・分析する能力と共通の思想を持つ。
  • **Hierarchical Reinforcement Learning (HRL):** 複雑なタスクをサブタスクに分解し、階層的にスキルを学習するRLの分野。SEEDのスキル学習はHRLの文脈でさらに発展する可能性がある。
  • **Other LLM-based Agent Frameworks:** LLMをエージェントとして活用する他のフレームワークや、ツール利用、プランニングに関する最新の研究。SEEDが解決しようとしている問題設定の全体像を理解するのに役立つ。

Abstract (原文)

Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.