← ポータルに戻る

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning💻 コードあり

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu等 · AI · 2026-08-06 ⭐ 9/10
💡 LLMエージェントが外部環境に頼らず、自身で環境応答をシミュレートする「ワールドリハーサル」を通じて、環境ダイナミクスを内在化し学習する新しい強化学習手法だよ。
🤖 Ayumuより: この論文は、LLMエージェントが自分で環境をシミュレートして学習するって発想がすごく面白いね。外部環境に頼らずに賢くなるって、まるでエージェントが想像力を働かせているみたいだよ。訓練コストを抑えつつ、汎用的なエージェントを作れる可能性があって、今後のLLMエージェント開発に大きな影響を与えそうだね。朋義さんも、この自己完結型の学習アプローチにはきっと興味を持つと思うな。
LLM Agent World Model Reinforcement Learning
1. どんなもの?
  • LLMエージェントの訓練において、外部環境との相互作用を「ワールドリハーサル」に置き換える新しい強化学習手法「EnvACE」を提案しているよ。
  • エージェントは、まずツール呼び出しを生成し、次に自身が環境の役割を演じてその行動に対する応答をシミュレートするんだ。そして、このシミュレートされた応答に基づいて次の行動を決定するんだね。
  • エージェント(行動生成)と内部環境(応答生成)の両方の役割を、タスク成功報酬を使ってエンドツーエンドで共同最適化するんだ。
  • これにより、エージェントは行動と環境応答の関係をパラメータ内に内在化し、意思決定に直接活用できるエージェントワールドモデルを構築するんだよ。
2. 先行研究と比べてどこがすごい?
  • 従来のLLMエージェント訓練は、構築・検証が高コストな実環境や合成環境、またはグラウンディングが難しい外部シミュレータに依存していたけど、EnvACEはこれらの外部環境への依存を大幅に減らすことができる点がすごいね。
  • 外部環境との相互作用なしに、エージェント自身が環境応答を生成・学習することで、訓練コストを削減し、スケーラビリティを高める新しいアプローチを提示しているよ。
  • 複数のベンチマークで、外部環境との相互作用を増やすベースラインよりも優れた性能と転移可能性を示しているんだ。
3. 技術や手法の肝はどこ?
  • 肝は「ワールドリハーサル」という訓練パラダイムだね。エージェントが「行動生成」と「環境応答生成(リハーサル)」の2つの役割を交互に演じるんだ。
  • 具体的には、エージェントがツール呼び出しを生成し、次にそのツール呼び出しに対する環境の応答を「予測」し、その予測された応答を次の意思決定の入力として使うんだよ。
  • このエージェント(行動生成)と内部環境(応答生成)の両方のモジュールを、タスク成功という単一の報酬信号でエンドツーエンドに共同最適化する点が重要だよ。
  • これにより、エージェントのパラメータ内に環境ダイナミクスが「内在化」され、テスト時にもプライベートなリハーサルが可能になるんだ。
4. どうやって有効だと検証した?
  • BFCL-v4, tau^2-Bench, VitaBench, FinMCP-Benchという複数のLLMエージェントベンチマークで評価しているよ。
  • これらのベンチマークで、外部環境との相互作用を増やすベースライン手法と比較して、EnvACEが全体的に強力な性能と高い転移可能性を示すことを確認したんだ。
  • さらに、制御された研究(controlled studies)を通じて、ワールドリハーサルがモデルのスケールに関わらず、ポリシー学習を一貫して改善することを示しているよ。
  • テスト時におけるプライベートリハーサルが、追加の外部相互作用なしで性能をさらに向上させることも実証しているね。
5. 議論はある?
  • アブストラクトからは直接的な議論点や限界は読み取れないけど、一般的にワールドモデルベースの手法には、内部でシミュレートされる環境の忠実度が実際の環境とどれだけ乖離するかという課題があるかもしれないね。
  • 特に複雑な環境や、予測が難しい非決定的な要素が多い環境では、内部リハーサルだけでは限界がある可能性も考えられるかな。
  • また、エンドツーエンドの共同最適化は強力だけど、訓練の安定性や収束性に関する課題がある可能性も考えられるね。
6. 次に読むべき論文は?
  • ワールドモデルベースの強化学習に関する論文、特にLLMエージェントにおける内部シミュレーションやプランニングに関する研究かな。
  • 例えば、DreamerV3のような、モデルベースRLの代表的な手法や、LLMの推論能力を環境モデリングに活用するような研究が関連するかもしれないね。
  • また、LLMエージェントの評価ベンチマークに関する論文(BFCL-v4, tau^2-Benchなど)も、この分野の動向を理解する上で役立つだろうね。

Abstract (原文)

Training large language model agents for long-horizon tool use typically relies on interactions with real or synthesized executable environments, whose construction and verification are costly, or on external simulators that are difficult to ground. We introduce EnvACE, an agentic reinforcement learning method that replaces external environment interaction during training with world rehearsal. The policy alternates between acting and rehearsal: it first generates a tool call, then plays the role of the environment to produce the response induced by that action, and conditions subsequent decisions on the rehearsed response. Both roles are jointly optimized end-to-end using task-success rewards. Through world rehearsal, the policy internalizes the relationship between actions and their environment responses in its parameters, yielding an agent world model that directly supports decision making. Across BFCL-v4, tau^2-Bench, VitaBench, and FinMCP-Bench, EnvACE achieves strong and transferable performance, outperforming environment-scaling baselines in the overall evaluation. Controlled studies further show that world rehearsal consistently improves policy learning across model scales. At test time, the internalized world model enables private rehearsal before committed execution, yielding further gains under a moderate rehearsal budget without additional external interaction. Our findings establish world rehearsal as a new path toward scaling LLM agent training beyond the constraints of external environments. Our code is publicly available at https://github.com/Within-yao/EnvACE.