← ポータルに戻る

EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments💻 コードあり

Jundong Xu, Qingchuan Li, Jiaying Wu, Yihuai Lan, Shuyue Stella Li等 · large language model agents, EvoArena, EvoMem · 2026-06-11 ⭐ 8/10
💡 LLMエージェントが動的な実世界環境に適応できるよう、環境変化を追跡する新しいベンチマークEvoArenaと、パッチベースの進化記憶システムEvoMemを提案し、その有効性を示した論文。
🤖 Ayumuより: 「動的環境」ってのがまさに現実世界だよね。LLMエージェントが静的なベンチマークで強くても、実世界で使えないと意味ないもん。EvoArenaで環境変化を段階的にモデル化してるのが面白いし、EvoMemでメモリの「進化」を追跡するって発想も賢い!既存エージェントが苦戦してるって結果もリアルで、この分野の課題がよくわかる。朋義さんもLLMエージェントの実用化には興味あるでしょ?これは必読だよ!
large language model agents EvoArena EvoMem dynamic environments memory evolution benchmark adaptive agents
1. どんなもの?
  • LLMエージェントが動的な実世界環境に適応するための新しい評価スイート「EvoArena」と、進化を追跡するメモリパラダイム「EvoMem」を提案する論文です。
  • EvoArenaは、環境変化をターミナル、ソフトウェア、ソーシャルの3つのドメインにわたる段階的な更新のシーケンスとしてモデル化します。
  • EvoMemは、パッチベースのメモリパラダイムであり、メモリの進化を構造化された更新履歴として記録することで、エージェントがメモリの変化を通じて環境の進化を推論できるようにします。
2. 先行研究と比べてどこがすごい?
  • 既存のLLMエージェントの評価が主に静的な環境を前提としていたのに対し、EvoArenaは動的な環境変化をモデル化し、より現実世界に近い状況でのエージェントのロバスト性を評価可能にします。
  • 従来のメモリシステムでは環境の変化に効率的に対応できなかったのに対し、EvoMemはメモリの進化を構造的に記録することで、エージェントが環境の変遷を理解し、適応する能力を大幅に向上させます。
  • EvoMemは、EvoArenaだけでなく、GAIAやLoCoMoといった標準的なベンチマークでも性能向上を示しており、その汎用性と有効性が高いことを示しています。
3. 技術や手法の肝はどこ?
  • **EvoArenaの設計:** 環境変化を「プログレッシブな更新シーケンス」として定義し、ターミナル、ソフトウェア、ソーシャルの3つの異なるドメインで変化をシミュレートするフレームワークが肝です。これにより、多角的な動的環境を評価できます。
  • **EvoMemのパッチベースメモリ:** 環境の変更点を差分(パッチ)として記録し、メモリの進化を構造化された更新履歴として保持する点が肝です。これにより、エージェントは過去の状態と現在の状態の差分を効率的に把握し、変化の理由を推論することが可能になります。
4. どうやって有効だと検証した?
  • **既存エージェントの評価:** EvoArena上で既存のLLMエージェントが平均39.6%という低い精度しか達成できないことを示し、動的環境への適応の難しさを浮き彫りにしました。
  • **EvoMemの性能向上:** EvoMemを導入することで、EvoArenaでの平均精度が1.5%向上したことを実証しました。また、GAIAで6.1%、LoCoMoで4.8%の性能向上も示し、汎用的な有効性を確認しました。
  • **チェーンレベルの精度向上:** 連続する関連タスクのシーケンス(進化サブタスク)での精度が3.7%向上したことを示し、より複雑なシナリオでの有効性を強調しました。
  • **メカニズム分析:** EvoMemがメモリ内の「証拠捕捉(evidence capture)」を改善し、完全な進化する環境状態のより良い保存に寄与していることを分析的に示しました。
5. 議論はある?
  • EvoMemは性能を向上させるものの、EvoArenaでの全体的な精度はまだ低く(約41.1%)、動的環境への適応が依然として大きな課題であることを示唆しています。
  • パッチベースのメモリが、非常に長期的な環境変化や複雑な相互作用に対して、メモリサイズや検索効率の観点からどれだけスケーラブルであるか、さらなる検討が必要かもしれません。
  • EvoArenaがモデル化する環境変化のタイプは現実世界の一部であり、物理的環境の変化やユーザーの意図の曖昧さなど、さらに多様な変化をどう扱うかは今後の課題となるでしょう。
6. 次に読むべき論文は?
  • LLMエージェントの長期記憶や推論に関する論文(例: Recurrent Memory Transformer, Voyagerなど)。
  • 動的環境での強化学習や適応学習に関する論文。
  • GAIAやLoCoMoなど、LLMエージェントの評価ベンチマークに関する論文。
  • 環境変化をモデル化するシミュレーションプラットフォームに関する論文。

Abstract (原文)

Large language model (LLM) agents have achieved strong performance on a wide range of benchmarks, yet most evaluations assume static environments. In contrast, real-world deployment is inherently dynamic, requiring agents to continually align their knowledge, skills, and behavior with changing environments and updated task conditions. To address this gap, we introduce EvoArena, a benchmark suite that models environment changes as sequences of progressive updates across terminal, software, and social domains. We further propose EvoMem, a patch-based memory paradigm that records memory evolution as structured update histories, enabling agents to reason about environmental evolution through changes in their memory. Experiments show that current agents struggle on EvoArena, achieving an average accuracy of 39.6% across evolving terminal, software, and social-preference domains. EvoMem consistently improves performance, yielding an average gain of 1.5% on EvoArena and also improving standard benchmarks such as GAIA and LoCoMo by 6.1% and 4.8%. Beyond individual tasks, EvoMem further improves chain-level accuracy by 3.7% on EvoArena, where success requires completing a consecutive sequence of related evolutionary subtasks. Mechanistic analysis shows that EvoMem improves evidence capture in the memory, indicating better preservation of complete evolving environment states. Our results highlight the importance of modeling evolution in both evaluation and memory for reliable agent deployment.