← ポータルに戻る

GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks💻 コードあり

Leijun Zhou, Zhihao Liu, Xiang Qu, Chenxu Liu, Yifei Liu等 · AI · 2026-08-04 ⭐ 8/10
💡 エージェントの自己進化能力を、実際のビジネスワークフローに基づいた新しい自動生成ベンチマーク「GDPevo」で評価し、その有効性と現在の限界を示した論文だよ。
🤖 Ayumuより: エージェントの自己進化って、すごく未来を感じるテーマだよね。特に、実際のビジネス課題に焦点を当てて、訓練とテストの独立性を保証する「ルールハイブリダイゼーション」のアイデアは、評価の信頼性を高める上でとても重要だと思うな。現在のエージェントがまだオラクルに遠いという結果も、今後の研究のモチベーションになるね。朋義さんも、この分野の進展には注目してるんじゃないかな。
Agent self-evolution Benchmark Enterprise workflows Rule hybridization Data contamination LLM agents
1. どんなもの?
  • エージェントの自己進化能力を評価するための新しいベンチマーク「GDPevo」とその自動生成パイプラインだよ。
  • 自己進化とは、エージェントが過去の経験から永続的な状態を更新し、関連タスクをより効果的に解決する能力のこと。
  • GDP関連の実際のエンタープライズワークフロー(CRM、ERP、金融、ヘルスケア、法務など)に基づいているんだ。
  • 訓練経験がテスト時の性能向上に直接寄与することを保証する「ルールハイブリダイゼーション」メカニズムが特徴だよ。
2. 先行研究と比べてどこがすごい?
  • 既存のベンチマークが抱える課題を解決している点がすごいよ。
  • 経済的価値のあるタスクドメインのカバー範囲が広く、より現実的な評価が可能になっているんだ。
  • 訓練とテストタスクの設計が工夫されており、テスト時の性能向上が訓練経験に明確に帰属できることを保証しているよ。
  • 完全自動化されたデータパイプラインにより、データ汚染(data contamination)のリスクを大幅に軽減し、迅速なタスク拡張が可能になっているんだ。
3. 技術や手法の肝はどこ?
  • 核心技術は「ルールハイブリダイゼーション」だよ。
  • 各エンタープライズワークフローを「原子的なビジネスルール」に分解するんだ。
  • 訓練タスクにはこれらのルールの一部を分散して提示し、エージェントに個々のルールを学ばせるよ。
  • テストタスクでは、訓練タスクでは直接見られなかったルールの新しい組み合わせを提示するんだ。これにより、エージェントが訓練で学んだルールを新しい状況で汎用的に適用する能力(自己進化)を評価できるよ。
  • また、ベンチマークタスクを迅速に生成・拡張できる「完全自動化されたデータパイプライン」も重要な肝だね。
4. どうやって有効だと検証した?
  • GDPevoベンチマークを用いて、4つの異なるエージェント(それぞれハーネスとモデルの組み合わせ)を4つの監視タイプで評価したんだ。
  • その結果、自己進化がテスト時の精度を最大16.44パーセンテージポイント向上させることを一貫して示したよ。
  • この評価を通じて、GDPevoがエージェントの自己進化の有効性を定量的に測定できることを実証したんだ。
5. 議論はある?
  • 自己進化は精度を向上させるものの、最良のエージェントでも完全に情報を持つオラクル(91.6%)には遠く及ばない点が議論の余地があるね。
  • これは、現在のエージェントの自己進化能力がまだ十分に実現されておらず、今後の研究で大きく改善される可能性があることを示唆しているよ。
  • ベンチマークのタスク数やドメインは自動化により拡張可能だけど、実際のビジネスの複雑さをどこまで網羅できるか、という点は常に検討されるべき課題だね。
6. 次に読むべき論文は?
  • エージェントの自己進化に関する基礎研究や、より複雑な推論を必要とするタスクにおけるエージェントの能力評価に関する論文がいいと思うよ。
  • 特に、LLMベースのエージェントがどのように知識を蓄積し、新しいタスクに転移学習するかを扱った論文や、タスク分解(Task decomposition)とプランニング(Planning)に関する研究も関連性が高いね。
  • 「Agent self-evolution」「LLM agents」「Task decomposition」「Transfer learning in agents」などのキーワードで検索してみるといいかな。

Abstract (原文)

Agent self-evolution updates an agent's persistent state from prior experience and reuses it to solve related tasks more effectively. Evaluating self-evolution is difficult: existing benchmarks provide limited coverage of economically valuable task domains, do not always design training and test tasks such that test-time gains can be attributed to training experience, and remain vulnerable to data contamination. We present GDPevo, an evolution-native benchmark grounded in GDP-related enterprise workflows, together with the fully automated data pipeline that generates it. Its core mechanism, rule hybridization, decomposes each enterprise workflow into atomic business rules, distributes subsets of these rules across training tasks, and recombines them in held-out test tasks so that test-time gains are attributable. GDPevo spans CRM, ERP, finance, healthcare, legal, and data-centric workflows. Its V1 release contains 120 tasks in 12 groups, with five training and five held-out test tasks per group. Full automation enables the pipeline to expand the suite to 240 tasks in 24 groups (V2) within two days, providing a practical response to contamination. Using GDPevo, we evaluate four agents, each comprising a harness and a model, under four supervision types. Self-evolution consistently improves held-out accuracy by up to 16.44 percentage points. But the best evolved agents remain far below the fully informed oracle ceiling of 91.6%, indicating that the self-evolution ability of current agents remains far from fully realized. We publicly release the pipeline, benchmark, and full evaluation results at https://github.com/Prism-Shadow/GDPevo.