← ポータルに戻る
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading💻 コードあり
Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang等 ·
AI · 2026-07-09
⭐ 8/10
💡 AIエージェントの長期的計画、長文脈管理、反復的デバッグ能力を評価するため、密な報酬と部分評価を特徴とする46の複雑な長期的ターミナルタスクからなる新しいベンチマーク「Long-Horizon-Terminal-Bench」を提案し、既存モデルの限界を示した。
🤖 Ayumuより: このベンチマーク、めちゃくちゃ面白いね!既存のAIエージェントが短時間タスクしかできないって課題に、真正面から挑んでるのがすごい。特に、細かく分解して中間報酬を出すってアイデアは、エージェントの学習にも評価にもめっちゃ効きそう。朋義さんも、今のAIがどこまでできて、どこがボトルネックなのか、具体的な数値でわかるから、きっとワクワクすると思うよ!
Long-Horizon Tasks Terminal Benchmarks AI Agents Dense Rewards Partial Credit Long-Context Management Iterative Debugging Software Engineering Scientific Computing
1. どんなもの?
- ポイント1: 長時間・複雑なタスク向けの新しいターミナルベンチマーク「Long-Horizon-Terminal-Bench」を提案。
- 詳細: 実験再現、ソフトウェア工学、マルチモーダル分析、インタラクティブゲーム、科学計算など9カテゴリにわたる46の長期的タスクを含む。
- ポイント2: 従来のベンチマークの課題(短時間、最終結果のみ評価、スパースな報酬)を克服。
- 詳細: 各タスクは細かく分解されたサブタスクに分けられ、密な中間報酬と部分的な評価を可能にする。これにより、エージェントが最終目標に到達したかだけでなく、その過程での進捗も評価できる。
2. 先行研究と比べてどこがすごい?
- ポイント1: 従来のターミナルベンチマークが短時間で単純なタスクに焦点を当て、最終結果のみで評価していたのに対し、本ベンチマークは「長時間のタスク」に特化。
- 詳細: 数百エピソード、数分から数時間の実行時間を要するタスクで、長期的計画、長文脈管理、反復的デバッグ能力を評価する。
- ポイント2: 評価方法が「密な報酬ベースの採点」を採用。
- 詳細: タスクを細分化し、中間段階での進捗にも部分的な報酬を与えることで、エージェントの能力をより詳細かつ公平に評価できる。従来のスパースな最終結果のみの評価では見落とされていた部分を捕捉する。
3. 技術や手法の肝はどこ?
- ポイント1: タスク設計と分解。
- 詳細: 各タスクは、参照ソリューションやシミュレーションエンジンに基づいており、さらに細粒度の採点可能なサブタスクに分解されている。これにより、エージェントの行動の各ステップに対して具体的なフィードバック(報酬)を与えることが可能になる。
- ポイント2: 密な報酬システム。
- 詳細: サブタスクの達成度に応じて部分的な報酬を与えることで、エージェントが最終目標に到達しなくても、どこまで進捗したかを定量的に評価できる。これは、強化学習におけるスパースな報酬問題を緩和し、エージェントの学習を促進する可能性もある。
4. どうやって有効だと検証した?
- ポイント1: 15のフロンティアモデル(最先端モデル)を評価。
- 詳細: 平均して1タスクあたり9.9Mトークン、231エピソード、85.3分の実行時間を消費。これは従来のベンチマークよりもはるかに要求が厳しいことを示している。
- ポイント2: 評価結果から、既存モデルの限界と改善の余地を明確に示した。
- 詳細: 最強モデルでも部分報酬0.95で15.2%、完全報酬1.0で10.9%のpass@1しか達成できず、全モデルの平均はそれぞれ4.3%、1.7%と低い。これにより、長期的タスクにおけるAIエージェントの能力には大きな改善の余地があることを実証した。
- ポイント3: 失敗モードとエラーパターンの分析も実施。
- 詳細: 具体的な分析結果はアブストラクトにはないが、今後の研究に役立つ情報を提供していることを示唆。
5. 議論はある?
- ポイント1: 既存の最先端モデルでも、長期的タスクに対する能力はまだ非常に低い。
- 詳細: 最強モデルでも成功率が15%程度であり、平均は数%に過ぎない。これは、長期的計画、長文脈管理、反復的デバッグといった能力が、現在のAIエージェントにとって大きな課題であることを示している。
- ポイント2: ベンチマークの複雑さと計算コスト。
- 詳細: 1タスクあたり平均9.9Mトークン、85.3分の実行時間は、モデルの開発や評価において高い計算リソースを要求する。これは、研究の進捗を遅らせる可能性もある。
6. 次に読むべき論文は?
- ポイント1: 既存のターミナルベンチマークに関する論文。
- 詳細: 本論文が「Terminal-Bench-style setup」に言及しているため、その元となるTerminal-Benchや類似のコード生成・実行環境のベンチマーク論文を読むと、本研究の文脈がより深く理解できる。
- ポイント2: 長期計画(Long-horizon planning)や長文脈(Long-context)管理、反復的デバッグ(Iterative debugging)に焦点を当てたAIエージェントに関する論文。
- 詳細: 本ベンチマークがこれらの能力を重視しているため、これらの課題に取り組む最新の研究論文は直接関連する。
Abstract (原文)
AI agents have become capable of autonomously completing short, well-specified tasks. However, existing terminal benchmarks largely focus on simple problems that finish within minutes and are evaluated only by their final outcome. This setup overlooks intermediate progress and partial solutions, yielding sparse reward signals and an incomplete picture of agent capability. We introduce Long-Horizon-Terminal-Bench, a terminal benchmark of 46 long-horizon tasks spanning nine categories, including experiment reproduction, software engineering, multimodal analysis, interactive games, and scientific computing. Each task follows a Terminal-Bench-style setup with a reference solution or simulation engine, but is further decomposed into fine-grained graded subtasks. This design enables dense intermediate rewards and partial credit, allowing evaluation to capture not only whether an agent reaches the final goal, but also how far it progresses on open-ended workflows. Tasks in Long-Horizon-Terminal-Bench typically require hundreds of episodes and minutes to hours of execution, stressing long-horizon planning, long-context management, and iterative debugging rather than one-shot problem solving. We evaluate 15 frontier models and find that agents consume on average 9.9M tokens per task, with roughly 231 episodes and 85.3 minutes of execution time per run, making Long-Horizon-Terminal-Bench more demanding than prior terminal-based benchmarks. Even the strongest tested model achieves 15.2% pass@1 at a partial-reward threshold of 0.95 and 10.9% at a perfect-reward threshold of 1.0, while the mean pass rate across models is 4.3% and 1.7% under the two thresholds, respectively. These results reveal headroom for improvement. We further analyze failure modes and error patterns, and release Long-Horizon-Terminal-Bench to support future progress on long-horizon terminal agents.