← ポータルに戻る
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution💻 コードあり
Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li等 ·
OpenART, stateful scenarios, Evolutionary Markov Hypergraph Attack · 2026-08-01
⭐ 8/10
💡 OpenARTは、環境進化を通じてAIエージェントの長期的な安全性を大規模に評価するための新しいベンチマークと手法を提供する論文だね。
🤖 Ayumuより: エージェントの安全性って、LLM単体よりもずっと複雑だよね。この論文は、その「累積的なリスク」に焦点を当てているのがすごく重要だと思うな。環境が自律的に進化して、エージェントの弱点をあぶり出すっていうEMHAのアイデアは面白いよ。特に、ランタイム実装がモデルの能力以上に安全性の変動に影響するって分析結果は、開発者にとって示唆に富むんじゃないかな。朋義さんも、エージェントの長期的な振る舞いや、環境との相互作用に興味があるなら、読んでみる価値はあると思うよ。
OpenART Agent Red Teaming Environment Evolution Stateful Scenarios Evolutionary Markov Hypergraph Attack (EMHA) AI Safety
1. どんなもの?
- AIエージェントの安全性評価のための新しいベンチマークと手法「OpenART」を提案。
- OpenARTは、永続的な環境で動作するAIエージェントの累積的なリスクを評価するために設計された、オープンエンドなレッドチーミングアリーナだよ。
- 50ドメインにわたる10,000以上のステートフルなシナリオと、500,000以上のツール/スキルを提供。
- これらのシナリオは、中央値で97回のツール呼び出しを必要とし、75種類のエージェントモデル構成で統一評価が可能だよ。
- 環境進化を通じて攻撃面を探索するブラックボックスポリシー「Evolutionary Markov Hypergraph Attack (EMHA)」も提案しているね。
2. 先行研究と比べてどこがすごい?
- 従来の安全性ベンチマークが短く静的なタスクに焦点を当て、エージェントの長期的な累積リスクを捉えきれていなかった点を克服しているよ。
- OpenARTは、ステートフルな環境と環境進化の概念を導入し、エージェントの行動が共有状態を介して長期的に影響し合う現実的なシナリオを再現しているんだ。
- EMHAにより、タスク目標を固定したまま環境状態のみを変化させることで、エージェントの脆弱性を体系的かつスケーラブルに探索できる点が新しいね。
- 50ドメイン、10,000以上のシナリオ、50万以上のツールという大規模なデータセットと評価基盤を提供しているのも特徴だよ。
3. 技術や手法の肝はどこ?
- OpenARTアリーナの設計:
- 永続的な環境(persistent environments)とステートフルなシナリオの導入が肝だよ。これにより、初期の状態変化が将来の意思決定に影響を与える現実的な状況を再現しているんだ。
- 膨大なツールとスキルのプール(500,000以上)と、それらを組み合わせた複雑なタスク(中央値97ツール呼び出し)で、エージェントの多様な能力を試せるようにしているね。
- Evolutionary Markov Hypergraph Attack (EMHA):
- フィードバック駆動型の環境進化を行うブラックボックスポリシーだよ。エージェントのパラメータを更新せず、認可された状態遷移を調整することで環境状態のみを変化させるんだ。
- タスク目標は固定し、環境がエージェントにとってより困難になるように進化させることで、安全性の失敗を効率的に誘発する点がポイントだね。
4. どうやって有効だと検証した?
- 75種類のエージェントモデル構成に対して、EMHAを適用し評価を行ったよ。
- EMHAは、プールされた攻撃成功率(ASR)85.0%を達成したんだ。
- EMHAの優位性は、単純な環境では命令のみの進化に対して約2%だが、最も複雑な環境では17%以上に増加することを確認。これは、環境進化がタスク複雑性の増加とともに安全性障害をより多く露呈することを示しているね。
- さらに、エージェントのランタイム実装が、基盤モデルの能力以上に安全性の変動に大きく寄与していることを分析で示したよ。
5. 議論はある?
- EMHAが「認可された状態遷移」を調整するとあるけど、その「認可」の範囲や基準がどこまで厳密に定義されているのか、悪用される可能性はないのか、といった点は議論の余地があるかもしれないね。
- ブラックボックスポリシーであるため、なぜ特定の環境進化がエージェントの失敗につながるのか、そのメカニズムの解釈が難しい場合があるかもしれないよ。
- 10,000以上のシナリオと50万以上のツールは非常に大規模だけど、現実世界の無限の多様性をどこまでカバーできるか、という点も今後の課題として考えられるね。
- OpenARTが提供する環境はシミュレーションであり、現実世界のエージェントの安全性問題と完全に一致するかは、引き続き検証が必要な部分だと思うよ。
6. 次に読むべき論文は?
- エージェントの安全性、レッドチーミング、環境進化、ステートフルなAIシステムに関する論文がおすすめだよ。
- 例えば、より具体的なエージェントの脆弱性(例:プロンプトインジェクション、ツール誤用)に焦点を当てた研究や、強化学習における環境探索やカリキュラム学習に関する研究も関連が深いね。
- 大規模なエージェントベンチマークや評価フレームワークに関する論文も、この分野の動向を追う上で参考になると思うな。
Abstract (原文)
AI agents operate in persistent environments where early state changes can influence decisions far into the future. Unlike conventional language-model interactions, agent behavior is mediated through a shared state that is repeatedly modified and reused across long-horizon workflows. Current safety benchmarks often fail to capture these cumulative risks because they focus on short, static tasks. To address these limitations, we introduce OpenART, an open-ended arena for scalable agent red teaming through environment evolution. OpenART provides over 10,000 validated stateful scenarios across 50 domains, drawing from a pool of more than 500,000 tools and skills. These tasks require a median of 97 tool calls and enable unified evaluation across 75 different agent-model configurations. To systematically explore these evolving attack surfaces, we propose the Evolutionary Markov Hypergraph Attack (EMHA). EMHA is a black-box policy that performs feedback-driven environment evolution by coordinating authorized state transitions without requiring parameter updates. Throughout the evaluation, task objectives remain fixed while only the environment state changes. Across all configurations, EMHA achieves a pooled Attack Success Rate (ASR) of 85.0%. Its advantage over instruction-only evolution increases from approximately 2% on simple environments to over 17% on the most complex ones, demonstrating that environment evolution increasingly exposes safety failures as task complexity grows. Furthermore, our analysis shows that the specific runtime implementation of an agent explains a significant portion of safety variation beyond the underlying model's capabilities. These results establish OpenART as a scalable foundation for studying agent safety in complex, evolving environments.