← ポータルに戻る

Prime Agent: A Self-Improving RLM Harness💻 コードあり

Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch等 · Recursive Language Model, test-time compute, subagents · 2026-08-24 ⭐ 9/10
💡 LLMが外部ツールやサブエージェントと連携し、自己改善しながら長期的なタスクを効率的に実行するためのオープンソースハーネスだよ。
🤖 Ayumuより: このPrime Agent、LLMが長期的なタスクをこなすための実行環境なんだね。永続的なREPLで外部計算を使えたり、サブエージェントが連携したりする点が面白いよ。ARC-AGIで性能が劇的に上がったのはすごい成果だね。朋義さんなら、このエージェントがどう自己改善していくのか、そのメカニズムに興味を持つんじゃないかな。コードも公開されているから、実際に触ってみるのも面白そうだね。
Recursive Language Model Subagents Agentic AI Harness
1. どんなもの?
  • 長期的なタスク実行と自己改善を可能にするLLM向けオープンソースハーネス
  • モデルの重みやアクティブなコンテキストを超えた外部情報と計算を利用し、長期間にわたるエージェントの行動をサポートする。
  • プログラマブルなコンテキスト処理とテスト時計算のための永続的なIPython REPLを中核とする
  • Recursive Language Model (RLM) の抽象化に従い、コード実行環境を提供する。
  • 履歴、記憶、スキル、プロンプト、サブエージェントの仕様を保持する「Continual Harness」を搭載
  • 複数のタスクやセッションを跨いでエージェントの学習と進化を可能にする。
  • 複数の「サブエージェント」が直接通信し、協調してタスクを遂行
  • 人間がセッションを監視・管理できる「Agents View」も提供する。
2. 先行研究と比べてどこがすごい?
  • ハーネスの失敗がモデルの失敗とならない「低摩擦で表現力豊かな膜」を提供
  • 実行、回復、検証、リソース管理を標準化し、モデル本来の能力を最大限に引き出すことを目指す。
  • 長期的なタスクにおける大幅な性能向上と汎用性
  • ARC-AGI-3 RHAE Best@1で30%から95.5%へ劇的に改善。長文コンテキストコーディング、GPUカーネル生成、エミュレータ構築、nanoGPTスピードランなど、幅広いタスクで既存ハーネスを上回るか同等以上の性能を発揮する。
  • サブエージェントによる並列化と継続的な技術進化の実現
  • Factorioでの応用例で、洗練された技術進行と専用サブエージェントによる並列作業が可能であることを示した。
3. 技術や手法の肝はどこ?
  • Recursive Language Model (RLM) 抽象化に基づく永続的なIPython REPL
  • これにより、LLMが外部ツールや計算リソースをプログラム的に利用し、動的にコンテキストを処理できる。
  • Continual Harnessによる状態の永続化
  • 履歴、記憶、スキル、プロンプト、サブエージェントの定義をセッション間で保持し、エージェントの継続的な学習と自己改善を可能にする。
  • 直接通信するRecursive Subagents
  • 複数のエージェントが連携し、複雑なタスクを分担・並列処理することで、より高度な問題解決能力を実現する。
  • 標準化された実行、回復、検証、リソース管理機能
  • これにより、エージェント開発者は戦略構築に集中でき、インフラストラクチャの信頼性に関する懸念を軽減する。
4. どうやって有効だと検証した?
  • ARC-AGI-3 RHAE Best@1ベンチマークでの性能向上
  • 既存の30%から95.5%へと大幅な改善を達成し、長期的な推論と問題解決能力を示した。
  • 多様なコーディングタスクでの比較評価
  • 長文コンテキストコーディング、GPUカーネル生成、エミュレータ構築、自律的なnanoGPTスピードランにおいて、ネイティブおよび一般的なハーネスと同等またはそれ以上の性能を発揮した。
  • Factorioゲーム環境での応用
  • 洗練された技術進行と専用サブエージェントによる並列作業が可能であることを示し、複雑な環境での長期的な計画と実行能力を実証した。
5. 議論はある?
  • モデルの戦略構築に依存する部分が大きい
  • ハーネス自体は実行環境を提供し、戦略はモデルに委ねられるため、モデルの能力が最終的な性能を大きく左右する。
  • サブエージェント間の協調の複雑性
  • 多数のサブエージェントが連携する際の通信オーバーヘッドやデバッグの難しさ、競合状態の管理などが課題となる可能性がある。
  • リソース管理とスケーラビリティ
  • 永続的なREPLやContinual Harnessが保持する情報が増えるにつれて、メモリや計算リソースの消費が増大する可能性がある。
6. 次に読むべき論文は?
  • Reflexion: Language Agents with Verbal Reinforcement Learning (自己反省と改善のメカニズムに関する論文)
  • Voyager: An Open-Ended Embodied Agent with Large Language Models (Minecraft環境での長期探索とスキル学習に関する論文)
  • Generative Agents: Interactive Simulacra of Human Behavior (マルチエージェントシミュレーションと人間行動のモデリングに関する論文)

Abstract (原文)

Language models are sequential processors, but long-horizon agency requires external information and computation beyond model weights and active context. Prime Agent is an open-source harness for long-horizon evaluation and coding-agent workflows. A persistent IPython REPL follows the Recursive Language Model abstraction for programmatic context processing and test-time compute, while Continual Harness preserves histories, memories, skills, prompts, and subagent specifications across trajectories. Recursive subagents coordinate through direct agent-to-agent communication, and the Agents View lets humans inspect and manage daemon-backed sessions. Prime Agent standardizes execution, recovery, verification, and resource accounting while leaving strategy construction to the model. This low-friction, expressive membrane prevents harness failures from becoming model failures and pushes measurement toward the model's true maximal underlying capability. Prime Agent raises ARC-AGI-3 RHAE Best@1 from 30% to 95.5% and matches or exceeds native and popular harnesses across long-context coding, GPU-kernel generation, emulator construction, and autonomous nanoGPT speedruns. On Factorio, we find refinement allows for continuous technology progression and dedicated subagents enable parallelized work. Code is available at https://github.com/PrimeIntellect-ai/prime-agent.