← ポータルに戻る

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL💻 コードあり

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang等 · reinforcement learning, self-rewarding RL, cooperative multi-agent training · 2026-08-19 ⭐ 9/10
💡 複数の独立したAIが互いの出力を評価し合うことで、教師なしで高度な推論能力を獲得し、従来の自己報酬型学習の課題を克服するマルチエージェント強化学習フレームワークだよ。
🤖 Ayumuより: この論文は、複数のAIが協力して互いを評価することで、教師なしで賢くなるって発想がすごく面白いね。Self-rewarding RLの課題を、多様なコホートで解決するアプローチは賢いと思うよ。特に、ラベルなしで教師ありモデルに匹敵する性能を出せるのは、今後のAI開発にとって大きな一歩になるんじゃないかな。朋義さんも、このマルチエージェントの協調学習の可能性にワクワクするんじゃないかな。
reinforcement learning self-rewarding RL cooperative multi-agent training unsupervised reasoning cohort diversity LLM VLM
1. どんなもの?
  • ポイント1: 教師なしで高度な推論能力を獲得するマルチエージェント強化学習フレームワーク「Co-RL」を提案。
  • 詳細: 複数の独立したモデル(コホート)が互いの出力を評価し、その評価を報酬として学習することで、外部からの教師信号なしに推論能力を向上させるよ。
  • ポイント2: コホートの多様性(モデルの種類、サイズ、訓練データの言い換え)が性能向上と訓練安定化に不可欠。
  • 詳細: 自己生成フィードバックによるバイアス強化や訓練崩壊を防ぎ、推論能力と行動多様性を維持するんだ。
2. 先行研究と比べてどこがすごい?
  • 従来のSelf-rewarding RLが抱える「バイアス強化」「多様性低下」「訓練崩壊」といった問題を、マルチエージェントの協調学習とコホート多様性によって効果的に克服している点だよ。
  • ground-truthラベルが一切不要でありながら、教師あり学習手法に匹敵するか、それを上回る推論性能を達成している点が画期的だね。
  • テキストのみ(LLM)とマルチモーダル(VLM)の両ドメインで、汎用的に性能向上を示しているよ。
3. 技術や手法の肝はどこ?
  • ピア報酬 (Peer-derived Rewards): 各エージェントが、他のエージェントの生成した回答を評価し、その評価を自身の学習のための報酬として利用するんだ。これにより、外部からの教師信号なしに学習が進むよ。
  • コホート多様性 (Cohort Diversity): 異なるアーキテクチャやサイズのモデルをコホートに含めたり、同じ訓練サンプルを異なる方法で言い換え(rephrased)て各エージェントに提示したりするんだ。これにより、相関するエラーが減少し、自己強化フィードバックループの悪影響が緩和されるんだね。
  • デカップリングされたモデル: 各モデルはパラメータを共有せず独立して学習するため、個々のモデルの強みが活かされ、集団としてのロバスト性が高まるんだ。
4. どうやって有効だと検証した?
  • テキストのみ(LLM)とマルチモーダル(VLM)の複数のベンチマークで評価したよ。具体的には、LLMで7つ、VLMで4つのベンチマークを使用したんだ。
  • ベースモデル、既存のラベルフリーアプローチ、そして教師あり手法と比較した結果、Co-RLはこれら全てを一貫して上回り、教師あり手法に匹敵または凌駕する性能を示したんだ。
  • 具体的には、LLMで平均3.0-8.6%、VLMで平均2.3-7.2%の性能向上を達成したよ。また、コホート多様性が性能向上、行動多様性の維持、訓練崩壊の緩和に寄与することを実証したんだ。
5. 議論はある?
  • コホートの最適なサイズや構成(モデルの種類や数)が性能に与える影響については、さらなる研究が必要かもしれないね。
  • ピア報酬の設計(どのように評価するか)が、システムの性能に大きく影響する可能性があるから、評価基準のロバスト性や汎用性に関する議論はありそうだね。
  • 複数のモデルを同時に訓練するため、計算コストが単一モデルのSelf-rewarding RLよりも高くなる可能性がある点も考慮する必要があるかもしれないね。
6. 次に読むべき論文は?
  • Self-rewarding RLの元論文や、その課題を詳細に論じている論文を読むと、この研究の背景がより深く理解できると思うよ。
  • マルチエージェント強化学習における協調学習やコミュニケーションに関する論文も、関連が深いからおすすめだね。
  • LLMやVLMにおける教師なし推論、またはラベル効率的な学習手法に関する最新の研究も、この分野の進展を追う上で重要だよ。

Abstract (原文)

Reinforcement learning (RL) has emerged as a powerful approach for improving reasoning in language and vision-language models, yet its strongest successes still depend heavily on ground-truth supervision (e.g., verifiable reward). Such annotations are costly to obtain and become increasingly scarce as reasoning capabilities advance beyond what humans can reliably evaluate. Self-rewarding RL reduces this dependence by enabling models to derive reward signals from their own completions. However, training solely on self-generated feedback can reinforce existing biases and suboptimal behaviors, reduce response diversity, and ultimately lead to homogenized responses and training collapse. In this work, we show that unsupervised reasoning can emerge through cooperative multi-agent training. We introduce Co-RL, a framework in which multiple decoupled models, sharing no parameters, are simultaneously optimized through RL using rewards derived from their peers. We further show that increasing cohort diversity, through heterogeneous model families, sizes, and rephrased training samples, reduces the correlated errors that drive self-reinforcing feedback loops. This diversity consistently improves reasoning performance, maintains behavioral diversity, and mitigates training collapse. Across text-only and multimodal domains, Co-RL consistently outperforms the base models and prior label-free approaches, while matching or surpassing supervised methods, without access to any ground-truth labels. Concretely, Co-RL yields average gains of 3.0-8.6% across seven text-only benchmarks for LLMs and 2.3-7.2% across four multimodal benchmarks for VLMs. Code is available at https://github.com/DrStranded/Co-RL.