← ポータルに戻る
ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning💻 コードあり
Ziyan Liu, Xueda Shen, Yuzhe Gu, Songyang Gao, Kuikun Liu等 ·
Large Reasoning Models, Reinforcement Learning with Verifiable Rewards, Chain-of-Thoughts · 2026-06-02
⭐ 8/10
💡 大規模推論モデルの「考えすぎ」問題を、内省的な選好学習で冗長な推論ステップを排除し、効率的かつ簡潔な推論チェーンを生成することで解決する。
🤖 Ayumuより: LRMの「考えすぎ」問題って、まさにLLM使ってて感じるやつだよね!内省的に冗長な部分を見つけて「折りたたむ」って発想が面白いし、トークン半分以下で精度維持はすごいインパクト。これって推論コスト削減に直結するから、実用面でも超重要じゃない?朋義さん、こういう効率化技術って、今後のLLM活用で必須になりそう!
Large Reasoning Models Chain-of-Thoughts Reinforcement Learning Preference Learning Reasoning Efficiency Token Reduction
1. どんなもの?
- ポイント1: 大規模推論モデル(LRM)の「考えすぎ」問題、すなわち冗長な推論ステップを削減するための新しいフレームワーク「ThoughtFold」を提案。
- 詳細: 従来の強化学習とChain-of-Thoughts (CoT) を組み合わせた手法では、正解に至るCoT全体を記憶するため、その中に含まれる試行錯誤や冗長な探索まで強化されてしまい、モデルが非効率になる問題があった。
- ポイント2: 内省的な選好学習(introspective preference learning)を用いて、正解CoTの中から冗長な部分を特定し、より簡潔で効率的な推論パスを学習させる。
2. 先行研究と比べてどこがすごい?
- 先行研究の課題: 従来のCoT効率化手法は、短いCoTを優遇するものの、学習信号が最終結果ベースであるため、長いCoT内の冗長な探索の記憶を根本的に減らすことができなかった。
- ThoughtFoldの優位性: きめ細かい選好学習と内省的戦略を導入。
- 正解CoTの内部で冗長なステップを直接特定し、ペナルティを課すことで、モデルが本質的な推論セグメント間を直接繋ぐように学習を促す。
- 結果として、トークン使用量を大幅に削減(約56%)しながら、最先端の精度を維持することに成功した。
3. 技術や手法の肝はどこ?
- ポイント1: 内省的戦略(Introspective Strategy)
- 詳細: 各正解CoTの中から冗長な部分を自動的に識別し、そこから複数の候補となる簡潔なサブCoT(推論パス)のスペクトラムを生成する。
- ポイント2: マスクされた選好最適化目的(Masked Preference Optimization Objective)
- 詳細: 生成されたサブCoTのスペクトラムを活用し、冗長な探索に対して明示的にペナルティを課す。これにより、モデルは不要なステップをスキップし、本質的な推論ステップ間を直接「橋渡し」するように学習し、推論チェーンをより簡潔なパスへと「折りたたむ」。
4. どうやって有効だと検証した?
- 検証モデル: DeepSeek-R1-Distill-Qwen-7Bという大規模言語モデルを使用。
- 評価指標と結果:
- 効率性: 推論時のトークン使用量を約56%削減することに成功。
- 精度: トークン使用量を大幅に削減しながらも、最先端(state-of-the-art)の精度を維持できることを示した。
- 実験規模: 「Extensive experiments(広範な実験)」と記載されており、複数のタスクやデータセットでその有効性を確認したと推測される。
5. 議論はある?
- アブストラクトからは直接的な議論点や限界は読み取れないが、一般的に以下の点が考えられる。
- 「冗長性」の定義と、内省的戦略がどれだけ汎用的に、かつロバストに冗長性を特定できるか。特に、より複雑で多段階な推論タスクにおける適用性。
- 特定のモデル(DeepSeek-R1-Distill-Qwen-7B)での結果であり、他の大規模言語モデルへの汎化性や、異なるアーキテクチャでの効果の検証が必要となる可能性がある。
- 精度を維持しつつ効率化しているが、特定の難しいケースで推論の「深さ」が失われる可能性はないか、といったトレードオフに関する詳細な分析が本論文でなされているか注目される。
6. 次に読むべき論文は?
- Chain-of-Thought (CoT) の初期論文や、その効率化・最適化に関する研究。
- 強化学習と大規模言語モデルの組み合わせ(RLHF, RLAIFなど)に関する論文。
- モデルの自己修正(Self-Correction)や自己改善(Self-Refinement)に関する論文。
- Preference Learning(選好学習)をLLMに適用した他の研究。
Abstract (原文)
Large Reasoning Models (LRMs) have achieved remarkable progress thanks to Reinforcement Learning with Verifiable Rewards (RLVR) on Chain-of-Thoughts (CoTs). However, since long CoTs naturally contain trial and errors and mainstream RLVR approaches choose outcome-correct CoT trajectories for memorization, the redundant explorations in long CoTs are inevitably reinforced, which results in the over-thinking issues of LRMs. Previous attempts to resolve this issue mainly give more advantage to shorter trajectories, yet their learning signals are still outcome-based and cannot reduce the memorization of redundant explorations in long CoTs. Therefore, we propose ThoughtFold, a framework that leverages fine-grained preference learning to mitigate redundant explorations for efficient reasoning. ThoughtFold employs an introspective strategy to identify redundancy within each correct trajectory, which yields a spectrum of candidate sub-trajectories. Leveraging this spectrum, we introduce a masked preference optimization objective that explicitly penalizes redundant explorations and encourages the model to directly bridge essential reasoning segments, effectively folding its reasoning chains into a more concise path. Extensive experiments show that ThoughtFold significantly enhances efficiency. It reduces the token usage of DeepSeek-R1-Distill-Qwen-7B by approximately 56% while maintaining state-of-the-art accuracy.