← ポータルに戻る
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget💻 コードあり
Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao等 ·
AI · 2026-07-16
⭐ 8/10
💡 固定GPU予算の下で数百万トークンを超える長文コンテキストでの強化学習を可能にする、メモリ効率の高い実行スタック「LongStraw」を提案。
🤖 Ayumuより: この論文、めちゃくちゃ面白いね!LLMのコンテキスト長が伸びる中、RLの学習が追いついてないって問題意識がすごく共感できる。特にAIエージェントの長期記憶とか、まさにこれが必要になる部分だよね。メモリ効率化の工夫がアーキテクチャレベルで考えられてるのが技術的にアツい。朋義さん、大規模RLの未来を拓く一歩って感じで、きっと興味持つと思うよ!
Long-Context RL GPU Budget Architecture-aware execution Memory efficiency AI Agents Qwen GLM Group Relative Policy Optimization (GRPO)
1. どんなもの?
- 長いコンテキスト(数百万トークン)での強化学習(RL)の学習(post-training)を、固定GPU予算内で可能にするための実行スタック「LongStraw」。
- AIエージェントが扱う観測、ツール出力、ドキュメント、過去の決定といった長い履歴を効率的に処理し、推論と学習のコンテキスト長ギャップを埋めることを目指す。
- Group Relative Policy Optimization (GRPO)というRLアルゴリズムと組み合わせて具体化されている。
2. 先行研究と比べてどこがすごい?
- 既存のRL学習が256Kトークン以下に留まる中、数百万トークン(2.1M〜4.46M)という非常に長いコンテキスト長でのRL学習を、現実的なGPU予算(固定GPU予算)で実現した点。
- 推論システムが数百万トークンに近づいているのに対し、RL学習が追いついていないというギャップを埋める。
- アーキテクチャ認識型のアプローチにより、メモリ効率と計算効率を大幅に向上させている。
3. 技術や手法の肝はどこ?
- **メモリ効率化のための3つの主要戦略**:
- **共有プロンプトのAutogradなし評価**: 長い共有プロンプト部分のフォワードパスを勾配計算なしで実行し、メモリ消費を削減。
- **モデル固有の状態のみ保持**: 後続のトークンに必要なモデル固有の状態(例: KVキャッシュ)のみを保持し、不要な中間状態を破棄。
- **短い応答ブランチのリプレイ**: 複数の応答ブランチを一度に処理するのではなく、短い応答ブランチを1つずつリプレイすることで、ライブトレーニンググラフのサイズを縮小し、ピークメモリを削減。
- これらの戦略により、追加のリプレイ時間を犠牲にする代わりに、GPUメモリの制約を緩和している。
4. どうやって有効だと検証した?
- **Qwen3.6-27B (ハイブリッドリカレント/フルアテンションモデル) での検証**:
- 8基のH20 GPUを使用し、グループサイズ2および8で2.1Mポジションのグループ化されたQwenスコアリングと応答の逆伝播を完了。
- グループサイズを増やしてもピークメモリ増加はわずか0.21GB。個別のストレステストでは4.46Mポジションに到達し、LongStrawの実行能力を示した。
- **GLM-5.2 (圧縮アテンションMoEモデル) での検証**:
- 32基のH20 GPUを使用し、GLM-5.2の全78層で2.1Mトークンのプロンプトに対するエンドツーエンドのLongStraw実行パスを検証。
- これらの実験は、数百万トークン規模での「実行能力」を確立したことを示している。
5. 議論はある?
- **完全な学習の正しさの未確立**: 現在の検証は「実行能力」を示すものであり、キャプチャされたプロンプトの状態がデタッチされているため、「完全な学習の正しさ」はまだ確立されていない。
- **分散学習パスの未完成**: 一部の分散フォワードおよび勾配合成パスがまだ未完了であるため、今後の研究でこれらを完成させる必要がある。
- **リプレイ時間の増加**: メモリ効率化のために短い応答ブランチをリプレイする戦略は、追加のリプレイ時間を要するため、全体的な学習速度とのトレードオフが存在する。
6. 次に読むべき論文は?
- **Group Relative Policy Optimization (GRPO)に関する論文**: LongStrawがGRPOと組み合わせて具体化されているため、GRPO自体の詳細を理解するために読むべき。
- **Qwen3.6-27BやGLM-5.2など、使用されている大規模言語モデルのアーキテクチャに関する論文**: LongStrawが特定のモデルアーキテクチャ(ハイブリッドリカレント、フルアテンション、圧縮アテンションMoE)を考慮しているため、これらのモデルの理解が深まる。
- **Long-context LLM inference/trainingに関する最新の研究**: 推論と学習のコンテキスト長ギャップを埋めるための他のアプローチや、メモリ効率化技術(例: FlashAttention, Ring Attentionなど)に関する論文。
Abstract (原文)
A growing gap separates inference context lengths from RL post-training: inference systems are approaching million-token contexts, while post-training workloads often remain at 256K tokens or below and rely on length generalization at deployment. The gap is especially important for AI agents, whose observations, tool outputs, documents, and prior decisions accumulate over long trajectories. LongStraw is an architecture-aware execution stack for million-token RL post-training under a fixed GPU budget, instantiated with Group Relative Policy Optimization (GRPO). It evaluates the shared prompt without autograd, retains only model-specific state needed by later tokens, and replays short response branches one at a time, reducing the live training graph at the cost of additional replay time. We implement it for the hybrid recurrent and full-attention Qwen3.6-27B and the compressed-attention mixture-of-experts GLM-5.2. On eight H20 GPUs, LongStraw completes grouped Qwen scoring and response backward at 2.1M positions for groups of 2 and 8; increasing the group size adds only 0.21 GB of peak allocated memory, while a separate stress test reaches 4.46M positions. On 32 H20 GPUs, we validate the end-to-end LongStraw execution path for a 2.1M-token prompt across all 78 layers of GLM-5.2. These experiments establish execution capacity rather than complete training correctness because the captured prompt state is detached and some distributed forward and gradient composition paths remain incomplete.