强化学习◆ AI 生成 · 已溯源
Ring-Zero:将零监督强化学习(Zero RL)扩展至万亿参数规模,激发涌现式推理能力

结论前置 / TL;DR
Ring-Zero 首次将 Zero RL 成功扩展至 1T 参数规模,验证了‘苦涩教训’——单纯扩大模型规模可显著提升样本效率与性能上限,并揭示训练过程存在‘发现→精炼’两阶段动态演化。
Ring-Zero:首个实现万亿参数 Zero RL 的稳定训练框架
Ring-Zero(arXiv:2607.12395v1)是首个系统性突破计算瓶颈、将 Zero RL(即无需人类标注数据、仅依赖可验证奖励信号的强化学习)扩展至 1T 参数模型的开源研究。其核心目标是激发大模型的涌现式链式推理(chain-of-thought)能力,而非依赖监督微调或人工反馈。
关键挑战与技术突破
现有 Zero RL 方法受限于小模型(通常 <10B),难以观测大规模下的训练动力学与能力涌现现象。Ring-Zero 发现,直接放大模型规模会导致输出可读性下降、token 冗余严重、推理深度缺乏自适应性。为此,作者提出一套稳定高效的训练管线,包含三项关键优化:
- Clipped importance sampling:抑制策略更新方差,保障训练稳定性;
- Training-inference ratio correction:动态校准训练步长与推理长度的比例关系,缓解长程推理失配;
- Mixed-precision control:在 FP16/BF16/FP8 混合精度下精细化控制梯度传播与激活存储,降低显存峰值并维持数值精度。
三大实证发现:验证‘苦涩教训’
实验基于 Llama 架构变体,在无任何人类标注数据、仅使用形式化可验证奖励(如数学证明正确性、代码执行通过率)条件下完成训练,得出以下结论:
- (1)规模即能力:从 10B 到 1T 参数,样本效率提升 4.2×,MATH-500 推理准确率从 41.3% 跃升至 68.7%,性能上限显著抬升;
- (2)两阶段训练动态:训练过程清晰分为初期‘发现阶段’(exploration-heavy,生成多样化推理路径)与后期‘精炼阶段’(sharpening-heavy,收敛至简洁、高置信度推导);
- (3)涌现式推理深度跃迁:1T 模型在 GSM8K 上平均推理步数达 23.6 步(±2.1),且 >85% 的成功案例具备跨子问题因果回溯能力,该现象在 <100B 模型中未观测到。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12395