强化学习◆ AI 生成 · 已溯源

Ring-Zero:将零监督强化学习(Zero RL)扩展至万亿参数规模,激发涌现式推理能力

Ring-Zero:将零监督强化学习(Zero RL)扩展至万亿参数规模,激发涌现式推理能力
结论前置 / TL;DR

Ring-Zero 首次将 Zero RL 成功扩展至 1T 参数规模,验证了‘苦涩教训’——单纯扩大模型规模可显著提升样本效率与性能上限,并揭示训练过程存在‘发现→精炼’两阶段动态演化。

Ring-Zero:首个实现万亿参数 Zero RL 的稳定训练框架

Ring-Zero(arXiv:2607.12395v1)是首个系统性突破计算瓶颈、将 Zero RL(即无需人类标注数据、仅依赖可验证奖励信号的强化学习)扩展至 1T 参数模型的开源研究。其核心目标是激发大模型的涌现式链式推理(chain-of-thought)能力,而非依赖监督微调或人工反馈。

关键挑战与技术突破

现有 Zero RL 方法受限于小模型(通常 <10B),难以观测大规模下的训练动力学与能力涌现现象。Ring-Zero 发现,直接放大模型规模会导致输出可读性下降、token 冗余严重、推理深度缺乏自适应性。为此,作者提出一套稳定高效的训练管线,包含三项关键优化:

  • Clipped importance sampling:抑制策略更新方差,保障训练稳定性;
  • Training-inference ratio correction:动态校准训练步长与推理长度的比例关系,缓解长程推理失配;
  • Mixed-precision control:在 FP16/BF16/FP8 混合精度下精细化控制梯度传播与激活存储,降低显存峰值并维持数值精度。

三大实证发现:验证‘苦涩教训’

实验基于 Llama 架构变体,在无任何人类标注数据、仅使用形式化可验证奖励(如数学证明正确性、代码执行通过率)条件下完成训练,得出以下结论:

  • (1)规模即能力:从 10B 到 1T 参数,样本效率提升 4.2×,MATH-500 推理准确率从 41.3% 跃升至 68.7%,性能上限显著抬升;
  • (2)两阶段训练动态:训练过程清晰分为初期‘发现阶段’(exploration-heavy,生成多样化推理路径)与后期‘精炼阶段’(sharpening-heavy,收敛至简洁、高置信度推导);
  • (3)涌现式推理深度跃迁:1T 模型在 GSM8K 上平均推理步数达 23.6 步(±2.1),且 >85% 的成功案例具备跨子问题因果回溯能力,该现象在 <100B 模型中未观测到。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12395
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。