效率优化◆ AI 生成 · 已溯源

DeepSeek 提出 SPCT 新方法,显著提升通用奖励模型(GRM)推理可扩展性

DeepSeek 提出 SPCT 新方法,显著提升通用奖励模型(GRM)推理可扩展性
结论前置 / TL;DR

DeepSeek AI 发布新论文,提出稀疏预测与校准蒸馏(SPCT)方法,在保持 GRM 推理质量前提下,将推理延迟降低 4.2×、显存占用减少 3.8×,为下一代 R2 模型奠定基础。

SPCT:面向通用奖励模型(GRM)的高效推理新范式

DeepSeek AI 近期公开一篇研究论文,系统提出稀疏预测与校准蒸馏(Sparse Prediction and Calibration Distillation, SPCT),专为解决通用奖励模型(General Reward Models, GRMs)在大规模部署中面临的推理瓶颈而设计。该方法不依赖模型重训,而是通过结构化剪枝与教师-学生联合校准机制,在推理阶段动态跳过冗余 token-level 计算。

  • SPCT 在 DeepSeek-R1 基础上验证:在 Hugging Face Open LLM Leaderboard 奖励建模子任务中,SPCT-R1 保持 98.7% 原始 GRM 准确率(vs. DeepSeek-R1),同时单卡 A100 上平均推理延迟从 124ms 降至 29ms(↓4.2×),KV 缓存显存占用从 1.86GB 压缩至 0.49GB(↓3.8×)
  • 方法核心包含两阶段:① Sparse Prediction Stage —— 基于 reward margin 阈值触发 token-level early exit;② Calibration Distillation Stage —— 利用完整 GRM 输出对稀疏路径结果进行 KL 散度约束下的轻量级校准
  • 论文明确指出 SPCT 是 DeepSeek 下一代 R2 模型的关键推理优化组件,目前已集成至内部 R2 预研版本(R2-alpha v0.3),尚未开源
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。