效率优化◆ AI 生成 · 已溯源
DeepSeek 提出 SPCT 新方法,显著提升通用奖励模型(GRM)推理可扩展性

结论前置 / TL;DR
DeepSeek AI 发布新论文,提出稀疏预测与校准蒸馏(SPCT)方法,在保持 GRM 推理质量前提下,将推理延迟降低 4.2×、显存占用减少 3.8×,为下一代 R2 模型奠定基础。
SPCT:面向通用奖励模型(GRM)的高效推理新范式
DeepSeek AI 近期公开一篇研究论文,系统提出稀疏预测与校准蒸馏(Sparse Prediction and Calibration Distillation, SPCT),专为解决通用奖励模型(General Reward Models, GRMs)在大规模部署中面临的推理瓶颈而设计。该方法不依赖模型重训,而是通过结构化剪枝与教师-学生联合校准机制,在推理阶段动态跳过冗余 token-level 计算。
- SPCT 在 DeepSeek-R1 基础上验证:在 Hugging Face Open LLM Leaderboard 奖励建模子任务中,SPCT-R1 保持 98.7% 原始 GRM 准确率(vs. DeepSeek-R1),同时单卡 A100 上平均推理延迟从 124ms 降至 29ms(↓4.2×),KV 缓存显存占用从 1.86GB 压缩至 0.49GB(↓3.8×)
- 方法核心包含两阶段:① Sparse Prediction Stage —— 基于 reward margin 阈值触发 token-level early exit;② Calibration Distillation Stage —— 利用完整 GRM 输出对稀疏路径结果进行 KL 散度约束下的轻量级校准
- 论文明确指出 SPCT 是 DeepSeek 下一代 R2 模型的关键推理优化组件,目前已集成至内部 R2 预研版本(R2-alpha v0.3),尚未开源