效率优化◆ AI 生成 · 已溯源

ShortOPD:通过短到长的在线策略蒸馏恢复剪枝后的大型语言模型

ShortOPD:通过短到长的在线策略蒸馏恢复剪枝后的大型语言模型
结论前置 / TL;DR

ShortOPD 提出一种短到长的在线策略蒸馏(On-Policy Distillation, OPD)调度机制,显著提升结构化剪枝后 LLM 在自由生成任务中的恢复能力,核心在于动态识别并跳过教师模型确认的重复后缀,将训练预算聚焦于有效前缀长度。

问题根源:结构化剪枝在生成任务上的失效

结构化剪枝(Structured pruning)虽硬件友好,但其有效性长期仅在多项选择类识别任务(如 MMLU、ARC)上验证;实际部署所需的自由生成(free-form generation)任务中,同一剪枝模型常出现严重崩溃——并非完全失效,而是生成质量骤降。

关键现象与归因

  • 现象一:剪枝后模型 greedy \textsc{pass}@1 几乎归零,但通过重复采样(repeated sampling)可显著恢复 \textsc{pass}@k(k > 1),说明有用生成未被擦除,仅被贪心解码‘降级’(demoted);
  • 现象二:可恢复区间(recoverable regime)的主要失败模式是后缀重复(suffix repetition)——模型在生成后期陷入循环,而非早期逻辑错误。

方法设计:ShortOPD 的三重创新

  • 核心机制:基于 On-Policy Distillation(OPD),复用剪枝前原始模型作为冻结教师(frozen teacher),对剪枝后模型(student)在其自身 on-policy 状态下进行 token-level 密集监督;
  • 关键优化:传统长 rollout 浪费大量训练预算于低信息量的重复后缀。ShortOPD 动态检测 teacher-confirmed repetitive suffixes(由教师模型判定为冗余重复的后缀),将剩余非重复前缀视为该 rollout 的有效长度(effective length)
  • 调度策略:采用 short-to-long rollout schedule,初始阶段仅训练短有效长度,随训练进展逐步延长,使梯度更新更早聚焦于高信息密度的生成前期阶段。

实验验证

论文在 Llama-2-7b 和 Qwen2-7b 上验证 ShortOPD,对比标准 OPD,在相同训练预算下,free-form generation 任务(如 GSM8K、HumanEval)的 \textsc{pass}@1 提升达 12.3–18.7 个百分点,且显著抑制重复率(repetition rate ↓34%)。

来源溯源(合规留痕)
https://arxiv.org/abs/2607.13124
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。