效率优化◆ AI 生成 · 已溯源
ShortOPD:通过短到长的在线策略蒸馏恢复剪枝后的大型语言模型

结论前置 / TL;DR
ShortOPD 提出一种短到长的在线策略蒸馏(On-Policy Distillation, OPD)调度机制,显著提升结构化剪枝后 LLM 在自由生成任务中的恢复能力,核心在于动态识别并跳过教师模型确认的重复后缀,将训练预算聚焦于有效前缀长度。
问题根源:结构化剪枝在生成任务上的失效
结构化剪枝(Structured pruning)虽硬件友好,但其有效性长期仅在多项选择类识别任务(如 MMLU、ARC)上验证;实际部署所需的自由生成(free-form generation)任务中,同一剪枝模型常出现严重崩溃——并非完全失效,而是生成质量骤降。
关键现象与归因
- 现象一:剪枝后模型 greedy \textsc{pass}@1 几乎归零,但通过重复采样(repeated sampling)可显著恢复 \textsc{pass}@k(k > 1),说明有用生成未被擦除,仅被贪心解码‘降级’(demoted);
- 现象二:可恢复区间(recoverable regime)的主要失败模式是后缀重复(suffix repetition)——模型在生成后期陷入循环,而非早期逻辑错误。
方法设计:ShortOPD 的三重创新
- 核心机制:基于 On-Policy Distillation(OPD),复用剪枝前原始模型作为冻结教师(frozen teacher),对剪枝后模型(student)在其自身 on-policy 状态下进行 token-level 密集监督;
- 关键优化:传统长 rollout 浪费大量训练预算于低信息量的重复后缀。ShortOPD 动态检测 teacher-confirmed repetitive suffixes(由教师模型判定为冗余重复的后缀),将剩余非重复前缀视为该 rollout 的有效长度(effective length);
- 调度策略:采用 short-to-long rollout schedule,初始阶段仅训练短有效长度,随训练进展逐步延长,使梯度更新更早聚焦于高信息密度的生成前期阶段。
实验验证
论文在 Llama-2-7b 和 Qwen2-7b 上验证 ShortOPD,对比标准 OPD,在相同训练预算下,free-form generation 任务(如 GSM8K、HumanEval)的 \textsc{pass}@1 提升达 12.3–18.7 个百分点,且显著抑制重复率(repetition rate ↓34%)。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.13124