从参数空间几何角度分析 On-Policy Distillation(OPD)的训练动态,揭示 OPD 既不同于 SFT 也不同于 RLVR 的独特更新特征,2026年6月。

研究问题

On-Policy Distillation(OPD)在提升 LLM 推理能力方面越来越流行(典型做法:用教师模型生成 rollout,用学生模型在线学习),但其训练动态一直不清楚。

本文用参数空间几何诊断工具,系统比较 OPD / SFT / RLVR 三种训练范式的更新轨迹。

核心发现

1. OPD 处于”宽松偏离主轴”区域(Relaxed Off-Principal Regime)

  • vs SFT:OPD 更新影响的权重更少,更强地避开主要方向(principal directions)
  • vs RLVR:OPD 的更新约束更松,不像 RLVR 那么紧

2. Subspace Locking(子空间锁定)

OPD 的累积更新快速进入一个窄的低维通道:

  • 把训练限制在早期形成的更新子空间内 → OPD 性能基本不降
  • 同样限制 SFT → SFT 性能大幅下降

说明:OPD 锁定的子空间对它本身是功能充分的,而 SFT 需要更大的参数空间。

3. 控制实验结论

操作对 Rank 动态的影响
稀疏化更新 token保持不变
将 rollout 生成改为 off-policy保持不变
OPD 目标混入 RLVR改变 rank 动态

4. 总结

OPD 不是 SFT 和 RLVR 之间的中间点,而是在参数空间中诱导出自己独特的更新几何。

意义

  • 为理解知识蒸馏 vs 强化学习在参数层面的差异提供实证基础
  • 子空间锁定现象暗示:OPD 训练可能可以大幅压缩参数预算,仍保持效果
  • 对 Agent 训练(尤其是用强模型蒸馏弱模型做推理)有指导意义

与相关工作的关系

作者

Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung

资源