从参数空间几何角度分析 On-Policy Distillation(OPD)的训练动态,揭示 OPD 既不同于 SFT 也不同于 RLVR 的独特更新特征,2026年6月。
研究问题
On-Policy Distillation(OPD)在提升 LLM 推理能力方面越来越流行(典型做法:用教师模型生成 rollout,用学生模型在线学习),但其训练动态一直不清楚。
本文用参数空间几何诊断工具,系统比较 OPD / SFT / RLVR 三种训练范式的更新轨迹。
核心发现
1. OPD 处于”宽松偏离主轴”区域(Relaxed Off-Principal Regime)
- vs SFT:OPD 更新影响的权重更少,更强地避开主要方向(principal directions)
- vs RLVR:OPD 的更新约束更松,不像 RLVR 那么紧
2. Subspace Locking(子空间锁定)
OPD 的累积更新快速进入一个窄的低维通道:
- 把训练限制在早期形成的更新子空间内 → OPD 性能基本不降
- 同样限制 SFT → SFT 性能大幅下降
说明:OPD 锁定的子空间对它本身是功能充分的,而 SFT 需要更大的参数空间。
3. 控制实验结论
| 操作 | 对 Rank 动态的影响 |
|---|---|
| 稀疏化更新 token | 保持不变 |
| 将 rollout 生成改为 off-policy | 保持不变 |
| OPD 目标混入 RLVR | 改变 rank 动态 |
4. 总结
OPD 不是 SFT 和 RLVR 之间的中间点,而是在参数空间中诱导出自己独特的更新几何。
意义
- 为理解知识蒸馏 vs 强化学习在参数层面的差异提供实证基础
- 子空间锁定现象暗示:OPD 训练可能可以大幅压缩参数预算,仍保持效果
- 对 Agent 训练(尤其是用强模型蒸馏弱模型做推理)有指导意义
与相关工作的关系
- OPD 常见于 2604.14228_dive-into-claude-code 所述的 Claude 训练管道中的 Constitutional AI / RLHF 阶段
- 与 agent-continual-learning 中讨论的 Model-level 持续学习机制相关
作者
Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung
资源
- 论文:https://arxiv.org/abs/2606.07082
- 代码:暂未开源