GLM Post-Training Beyond SFT

导言

部门要突破 GLM 模型的 NPU 原生训练,真正困难的不是把一个 GRPO loss 搬到 NPU,而是让 Actor 训练、推理 Rollout、Teacher Prefill、Verifier、权重同步和低精度数值形成闭环。

本文以 GLM-5 技术报告为主线,并补充 GLM-5.2 已公开的 SAO、CompactionRL 和十多个专家的并行 OPD。重点解释非 SFT 后训练中的 RL、OPD/MOPD,同时单独澄清 QAT 与量化:GLM-5 明确把 INT4 QAT 放在 SFT 阶段,它对 NPU 后训练很重要,但不是非 SFT RL 的一个阶段。

Read more

On-Policy Distillation

导言

On-Policy Distillation(OPD)不是 top-k,也不等于 RL。它先让学生模型生成自己的轨迹,再让教师在学生实际到达的前缀上提供 token 分布,以减少训练与部署时的状态分布偏移。

OPD 能否生效,关键不是教师参数量是否更大,而是师生是否共享可比较的动作空间、思维模式是否兼容,以及教师是否真的提供了学生尚未掌握的知识。本文同时梳理 DeepSeek V4、Qwen3/Qwen3.5、Qwen3.5-Omni 的公开流程,以及 verl/verl-omni 的现有能力与缺口。

Read more