GLM Post-Training Beyond SFT

导言

部门要突破 GLM 模型的 NPU 原生训练,真正困难的不是把一个 GRPO loss 搬到 NPU,而是让 Actor 训练、推理 Rollout、Teacher Prefill、Verifier、权重同步和低精度数值形成闭环。

本文以 GLM-5 技术报告为主线,并补充 GLM-5.2 已公开的 SAO、CompactionRL 和十多个专家的并行 OPD。重点解释非 SFT 后训练中的 RL、OPD/MOPD,同时单独澄清 QAT 与量化:GLM-5 明确把 INT4 QAT 放在 SFT 阶段,它对 NPU 后训练很重要,但不是非 SFT RL 的一个阶段。

Read more

Ascend 950 A5 Multimodal Quantization

导言

截至 2026-07-07,Ascend 950 A5 对多模态生成的公开支持已经不是零,但它更像三层拼图:vLLM-Omni 已把 Ascend NPU、Wan2.2/Qwen-Image 等 diffusion 量化路径写进文档;vLLM-Ascend 主分支出现 A5/950 与 MXFP/W8A8 等后端代码;VeRL-Omni 已能用 vLLM-Omni 做 Ascend NPU rollout,但量化默认仍是空配置,公开 recipe 还没有给出 A5 量化 RL 的性能和精度结论。本文只写可追溯来源,尤其区分“文档支持”“代码路径”“验证效果”和“仍需实测”。

Read more