Ascend 950 A5 Multimodal Quantization

导言

截至 2026-07-07,Ascend 950 A5 对多模态生成的公开支持已经不是零,但它更像三层拼图:vLLM-Omni 已把 Ascend NPU、Wan2.2/Qwen-Image 等 diffusion 量化路径写进文档;vLLM-Ascend 主分支出现 A5/950 与 MXFP/W8A8 等后端代码;VeRL-Omni 已能用 vLLM-Omni 做 Ascend NPU rollout,但量化默认仍是空配置,公开 recipe 还没有给出 A5 量化 RL 的性能和精度结论。本文只写可追溯来源,尤其区分“文档支持”“代码路径”“验证效果”和“仍需实测”。

Read more

Multimodal Generation Evaluation

导言

多模态生成 RL 的评测不能沿用 VLM 问答评测的一套逻辑。理解任务可以用正确答案、选项或短文本验证;生成任务还要评价 视觉质量、语义一致、运动时序、编辑边界、音频质量、音画同步和人类偏好

因此,评测方案要先回答一个问题:训练时 reward 优化的是哪一种生成能力,最终 benchmark 是否真的测了同一种能力。本文把 AISBench、VBench、VEFX-Bench、Flow-Factory 和 VeRL-Omni 放在一起,整理一个后续实验可执行的评测地图。

Read more