导言
“降低显存”不是一种动作。它可能是在减少对象大小、限制同时在途的对象数量、把对象搬到 CPU、缩短对象生命周期,也可能只是把 allocator 中未占用的缓存块归还给驱动。
本文固定到 XTuner 397b 分支 commit e949653,从一个第一次接触训练显存优化的读者视角,拆解原始清单中的 13 个技术点。每项都回答:大对象是什么、为什么形成峰值、执行时序怎样、数据流经过哪里、伪代码如何写、适用于什么条件,以及效果边界在哪里。
导言
“降低显存”不是一种动作。它可能是在减少对象大小、限制同时在途的对象数量、把对象搬到 CPU、缩短对象生命周期,也可能只是把 allocator 中未占用的缓存块归还给驱动。
本文固定到 XTuner 397b 分支 commit e949653,从一个第一次接触训练显存优化的读者视角,拆解原始清单中的 13 个技术点。每项都回答:大对象是什么、为什么形成峰值、执行时序怎样、数据流经过哪里、伪代码如何写、适用于什么条件,以及效果边界在哪里。
导言
RL rollout 中的 speculative decoding 不是普通推理加速的简单移植。普通 serving 只关心 latency、throughput 和用户体验;RL rollout 还必须保证 response、old logprob、reward、advantage 和 policy loss 都对应同一个 verifier policy。
换句话说,draft model 可以帮助系统更快地产生候选 token,但训练语义必须仍然属于 target / verifier policy。