导言
Codex 的 Fast 模式究竟快多少?Sol 与 Luna 谁输出更快?我在同一台 Mac、同一账号和同一时间窗口内,串行运行了 36 次真实请求:24 次约 10K 用户输入差分,12 次至少 10K 文本 token 的流式输出。结果很明确:Fast 将持续输出吞吐提高到约 1.50–1.53 倍,Sol 的流式速度只比 Luna 高 3.4%–5.6%;但输入处理速度被连接重试与缓存噪声淹没,本轮无法识别。
导言
Codex 的 Fast 模式究竟快多少?Sol 与 Luna 谁输出更快?我在同一台 Mac、同一账号和同一时间窗口内,串行运行了 36 次真实请求:24 次约 10K 用户输入差分,12 次至少 10K 文本 token 的流式输出。结果很明确:Fast 将持续输出吞吐提高到约 1.50–1.53 倍,Sol 的流式速度只比 Luna 高 3.4%–5.6%;但输入处理速度被连接重试与缓存噪声淹没,本轮无法识别。
导言
这篇文章记录 AI infra、post-training 和 multimodal serving 方向的每日 PR / issue 雷达。每轮只深入少量 P0/P1 项:优先性能、多模态、调度、attention、padding、KV cache、MTP、NPU / Ascend 相关变化。
导言
MFU / SMA 低不一定说明 kernel 慢,也可能是 rollout、reward、checkpoint、通信、异步队列或 token 分布造成的等待。性能优化的第一步不是开特性,而是建立 E2E 性能模型。