导言
Kimi K3 是一个面向长时程智能体任务的原生多模态混合专家模型:总参数量 2.78T,每个词元激活 104.2B 参数,训练上下文最长 100 万词元。它把 Kimi Delta Attention(KDA)、Block Attention Residuals(AttnRes)和 Stable LatentMoE 放进同一套训练系统,并进一步连接原生多模态预训练、分档推理投入强化学习、量化感知后训练与大规模并行基础设施。
本文按照论文的段落和小段落顺序进行逐句翻译,保留全部 16 幅图、5 张表、编号公式、交叉引用和技术附录。为帮助第一次接触相关概念的读者,额外说明均放在明确标记的“小白提示”中,不与原论文观点混写。