导言
RL 涉及到 推理,推理的流程细节不是很明晰。
- warmup,计算kvcache
- chunked prefill,降低prefill的显存
导言
RL 涉及到 推理,推理的流程细节不是很明晰。
导言
训练由于要计算并更新梯度,一般是计算密集。但是推理一般是访存密集。
导言
训练由于要计算并更新梯度,一般是计算密集。但是推理一般是访存密集。
导言
导言
LLM Prefill、decode、kvcache等概念
导言
机器学习和人工智能模型算法,从一开始模仿神经元设计,到现在根据任务定制或者基于naive的思想构建(例如对抗思想、感受野、注意力机制)。模型的设计可以说是日新月异,截然不同。但是从高性能计算的角度来看,还是离不开求导操作、矩阵操作、激活函数计算这几点。剩下值得考虑的就是寻找现有或者未来模型构成计算操作的最大公约数,来对其进行特殊软硬件设计加速。或者只是对现有模型的适配加速工作。
导言
learning HTML is the foundation of building my hugo theme
导言
毕竟都是要工作的人了,有些💴相关的事情还是要了解的。 计算税率有几个难点:
When & How 4 team presentation page & knowledge database pool
导言
我原本是想开发一个实验室主页的模板的,一开始想着还可以带到公司里去。但是我突然想到 公司里还有 “嫡系” 这种事情。让我意识到实验室和公司的环境完全不一样,让机制的部署和落地变得更加复杂。