导言
训练万亿参数模型时,几千甚至上万张 NPU/GPU 不是各算各的。每一步训练都会反复交换梯度、激活和专家 token,网络就像一座每秒要分拣海量包裹的城市:包裹搬得慢,昂贵的计算卡只能停下来等路。
UB-Mesh 的关键想法不是发明一条“无限快”的网线,而是承认通信具有局部性:把最频繁、最大量的通信放到近处的短链路,把较少的远程通信留给远层网络,再让路由、集合通信和容错都理解这张不对称的地图。
导言
训练万亿参数模型时,几千甚至上万张 NPU/GPU 不是各算各的。每一步训练都会反复交换梯度、激活和专家 token,网络就像一座每秒要分拣海量包裹的城市:包裹搬得慢,昂贵的计算卡只能停下来等路。
UB-Mesh 的关键想法不是发明一条“无限快”的网线,而是承认通信具有局部性:把最频繁、最大量的通信放到近处的短链路,把较少的远程通信留给远层网络,再让路由、集合通信和容错都理解这张不对称的地图。