Tensor Parallelism张量并行


一句话总结

张量并行将单个层的权重矩阵拆分到多个设备上并行计算,是大模型推理中最常用的并行策略。

核心概念

Megatron-LM提出的张量并行方法将线性层的权重按列或按行切分。对MLP层,第一个线性层按列切分,第二个按行切分,中间无需通信。对Attention层,将Q/K/V投影按注意力头维度切分,每个设备处理部分注意力头。每层需要两次AllReduce通信(前向和反向各一次)。通信量与隐藏层维度成正比。

为什么重要

张量并行是推理场景降低单请求延迟的最有效方式,因为它将单层计算真正并行化。相比流水线并行没有bubble,相比数据并行可以处理超大模型。70B模型通常需要4-8张GPU做张量并行。

实践要点

张量并行度通常设为同一节点内的GPU数量(2/4/8)。跨节点张量并行因通信延迟高而不推荐。确保隐藏层维度能被并行度整除。搭配NVLink高速互联获得最佳性能。Attention头数需为并行度的倍数。

常见误区

误以为张量并行可以无限扩展,实际通信开销随并行度增加。忽视张量并行对模型结构的要求。跨节点使用张量并行导致严重性能下降。