技术与工程已解决
多卡推理的并行策略:TP 与 PP
张量并行切模型内部、流水线并行切层——多卡部署的两种基本切法。
问题正文
张量并行(TP)
把模型的权重矩阵切开分到多卡,每步计算所有卡协同完成。通信频繁但延迟低,适合卡间互联快的场景(单机内、NVLink)。
流水线并行(PP)
把模型的层分段分到多卡,像流水线一样接力。通信少但有空泡浪费,适合跨机场景。
组合使用
大模型大集群:机内 TP 加跨机 PP 的组合。KV Cache 也需要按并行策略分片,这是显存规划的一部分。
张量并行切模型内部、流水线并行切层——多卡部署的两种基本切法。
问题正文
把模型的权重矩阵切开分到多卡,每步计算所有卡协同完成。通信频繁但延迟低,适合卡间互联快的场景(单机内、NVLink)。
把模型的层分段分到多卡,像流水线一样接力。通信少但有空泡浪费,适合跨机场景。
大模型大集群:机内 TP 加跨机 PP 的组合。KV Cache 也需要按并行策略分片,这是显存规划的一部分。
ANSWERS
回答内容
单卡装得下就别并行(通信开销为零)。装不下时优先机内 TP(2 卡、4 卡),跨机再考虑 PP。
TP 的扩展效率严重依赖卡间带宽:普通 PCIe 上多卡的收益可能远低于预期,NVLink 才能发挥 TP 价值。跨机并行必须评估网络。
vLLM 与 TensorRT-LLM 都内置了并行支持,参数化开启即可。并行度的调优要用真实流量验证吞吐,不要只看单请求延迟。