
数据/模型/张量并行Maths, CS AI Compendium分布式训练原理图解【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendiumMaths, CS AI Compendium 是一本直觉优先的开源教科书覆盖数学、计算机科学与 AI 的全栈知识。本文聚焦其中的分布式训练核心内容用图解式思路拆解数据并行、模型并行、张量并行三大策略帮你快速看懂大模型LLM为什么必须多卡训练、多张 GPU 之间如何分工与同步。为什么大模型训练必须分布式单卡训练大型神经网络迟早会撞上两堵墙算力墙⚡一个 dense 层单步训练约需 6·B·d_in·d_out 次浮点运算反向传播成本约为前向的 2 倍GPT 级模型动辄需要数千 GPU 时显存墙训练时 GPU 必须同时放下四样东西——参数、梯度、优化器状态、激活值。以 7B 模型 FP32 Adam 为例仅前三项就合计 112 GB还没算随 batch size 线性增长的激活值一块 80 GB 的 A100 根本装不下。结论见 05. distributed deep learning.md分布式训练不是锦上添花而是训练前沿模型的刚需。混合精度训练显存减半的第一道防线用FP16 / BF16跑前向与反向同时保留一份FP32 主权重供优化器更新BF16 的指数范围与 FP32 相同几乎不会溢出已是现代 Transformer 训练的默认选择效果激活值与梯度这两块大头显存直接减半。对应原理05. distributed deep learning.md数据并行多卡训练最简单的入门方法数据并行是最容易上手的分布式策略分三步把完整模型复制到 N 张 GPU 上把 mini-batch 切成 N 份每张卡独立做前向 反向用All-Reduce对梯度求平均各卡同步更新本地权重。它的效果等效于用 N 倍的 batch size 在单卡上训练。同步 SGD 与单卡训练数学等价但最慢的卡会拖住全员异步 SGD 消除等待却引入陈旧梯度噪声实践中更推荐同步 高效通信。详见 05. distributed deep learning.md。梯度累积小显存也能模拟大批量不急着更新权重先跑多轮前向/反向把梯度累加起来再一次性更新——效果等同大 batch而激活值显存只占一份。这是单卡玩家模拟大批量训练的实用技巧。模型并行模型太大装不进单卡怎么办当模型本身超过单卡显存就要把模型拆给多张卡主要有两种拆法张量并行把一层的矩阵乘法拆给多卡把 Y XW 按列切开W 分成 [W₁, W₂] 放两张卡并行算出 Y₁ XW₁、Y₂ XW₂ 再拼接。它适用于 Attention 的 Q/K/V 投影和 FFN 层但每一层都要通信必须搭配 NVLink 这类机内高速互联。流水线并行像流水线一样分阶段执行GPU 0 跑第 1-4 层、GPU 1 跑第 5-8 层……数据像传送带依次流过。朴素做法存在流水线气泡上游在算、下游空转把 mini-batch 再切成多个微批依次流过就能让各卡几乎全程忙碌。两种模型并行的对比见 05. distributed deep learning.md。混合并行大模型训练的真实组合拳GPT-4、Llama 这类模型采用的是三层嵌套方案层级策略为什么机内8 卡张量并行NVLink 带宽高扛得住每层通信跨机流水线并行层间通信量相对小跨多组机器数据并行扩展 batch、提升吞吐Ring All-Reduce带宽最优的梯度同步朴素做法是把所有数据集中到一台卡上求和再广播根节点很快成为瓶颈。Ring All-Reduce把 N 张卡排成环、数据切成 N 块经过 2(N−1) 步后每张卡都拿到完整的和——总通信量约 2 倍数据大小且几乎不随卡数增长是带宽最优方案工业界普遍配合 NCCL 库按网络拓扑自动选择最优算法。原理见 05. distributed deep learning.md。分布式训练速查表技术作用代价混合精度BF16激活/梯度显存减半轻微数值差异数据并行多卡扩展 batch梯度同步通信开销张量并行层内拆分矩阵需要高速互联流水线并行层间切分模型流水线气泡梯度累积模拟大批量训练更慢梯度检查点降低激活显存约 33% 计算Ring All-Reduce高效梯度平均超大模型下带宽受限延伸阅读在 Compendium 中深入学习分布式训练完整章节含 FLOPs 估算公式、数据并行与单卡等价性验证、MoE 层实现练习05. distributed deep learning.mdGPU 架构与 CUDA 基础理解 NVLink 与跨机带宽差异04. GPU architecture and CUDA.md 一句话总结前沿模型训练 BF16 混合精度 机内张量并行 跨机流水线并行 数据并行 梯度检查点 定期 checkpoint 容错系统工程与算法设计同样关键。【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考