尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

玩转大模型 第三篇:训练 vs 推理、显存带宽多卡通信——大模型的算力到底卡在哪

玩转大模型 第三篇:训练 vs 推理、显存带宽多卡通信——大模型的算力到底卡在哪 玩转大模型 第三篇训练 vs 推理、显存带宽多卡通信——大模型的算力到底卡在哪前两篇聊的是模型本身它是什么、怎么训出来的。但只要你想把这件事落到地上下一个问题马上会撞上来——卡。“显存爆了”、“这模型 7B 要多少显存”、“为什么推理慢不是算力问题而是带宽问题”……这些说法在群里天天出现但很少有人把它们放在同一张图里讲清楚。更反直觉的是训练阶段和推理阶段的瓶颈压根不是同一套。这篇就把大模型落地的硬件地基铺开算力是什么、CPU/GPU/NPU/TPU 谁干什么、内存和显存的区别最后重点讲训练和推理各自的瓶颈分别卡在哪一环。1. 先把两个概念分开训练和推理这两个词经常被混着用但从计算角度看是两个完全不同的过程。维度训练Training推理Inference做什么大量样本做前向计算 → 算损失 → 反向传播更新参数参数固定只做前向计算生成输出目标“学到能力”“基于输入提示词自回归生成”梯度/优化器状态需要占大量显存不需要典型耗时数周到数月单次毫秒到秒级频率一次性投入持续发生长期成本这个区分很重要因为它直接决定了成本结构训练是资本开支推理是运营开支。一家公司可能只训一次模型但每天要推理上亿次。后面所有关于瓶颈的讨论都会沿这条线分成两套逻辑。2. 算力到底是什么2.1 定义算力Computing Power指计算系统在单位时间内完成计算任务的能力是衡量计算平台性能的核心指标之一。在 AI 领域算力通常体现为对大规模矩阵运算、张量运算和并行计算任务的处理能力。深度学习场景下算力一般用FLOPSFloating Point Operations Per Second每秒浮点运算次数量化。但这里有个特别多人踩的认知坑在实际应用里显存容量、带宽、通信效率往往同样成为决定性因素。也就是说FLOPS 只是纸面能力真正限制你的常常不是它。2.2 硬件基础四类芯片的分工1CPU通用计算的大脑CPUCentral Processing Unit中央处理器专为通用计算设计擅长复杂任务的串行处理是所有计算机的大脑。没有 CPU计算机无法工作。它的运算能力来自少量性能强大的运算单元ALU算术逻辑单元。2传统 GPU大量简单单元并行GPUGraphics Processing Unit图形处理器是专用于数字图像处理的电路我们通常说的显卡就是 GPU最初设计目的是加速图形渲染3D 游戏、视频处理。GPU 拥有大量功能单一的计算单元FP64 双精度、FP32、FP16 等适合大量简单任务并行处理。3现代 GPU加上了 Tensor Core现代 GPU 为了迎合机器学习训练和推理的需求在传统 GPU 基础上增加了专用的矩阵计算单元——在英伟达显卡里就叫Tensor Core大幅提升了神经网络计算效率。目前顶尖的大模型多数都是在 英伟达 的 GPU 上训练的。4NPU牺牲通用性换极致性能NPUNeural Processing Unit神经网络处理器也叫 AI 加速器或深度学习处理器是一类专门为加速神经网络计算设计的芯片用牺牲通用性换取在机器学习任务上的超高性能和低功耗。架构上很直接NPU 砍掉了 FP64 这类单一运算单元通常只保留矩阵运算单元再引入向量处理单元和标量处理单元。说明NPU 厂家很多架构五花八门核心思路相同但具体实现需要参考各自的架构手册。5TPU谷歌的自研专用芯片TPUTensor Processing Unit张量处理器是谷歌为神经网络机器学习专门开发的专用芯片适配自家TensorFlow框架。2015 年开始内部使用2018 年向第三方开放。发布后处于第一梯队的 Gemini-3 系列模型就是在谷歌的 TPU 上训练出来的。说明本质上TPU 也属于 NPU 的一种。QCPU、GPU、NPU、TPU 到底怎么一句话区分CPU 少量强单元什么都能干擅长复杂串行逻辑 GPU 海量弱单元擅长大规模并行数值计算现代版加了矩阵专用单元 NPU 只留矩阵相关单元砍掉通用性换性能和低功耗 TPU NPU 的一种谷歌自家实现绑定自家框架生态6内存 vs 显存两个不能互相替代的东西名称定位服务对象常见类型内存RAM计算机的临时工作空间CPU 运行所需的数据DDR 系列显存VRAM显卡专用内存GPU 运行所需的数据GDDR/HBM这里有个很实用的选择线索游戏显卡通常采用GDDR高端计算卡用于神经网络计算通常采用HBMHBM高带宽内存贵就贵在带宽上这也解释了为什么同一代芯片计算卡和游戏卡价格差一个数量级。7厂家格局GPU 算力市场英伟达一家独大。在贸易战背景下国内有一批企业在自研 GPU如华为昇腾、摩尔线程、寒武纪等。8LLM 常用 GPU 型号当前大语言模型的训练与微调主要依赖 NVIDIA 的 GPU原因是CUDA 生态成熟 计算库高效。以下是常用于 LLM 微调的型号型号架构发布时间H10080GB HBM3Hopper2022 年 3 月H800Hopper2023 年 3 月A100Ampere2020 年 5 月A800Ampere2022 年 11 月V100Volta2017 年 5 月RTX 4090Ada Lovelace2022 年 10 月RTX 3090Ampere2020 年 9 月H800 / A800 这类带 00 后缀的是为特定市场准备的出口合规版本主要区别在互联带宽上被砍了一刀——这一点在下面讲多卡通信时就能理解影响有多大。3. 算力为什么永远不够用在大模型场景里算力长期处于供不应求状态。但真正卡住你的东西训练和推理完全不一样。3.1 训练阶段的三个瓶颈情况 1显存容量训练时显存装的不只是模型参数还要同时保存模型参数 梯度 优化器状态 中间激活值 → 显存消耗通常是参数本身的数倍爆显存显存不足时部分数据会被卸载到内存甚至硬盘此时I/O数据在不同存储介质间的传递成为瓶颈训练效率会非常低。情况 2多卡通信开销顶尖大模型规模太大单卡装不下完整模型必须用张量并行或流水线并行切分模型为了提升效率还会额外引入数据并行。这时候多卡通信就成了新瓶颈。情况 3算力算力指显卡单位时间内能完成的运算次数。模型越大越吃算力——目前顶尖模型参数量在千亿甚至万亿级即使跑在高性能 GPU 集群上也要数周甚至数月。算力不足训练时间会进一步拉长。三者关系值得单独记一句在显存充足且通信够快的情况下算力才会成为瓶颈。反过来说绝大多数团队遇到的问题其实前两个。3.2 推理阶段的四个瓶颈跟训练比推理阶段的瓶颈表现出完全不同的特点。情况 1显存容量推理不需要梯度和优化器状态即便如此超大模型的参数本身仍然占据大量显存。而且为了提升效率推理通常还要保存 KV Cache显存开销进一步上涨。同样爆显存可以卸载到 RAM但会让 I/O 成为瓶颈效率大幅降低。情况 2显存带宽这一条最容易被忽视这是推理独有的瓶颈值得展开训练加载整个序列做大量并行计算 推理Decode 阶段是 逐 token 生成 ↓ 每生成 1 个 token都要从显存加载 整个模型 全部 KV Cache ↓ 计算单元大部分时间在 等待数据 ↓ 瓶颈从算力转移到 显存带宽说白了推理时 GPU 的算力大部分是闲置的卡在了把权重从显存搬进计算单元这条路上。这也是为什么量化、KV Cache 优化、投机解码这些技术对推理的价值远超它们对训练的价值。情况 3多卡通信单卡显存不足时不考虑量化就得用多卡集群多卡通信效率会直接影响推理效率。情况 4算力推理的Prefill 阶段把整个 prompt 一次性算完计算量很大这时候算力可能会成为瓶颈。Q为什么长 prompt 的模型响应特别慢因为 Prefill 是算力密集的输入越长这一步越吃算力。而后续逐 token 输出的 Decode 是带宽密集的。所以首 token 慢和后续吐字慢其实是两个不同的瓶颈优化方向也不一样——一个要看算力一个要看显存带宽。4. 如果我是后端 / 架构该怎么看这一堆课件这块偏科普我按自己选型时的思路重新排了一遍优先级你想做的事第一个卡你的东西该关注什么跑一个 7B 模型做推理显存容量能否塞进单卡量化能救很多微调一个 7B 模型显存容量 优化器状态全参微调要 80GBLoRA 可以压到 24G 单卡高并发推理服务显存带宽换卡不如换推理框架和缓存策略训练/续训大模型多卡通信互联带宽NVLink / IB比单卡算力更决定整体效率企业私有化部署上面全部 生态CUDA 兼容性常常比价格更重要一句话纸面 FLOPS 是最不重要的一项真正决定体验和成本的是显存容量、显存带宽、多卡通信这三件事。最后总结训练和推理要分开算账训练是资本开支瓶颈在显存 → 通信 → 算力依次解锁推理是运营开支瓶颈多了显存带宽这一项。四类芯片不是替代关系CPU 管全局逻辑GPU 管大规模并行NPU/TPU 用通用性换极致的神经网络效率和低功耗。显存 ≠ 内存GDDR 面向游戏HBM 面向计算卡价差的核心是带宽。为什么爆显存后效率断崖式下跌数据被卸载到内存/硬盘I/O 变成瓶颈GPU 大部分时间在等数据。为什么 Decode 慢通常不是算力问题逐 token 生成为主每步都要加载全部权重和 KV Cache卡的是带宽。对我个人来说这一篇最实用的结论是选型时先问我的瓶颈在显存、带宽还是通信再去看卡型号比直接对比 FLOPS 有用得多。第四篇开始进入应用层从在线平台到 API 调用以及大模型落地绕不开的那个词——幻觉。参考资料 致谢[1] 尚硅谷大模型技术之大模型概述 V1.0.3-课件[2] NVIDIA 官网[3] NVIDIA H100 产品页-官网[4] Google TPU 官网[5] 华为昇腾-官网
返回列表