
GPU 架构演进对算子编写的影响从 Pascal 到 Hopper 的 Tensor Core 变迁在过去近十年的深度学习浪潮中NVIDIA GPU 的底层微架构经历了翻天覆地的代际跃迁从PascalP100 / GTX 1080到VoltaV100 - Tensor Core 诞生到TuringT4到AmpereA100再到现代大模型时代的HopperH100与 BlackwellB200。很多高层算法工程师习惯于在 PyTorch 中调用torch.matmul感觉每一代显卡无非是“运行速度变快了”。然而在底层高性能算子开发者与 AI 编译器工程师的视角下每一代 GPU 架构的演进都伴随着编程范式Programming Paradigm、硬件执行原语与片上访存体系的颠覆性重构。深入推导 Tensor Core 在微架构层面的演进脉络是手写现代化极致 Kernel 的核心基石。-------------------------------------------------------------------------- | NVIDIA GPU Tensor Core 关键架构代际演进 | -------------------------------------------------------------------------- | 1. [Pascal 时代 (P100)]: 传统 CUDA Core 标量乘加 (FMA) | | - 每个时钟周期只能执行 1 次标量乘加 (单线程视角) | -------------------------------------------------------------------------- | 架构革命: 引入 Tensor Core v | 2. [Volta / Turing 时代 (V100/T4)]: WMMA API (Warp 级矩阵乘) | | - 引入 nvcuda::wmma 原语单个 Warp 并发完成 16x16x16 矩阵乘加 | -------------------------------------------------------------------------- | 架构演进: 暴露硬件底层汇编 v | 3. [Ampere 时代 (A100)]: MMA.SYNC 汇编 异步拷贝 (Async Copy) | | - ldmatrix 指令优化共享内存加载cp.async 实现 Global-Shared 异步直传 | -------------------------------------------------------------------------- | 终极进化: 硬件级张量加速器 v | 4. [Hopper 时代 (H100)]: TMA 硬件张量内存加速器 Warp Group (WGMMA) | | - 异步硬件 TMA 彻底接管内存搬运WGMMA 支持 128 线程大张量并发计算! | --------------------------------------------------------------------------1. Volta 时代V100Tensor Core 诞生与 WMMA 抽象在 Pascal 之前所有的矩阵乘法本质上都是由一个个独立的 CUDA Core 执行标量fma(a, b, c)指令完成的。Volta 架构首次引入了专用的硬件矩阵计算单元——Tensor Core核心原语nvcuda::wmma::mma_syncWarp 协同语义一个 Warp32 个线程作为一个不可分割的整体在单条指令周期内协同完成一个 $16 \times 16 \times 16$ 的 FP16 矩阵乘加运算$$D A \times B C$$算力跃迁V100 的半精度张量算力相比上一代 P100 暴增了整整5 倍2. Ampere 时代A100异步拷贝cp.async与极致指令重叠在 Volta/Turing 时代算子开发面临一个严重的痛点将数据从全局显存Global Memory加载到片上共享内存Shared Memory时必须经过线程寄存器中转Global - Register - Shared消耗了大量的寄存器和 ALU 指令。Ampere 架构引入了两大颠覆性硬件特性异步内存拷贝指令cp.async允许硬件直接在 Global Memory 与 Shared Memory 之间建立 DMA 搬运通道完全不经过寄存器CPU/GPU 线程在发起拷贝后可以立即去执行其他计算ldmatrix硬件指令单条指令能够并发从 Shared Memory 中抓取 4 个矩阵分片并高效分发给 Warp 内的 32 个线程彻底消除了共享内存的 Bank Conflict 冲突。3. Hopper 时代H100TMA 硬件加速器与 WGMMA在 Hopper 架构中硬件矩阵计算再次发生质的飞跃TMATensor Memory Accelerator张量内存加速器彻底将数据搬运从 GPU 指令流水线中剥离算子只需向 TMA 发出一个包含多维张量坐标的描述符TMA 硬件控制器全自动在后台完成多维张量切片、Padding 与地址换算并直接填充进 Shared MemoryWarp Group 级矩阵乘WGMMA矩阵乘计算单元从单个 Warp 扩展为Warp Group4 个 Warp 128 个线程协同允许算子直接以 Shared Memory 中的张量作为操作数执行矩阵乘算力达成率逼近硬件理论极限的95% 以上从传统的标量计算演进到 Warp 级 WMMA再到异步流水线与 TMA 硬件卸载GPU 算子编写的每一次代际蜕变都见证着软硬件协同设计在性能极限上的伟大探索。