NVIDIA Rubin GPU技术详解:224个SM、288GB HBM4与NVLink 6

发布时间:2026/7/23 11:40:51

NVIDIA Rubin GPU技术详解:224个SM、288GB HBM4与NVLink 6 NVIDIA于2026年7月21日公开Rubin GPU进一步架构细节。本次披露覆盖芯片组织、Tensor Core与Transformer Engine、HBM4、TMA、注意力执行、Kernel依赖、NVLink通信和机架功率管理。本文只整理已公开技术事实并说明各项机制对应的负载。1Rubin GPU规格总览子系统规格封装双计算裸片通过NV-HBI连接晶体管3360亿计算单元224个SM、896个Tensor CoreTransformer Engine第三代支持NVFP4等精度NVFP4推理最高50 PFLOPS预备峰值官方未标注Dense显存最高288GB HBM412-Hi堆叠显存带宽最高22TB/sScale-upNVLink 6最高3.6TB/s双向总带宽CPU—GPUNVLink-C2C最高1.8TB/s双向一致性带宽Host I/OPCIe 6.0代际x16单向约128GB/s、双向合计约256GB/s口径说明50 PFLOPS是NVIDIA公布的NVFP4预备峰值规格。官方规格表没有将该项标注为Dense specification而NVFP4训练35 PFLOPS带有Dense脚注因此不宜自行写死为稠密或含稀疏性也不应与不同精度或平台层级的数据直接比较。2双裸片与计算组织Rubin采用两个reticle-limited计算裸片通过NV-HBI在封装内统一。GPU内部以GPC组织SM使用集中式L2缓存GigaThread Engine负责工作调度MIG Control用于多工作负载分区NV-DEC承担视频解码。第三代Transformer Engine根据数值格式调度Tensor Core。Rubin把Tensor Core每时钟处理的K维数据量提高一倍。对于输出维度被Tensor Parallel切小、K维仍较大的GEMM可用更少的K循环完成归约减少循环和指令开销。3TMA的内联描述符更新TMA负责Tensor在显存与共享内存之间的地址计算和数据传输。MoE模型包含多个布局相同、位置不同的专家权重。此前软件可能为不同专家维护不同描述符Rubin支持在TMA指令中内联覆盖内存指针、stride等字段使多个专家共享基础描述符。该机制降低的是描述符管理与地址更新开销。实际收益受专家数量、专家并行策略、Tensor布局及框架实现影响不能独立推导端到端加速比例。4长上下文注意力激活稀疏与SoftmaxRubin仍先执行稠密QKᵀ计算再把中间注意力分数转换成结构化2:4稀疏表示同时生成非零值和元数据。Softmax可针对非零值运行随后的attention×V可用稀疏MMA执行外围接口仍输出稠密数据。这一流程主要减少注意力中间结果的存储、读取与计算。Rubin还提高指数函数吞吐相对Blackwell基线FP32为2倍BF16/FP16为4倍用于缓解Softmax的指数和归约运算瓶颈。5依赖Kernel的细粒度触发推理图中常见生产者—消费者Kernel链。若消费者必须等待大范围生产任务完成GPU时间线上会出现空隙。Rubin允许依赖工作在所需Tile数据到达后更早启动把触发粒度从批量依赖缩小到数据可用级别。该机制主要改善Kernel切换和激活值依赖延迟适合逐层、逐Token的执行路径。它与CUDA图、Kernel融合等软件优化互补最终是否启用仍取决于框架和编译器支持。6HBM4容量与带宽分别解决什么Rubin最高配置为288GB HBM4、22TB/s。容量决定权重、上下文和KV Cache是否常驻带宽决定Decode阶段每个Token访问权重和KV状态的速度。NVIDIA称22TB/s相较Blackwell与Blackwell Ultra最高8TB/s约提升2.8倍。Rubin的容量与最高288GB的Blackwell Ultra相同因此不能把升级简单描述为“显存更大”更准确的变化是HBM4接口和控制器显著扩大数据吞吐。7NVLink 6与counted writesNVLink 6为单颗Rubin GPU提供最高3.6TB/s双向Scale-up总带宽。Rubin进一步加入设备发起通信的counted writes让接收GPU通过计数更直接地确认传输完成减少屏障、确认消息与原子标志相关的同步步骤。对Expert Parallel、Tensor Parallel和分布式Decode而言带宽与同步开销都会影响通信计算重叠。NVLink 6解决数据通路counted writes处理完成通知两者不应混为同一指标。8从GPU扩展到NVL72Vera Rubin NVL72集成72颗Rubin GPU、36颗Vera CPU、NVLink 6交换与机架级网络。NVIDIA同时公开45°C液冷、Intelligent Power Smoothing和DSX MaxLPS等设计用于控制瞬态功率并提高固定供电预算内的GPU部署密度。NVIDIA宣称DSX MaxLPS可在同等电力预算下配置最高多40%的GPU这是平台级规划结果取决于负载、功率曲线、运行点与设施条件不是Rubin GPU自身能效倍数。9性能数据的正确使用方式“最高10倍Agent吞吐/单位能耗”来自NVIDIA内部2T MoE工作负载对比的是Vera Rubin与Blackwell平台的Pareto前沿。该结果包含GPU、CPU、内存、互连、软件和机架系统不能改写为单卡或所有模型普遍提升10倍。工程验证建议记录模型与活跃参数、精度、上下文、批量、并发、并行策略、TTFT、TPOT、Tokens/s、有效显存带宽、通信占比和整机功耗。只有在相同服务目标下平台效率才有可比性。10总结Rubin的架构重点可以归纳为三条数据路径TMA管理GPU内部Tensor移动HBM4提高权重与KV状态读取速度NVLink 6与counted writes优化GPU间通信Tensor Core、注意力稀疏和细粒度Kernel触发则提高这些数据到达后的执行效率。截至2026年7月NVIDIA已公布Vera Rubin进入全球量产爬坡和合作伙伴导入阶段。赋创将持续关注新一代GPU及服务器平台的技术演进并将相关变化用于完善显存、互连、网络、供电散热和集群扩展等方案评估为不同模型与业务负载提供更适配的AI算力配置参考。

相关新闻