
「智算X互联 AI-X OpenLab」专注智算互联产业和技术观察。最近几期里我们将从智算互联角度对NVIDIA GTC2 2026进行拆解。如感兴趣请搜索关注「智算X互联 」公众号。BlueField-4 STX并非传统意义上的存储控制器或SSD扩展卡而是NVIDIA面向“智能体AI”Agentic AI时代为解决万亿参数模型长上下文推理的核心瓶颈——KV缓存Key-Value Cache的存储与管理——而设计的革命性架构。其核心目标是将KV缓存从消耗昂贵GPU内存HBM的“奢侈品”和性能瓶颈转变为在整个AI计算集群Pod内可高效共享、按需供给的“标准资源”。一、 核心问题传统存储架构无法承载AI推理的“记忆”在Transformer模型推理尤其是自回归生成中KV缓存用于存储历史Token的Key和Value向量避免重复计算是模型保持“上下文记忆”的关键。随着上下文长度从千级、万级迈向百万级TokenKV缓存的大小线性增长带来两大挑战容量挑战单次会话的KV缓存轻松超过单个GPU的HBM容量数十GB必须溢出到系统其他部分。性能与效率挑战传统数据中心存储层级G1: HBM, G2: DRAM, G3: 本地SSD, G4: 共享存储在容量和延迟/带宽之间存在巨大鸿沟。将活跃的KV缓存放在慢速的G4共享存储中会导致GPU因等待数据而空转吞吐量Tokens Per Second和能效急剧下降。BlueField-4 STX的使命就是在G3本地高速存储和G4远程共享存储之间插入一个全新的、为KV缓存优化的G3.5存储层即“上下文内存层”。二、 架构核心硬件、层级与软件的深度协同BlueField-4 STX架构是一个从硬件、网络到软件栈的完整解决方案。1. 硬件基石存储优化的BlueField-4处理器集成设计单颗芯片集成了Vera CPU88核自研Arm核心和ConnectX-9 SuperNIC1.6 Tbps网络接口。专用引擎内置硬件KV I/O加速引擎专门优化KV缓存数据的存取、搬运和协议处理。高带宽互联提供800Gb/s的网络吞吐能力为存储层与计算层之间的高速数据交换奠定物理基础。2. 核心创新Pod级上下文内存层这是STX架构的灵魂。它在AI计算集群一个Pod通常包含多个机架的计算单元级别构建了一个共享的、可扩展的、低延迟的KV缓存存储池。位置位于GPU HBMG1和传统后端共享存储G4之间作为G3.5层。容量可扩展至TB-PB级别足以容纳海量的长上下文KV缓存。访问方式通过Spectrum-X以太网结构基于RoCE RDMA实现所有计算节点GPU、LPU对这个共享内存池的低抖动、高带宽直接访问。这确保了跨节点、跨会话的KV缓存可以高效复用。3. 软件栈与调度智能的数据生命周期管理硬件能力需要通过软件调度才能发挥最大价值STX与NVIDIA的AI软件栈深度集成Dynamo 1.0作为推理流水线的统一编排器其KV块管理器负责智能决策哪些KV块是“热”的应保留在GPU HBM或预加载到CMX层哪些是“温”的可放在CMX层哪些是“冷”的可沉降到后端G4存储。NIXL传输库负责在GPU HBM ↔ CMX层 ↔ 后端存储之间执行零拷贝的数据搬运。它与Dynamo协同实现KV缓存的异步预加载Prestaging和淘汰Eviction。DOCA框架为存储场景提供微服务化、硬件加速的支撑包括KV协议终止、元数据卸载、安全加密和遥测将CPU占用率降至近乎为零。三、 工作模式解耦的推理流水线STX架构支持并优化了解耦推理模式Prefill阶段由Rubin GPU负责处理完整的提示词生成初始的KV缓存。Decode阶段由Groq 3 LPU或GPU负责进行自回归Token生成。KV缓存管理由BlueField-4 STX全权负责。它将Prefill阶段产生的大容量KV缓存持久化到CMX层在Decode阶段根据调度策略将即将需要的KV块提前预加载到计算单元的内存中。多个推理任务可以共享CMX中的同一份KV缓存如多轮对话历史避免了重复计算和传输。四、 带来的量化收益与根本性转变根据文档中的官方数据相比传统的CPU-centric存储方案BlueField-4 STX架构实现了吞吐量Token吞吐量提升5倍。能效功耗效率提升4-5倍。数据摄入训练/推理数据预处理速度提升2倍。延迟与成本显著降低GPU尾延迟提升GPU利用率从而降低总体拥有成本。根本性转变在于从瓶颈到资源KV缓存从挤占GPU内存、导致性能下降的“瓶颈”变成了在Pod内可池化、可共享的“加速资源”。支持无限上下文理论上通过CMX层与后端存储的协同可以支持无限长的上下文推理仅受限于存储总容量。AI-Native存储存储架构首次为了一种特定的AI数据类型KV缓存进行端到端的优化从硬件、协议到调度实现了真正的“AI原生”。五、 生态定位与启示BlueField-4 STX是NVIDIAVera Rubin AI工厂平台的核心存储组件。它与Rubin GPU、Vera CPU、Groq 3 LPU、Spectrum-X网络共同构成了一个从计算、互联到存储的全栈协同设计闭环。对行业的启示系统协同AI基础设施的竞争已从单一算力芯片转向计算、内存、存储、网络的全栈协同优化能力。专用化针对AI负载中涌现出的关键数据类型如KV缓存进行硬件和架构层面的专用优化将成为释放性能潜力的关键。软件定义硬件DOCA、Dynamo等软件栈的价值凸显它们是将强大硬件能力转化为简易API和实际性能的关键构成了更深的生态护城河。总结BlueField-4 STX存储架构代表了AI数据中心基础设施演进的一个重要方向通过引入专用的、池化的上下文内存层并辅以硬件加速和智能调度从根本上解决了长上下文AI推理的“记忆墙”问题为下一代Agentic AI应用提供了必需的高性能、高能效“记忆系统”。