
目录2. 核心计算引擎微架构2.1 Matrix Multiply Unit (MXU) 深度解析2.2 向量处理单元(VPU)与标量协同2.3 SparseCore架构(v6/v7专属)实现代码2. 核心计算引擎微架构2.1 Matrix Multiply Unit (MXU) 深度解析现代TPU的MXU采用大规模脉动阵列架构,通过权重静止(Weight Stationary)数据流策略最大化计算密度。Ironwood(v7)世代将阵列规模扩展至256×256,每个时钟周期可在单芯片上完成65,536次乘累加操作。该架构通过数据在阵列中的定向流动消除寄存器文件访问瓶颈,权重矩阵在阵列初始化阶段加载至各处理元素(PE)的本地寄存器,随后激活数据以流水线方式横向流入,部分和纵向流出,形成二维数据流网格。寄存器文件层级采用分离式架构设计。Accumulator寄存器堆提供32KB容量,支持多精度累加操作,其物理设计采用多bank结构以支持并行访问。Tile