尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

EAI182X-M2 新品发布:不换主控,插卡升级,怎么让存量设备获得 20TOPS 本地大模型算力?

EAI182X-M2 新品发布:不换主控,插卡升级,怎么让存量设备获得 20TOPS 本地大模型算力? 在端侧AI的性能讨论中TOPS长期是最常被比较的指标。但当大语言模型进入终端一个更基础的约束开始主导实际体验数据能否以足够快的速度送达计算单元。以RK3588为例其内置NPU提供6TOPS算力在YOLO检测、人脸识别等CNN类任务中表现稳定。但运行大语言模型时实测输出速度仅约14 tokens/sQwen2-1.8BW8A8量化第三方数据。瓶颈并非算力不足——而是模型权重在内存与NPU之间的搬运速度跟不上计算消耗。这个被称为「内存墙」的约束正在成为端侧大模型落地的第一道门槛。01——内存墙与3D堆叠-TOPS换不来生成速度带宽可以大语言模型的推理与CNN类任务有本质区别。CNN是一次性前向计算权重读取一次即可而LLM采用逐Token自回归生成——每生成一个token都要把整层模型权重从内存读取一遍长上下文还会让KV Cache访问量持续攀升。这意味着LLM是典型的带宽受限型bandwidth-bound负载——其实际性能主要受内存带宽制约而非NPU峰值算力决定。传统SoC中操作系统、显示、视频与AI计算共享外部内存权重搬运需跨PCB、跨封装且LPDDR外挂总线存在物理带宽上限。就会导致一个后果算力再高内存喂不上来NPU就是空转。RK182X的解法不在SoC内部挤带宽而是单独做一颗AI协处理器把高带宽DRAM直接叠封在NPU上方——逻辑晶圆与定制LPDDR晶圆通过TSV硅通孔混合键合垂直层叠互联路径从跨PCB、跨封装缩短为垂直穿通。片内DRAM与算力datasheet7B模型INT4量化后约4GBRK1828的5GB片内内存可完整装下权重全程常驻片内无需与主控反复交换——这是突破内存墙的物理基础。02——协处理器架构与 EAI182X-M2-不换主控插卡升级理解RK182X的关键在于——它不是SoC是一张AI算力卡。3588、3576这类SoC是完整片上系统插电即可跑系统而RK182X只有NPU加高带宽DRAM3颗RISC-V核用于任务调度不直接跑模型。最接近的类比是PC里的独立显卡主控是3588/3576推理任务通过PCIe下发给RK182X结果再返回。互联接口 2路 PCIe 2.1单通道RC模式2.5/5.0Gbps、1路 USB 3.0 DRD 1路 USB 2.0 DRD、1路千兆以太网RGMII并内置AES/SM4、SHA/SM3、RSA 4096、ECC 256、SM2等安全引擎。灵眸科技 EAI182X-M2灵眸科技 EAI182X-M2即基于该架构采用标准M.2形态Key B-M适配 RK3588 / RK3576 / RK3568 等瑞芯微主控平台作为Host互联 PCIe 2.1 与主控协同主控继续承载操作系统、显示、视频与外设控制算力 NPU INT8 20 TOPS混合精度支持存储 片内3D堆叠DRAM2.5GBRK1820或 5GBRK1828工具链配套RKNN3区别于此前的RKNN/RKNN2提供C API支持模型转换、推理与性能评估模型 支持LLM、VLM、CNN三类核心模型本地化部署兼容Qwen、DeepSeek、GLM、MiniCPM、Llama等主流模型产品形态卡片正面覆盖黑色金属散热鳍片并嵌入主动散热风扇背面为完整PCB板载RK182X主控与片内DRAM堆叠封装右侧为M.2金手指。机械尺寸这种SoC AI协处理器双轨架构的工程价值在于一台已量产的RK3588/RK3576/RK3568板卡只要预留M.2插槽插上即可获得20TOPS独立NPU算力无需更换主控、重新画板、重新做产品认证。对工业、车载这类主控生命周期长达5~7年、而AI模型几个月一迭代的场景等于为AI能力保留了一条独立升级通道。03——模型支持范围、实测性能与模型精度当前已支持模型目前支持的模型包括但不限于以下模型性能注1. RK182X 表⽰加速芯⽚可为 RK1820 或 RK1828。2. Qwen2.5-VL-3B-如果使⽤ RK1820 加速芯⽚采⽤两段式运⾏⽅案LMHead在RK3588上执⾏-如果使⽤ RK1828 加速芯⽚模型推理完全在协处理器端执⾏。3. RK1820/RK1828协处理器NPU频率均为1GHz。4. 测试基于RK3588 RK1820/RK1828两者之间通过PCIe连接RK3588 设置为性能模式。5. TTFT模型⽣成第⼀个 token 所需的时间。6. TPOT⽣成每个输出 token 所需的平均时间。7. TPS模型每秒能⽣成的 token 数量。8. VLM 的 Vision 和 LLM 耗时为独⽴测试LLM部分的 Input Tokens 和 New Tokens 均设为128。9. 多卡级联测试基于 RK3588 主控 多张 RK1828 协处理器采⽤流⽔线并⾏级联RK3588 设置为性能模式模型精度端侧AI进入BOM的前提是能够被量化为实际的体验提升或成本回报。对已部署大量RK3588/RK3576/RK3568平台的客户而言不换主控、插卡升级意味着AI能力的引入不再伴随一次完整的硬件改版与重新认证——这是EAI182X-M2最直接的价值。同时我们也建议用户在选型时先明确负载类型以大模型交互为主协处理器路线收益明确以传统视觉检测为主主控自带NPU已能满足需求无需重复投入。EASY-EAI灵眸科技长期基于瑞芯微平台提供嵌入式软硬件方案EAI182X-M2 的推出进一步完善了从主控核心板到AI算力扩展的产品矩阵。
返回列表