
AMD ROCm 开源 GPU 计算平台全景指南Core SDK、AI 生态与系统基础设施【免费下载链接】legacy-rocm-buildAMD ROCm™ Software - GitHub Home项目地址: https://gitcode.com/GitHub_Trending/ro/legacy-rocm-buildAMD ROCmRadeon Open Compute是 AMD 的开源 GPU 计算平台一个覆盖编译器、运行时与库的端到端生态系统面向 AI、HPC 及领域专用负载设计。本指南以本仓库的入口文档 docs/index.md 为核心骨架结合 README.md、核心组件说明 与 7.14.0 发布说明 等仓库资源系统梳理 ROCm 的四大板块——Core SDK、AI Ecosystem、GPU Systems and Infrastructure 与 Toolkits帮助你快速理解 ROCm 的软件栈构成、组件分类方式以及从安装、兼容性验证到性能工具链的完整入门路径。ROCm 平台定位开源的端到端 GPU 计算栈按 docs/index.md 的定义ROCm 是 AMD 的开源 GPU 计算平台由编译器、运行时和库组成一个端到端生态系统服务于 AI、HPC 与领域专用负载。它的三个关键属性是开源软件栈整体开源由社区与 AMD 共同演进跨平台同时支持 Linux 与 Windows硬件覆盖广面向 AMD Instinct™数据中心 GPU、AMD Radeon™消费/工作站 GPU与 AMD Ryzen™ AIAPU三类设备优化。更细化的描述见 docs/about/what-is-rocm.rstROCm 是 AMD 面向 GPU 加速计算的开源软件栈提供编程 AMD GPU 所需的运行时、编译器、性能与系统工具、以及优化的数学和计算库更广泛的 ROCm 生态还包括 PyTorch 等 ROCm 启用的 HPC 应用与深度学习框架。而 README.md 补充了一个重要定位ROCm 特别适合 GPU 加速的高性能计算HPC、AI、科学计算与计算机辅助设计CAD其核心编程模型由HIP驱动——一个 C 运行时 API 与内核语言提供与 NVIDIA CUDA 相似的接口让开发者编写可移植的 GPU 代码同时它也支持 OpenMP 与 OpenCL。从 README.md 中还可以看到一个与仓库状态直接相关的事实本仓库legacy-rocm-build即将弃用后续开发与 issue 讨论将迁移到 ROCm/TheRockTheRock 正是 AMD 的开源构建与发布系统。理解这一点有助于你正确看待本仓库中的文档——它们代表 ROCm 在 TheRock 化改造后的最新组织方式。ROCm Core SDKGPU 计算的基石入口页的第一个板块是Core SDK它被定位为在 AMD 硬件上进行 GPU 计算的基础库、运行时与工具——包括数学与计算库、通信原语、HIP 运行时、性能分析与调试工具等。仓库中对应的完整清单由 docs/data/components.yaml 驱动并通过 docs/components/core.rst 渲染成文。七大组件分组docs/components/core.rst 将 Core SDK 组件划分为七个固定分组顺序如下Math and compute libraries数学与计算库覆盖稠密与稀疏线性代数、FFT、随机数生成等 GPU 加速数学库Communication libraries通信库如 RCCL、rocSHMEM用于多 GPU / 多节点集合通信Runtime and compilers运行时与编译器HIP、HIPIFY、LLVM、ROCr Runtime 等Profiling and debugging tools性能分析与调试工具ROCm Compute Profiler、ROCm Systems Profiler、ROCprofiler-SDK、ROCgdb 等Control and monitoring tools控制与监控工具AMD SMI、ROCm Data Center ToolRDC、rocminfoMedia libraries媒体库rocDecode、rocJPEGStorage存储hipFile支持存储与 GPU 内存之间的直接数据传输AMD Infinity Storage 的一部分绕过主机侧拷贝以降低大吞吐 GPU I/O 的延迟与命令开销。roc* 与 hip* 前缀的命名语义这是读懂 ROCm 库清单的关键约定见 docs/components/core.rstroc*前缀原生高性能实现直接以 HIP 为 AMD GPU 编写如 rocBLAS、rocFFT、rocRAND、rocSPARSE、rocSOLVER、rocPRIM、rocThrusthip*前缀可移植封装实现与 NVIDIA CUDA 等价的 API使 CUDA 应用能以最小代码改动移植到 AMD GPU如 hipBLAS、hipFFT、hipRAND、hipSOLVER、hipSPARSE、hipCUB、hipFile。hip*封装与roc*原生库通常成对出现如 hipBLAS/rocBLAS、hipSPARSE/rocSPARSE这种双轨结构正是 ROCm 可移植性设计的核心。版本与发布节奏当前仓库对应 ROCm7.14.0见 docs/about/release-notes.md。该版本是 ROCm 迁移到 TheRock 构建系统后的重要一步发布说明总结的三大变化方向值得注意更精简的核心Core SDK 聚焦于必需的运行时与开发组件面向用例的扩展AI、数据科学、HPC 等领域可选的领域专用 SDK模块化安装只安装工作流所需的组件从而简化安装、缩小占用并加速创新组件可独立发布。此外发布说明指出 7.14.0 的亮点集中在 AI 推理、分布式负载与性能分析vLLM 推理就绪镜像与包、ROCprofiler-SDK 在 AI 分析工作流中的采用、系统遥测与验证覆盖扩展以及数学/稀疏/通信库的更新。AI EcosystemAMD GPU 上的 AI 全栈入口页的第二个板块是AI Ecosystem定位为在 AMD GPU 上使用主流 ROCm 启用框架部署 AI 工作负载的全栈文档与配方。仓库中的 docs/ai-ecosystem.md 对该板块展开了详细描述AI 生态文档门户包含深度学习框架的安装与配置、大规模模型训练、LLM 与扩散模型推理服务以及 AMD GPU 上 AI 工作负载的性能优化指南。AI 生态构建在 ROCm Core SDK 之上——由 Core SDK 提供底层 GPU 运行时HIP、编译器与数学库。其覆盖范围包括深度学习框架PyTorch 与 JAX 在 AMD GPU 上的安装涵盖 AMD Instinct、Radeon GPU 与 Ryzen APU跨 Linux 与 Windows基于 pip 分发训练使用 PyTorch 分布式原语DDP、RPC、集合通信跨多 GPU 扩展模型训练应对超出单 GPU 内存的大模型推理使用高性能推理框架服务 LLM 与生成式 AI 模型覆盖单节点与分布式多 GPU 部署涉及 vLLM、SGLang、MIGraphX、ONNX Runtime、xDiT、ComfyUI 等分布式推理在 MI355X 集群上通过 MoRIModular RDMA Interface实现多节点 prefill-decode 分离式推理服务优化吞吐、延迟与内存效率优化包括 vLLM V1 性能调优、模型量化、模型加速库、Triton kernel 与 Composable Kernel 优化教程AI Playbooks 与 AI Developer Hub 等实操指南。当前 7.14.0 版本启用的框架版本为PyTorch 2.12.0、JAX 0.10.0、vLLM 0.23.0、SGLang 0.5.13、TensorFlow 2.21取代此前的 PyTorch 2.9.1、JAX 0.8.2、vLLM 0.19.1、SGLang 0.5.9。这些版本信息同时出现在 docs/compatibility/compatibility-matrix.rst 的 AI 生态兼容性章节中。GPU Systems and Infrastructure规模化部署与运维入口页的第三个板块面向 AMD Instinct GPU 的规模化部署与运维包括 AMD GPU Driver 安装、集群管理、GPU 分区、监控、虚拟化、云部署与容器。其两个核心入口为AMD GPU DriveramdgpuROCm 正常运行依赖内核驱动层安装时通常需要单独安装 amdgpu 驱动Network OperatorKubernetes在 Kubernetes 集群中管理 GPU 网络资源。兼容性矩阵 的系统要求章节解释了为什么这一层需要谨慎对待ROCm 依赖固件、驱动与用户空间组件组成的协调栈各层之间保持版本对齐是 GPU 正常运行与性能达标的保证对 AMD 数据中心产品尤其如此。矩阵逐表列出 GPU 详情、支持的操作系统、内核驱动与固件版本并分别覆盖 AMD Instinct、Radeon 与 Ryzen 三类设备同时包含虚拟化支持Instinct 与 Radeon与 SR-IOV 场景。7.14.0 在系统层的新增支持包括新增多款 Ryzen AI APUgfx1151/gfx1153 系列新增 RHEL 10.2 与 RHEL 9.8 支持SLES 15 SP7、SLES 16 与 Debian 13 支持 MI350PMI350X 上新增 VMware ESXi 9.1 虚拟化配置以及在 MI355X/MI350X 上启用 DPX 与 CPX 计算分区模式配合 NPS2 内存分区的 SR-IOV 多虚拟功能VF分区支持。Toolkits面向领域的扩展工具包入口页的第四个板块是Toolkits——面向领域应用的高性能库开源集合。仓库列出了五个 ROCm 工具包ROCm Data Science数据科学、ROCm Finance金融、ROCm Life Science生命科学、ROCm LLMExtLLM 扩展与 ROCm Simulation仿真。结合 docs/about/release-notes.md 的未来变更章节可以确认这一策略未来版本将增加更多领域专用扩展工具包数据科学、生命科学、金融、仿真及其他 HPC 领域这与 Core SDK 向精简核心 领域扩展演进的路线完全一致。安装与兼容性从零开始的实操路径安装前的兼容性验证无论选择哪种安装方式官方流程都要求先通过 兼容性矩阵 确认硬件与系统组合受支持。矩阵覆盖 LinuxUbuntu、Debian、RHEL、Oracle Linux、Rocky Linux、SLES与 WindowsGPU 目标包括 CDNA4/CDNA3/CDNA2Instinct与 RDNA4/RDNA3Radeon等架构见 README.md。如果 GPU 不在官方支持列表中仍可能通过 TheRock nightly 构建获得社区启用支持。安装方式与安装前准备安装指南 支持多种安装方式包括包管理器apt/dnf/zypper、Runfile 安装器、pip 与 tarball。以 Runfile 方式为例命令取自 docs/install/include/200-install.rst# 下载 Runfile 安装器 wget https://repo.radeon.com/rocm/installer/rocm-runfile-installer/rocm-rel-7.14/rocm-installer-7.14.0-7.run # 安装内核驱动amdgpu安装后需重启 bash rocm-installer-7.14.0-7.run depsinstall amdgpu以 Ubuntu 包管理器方式为例同一文件的真实命令# 1. 下载并安装 GPG key sudo mkdir --parents --mode0755 /etc/apt/keyrings wget https://repo.amd.com/rocm/packages-multi-arch/gpg/rocm.gpg -O - | \ gpg --dearmor | sudo tee /etc/apt/keyrings/amdrocm.gpg /dev/null # 2. 注册 ROCm 仓库 sudo tee /etc/apt/sources.list.d/rocm.list EOF deb [archamd64 signed-by/etc/apt/keyrings/amdrocm.gpg] https://repo.amd.com/rocm/packages-multi-arch/ubuntu2404 stable main EOF sudo apt update # 3. 安装核心 ROCm 包 sudo apt install amdrocm7.147.14.0 的 Runfile 安装器还引入了多项新能力见 发布说明多 GPU 架构支持单次安装可装一个或多个 GPU 架构、自动探测 GPU 并安装匹配架构、按架构查询/选择性卸载、灵活的组件选择core运行时库与工具为默认项另有core-dev开发头文件、dev-tools调试分析工具、core-sdk综合 SDK、opencl运行时支持、可选的图形支持Mesa/OpenGL启用时附带amdgpu-lib包、构建与清单信息查看以及统一安装器一个安装文件支持所有 Linux 发行版。安装前置条件GPU 访问权限安装 ROCm 前的关键前置步骤之一是配置 GPU 访问权限docs/install/include/100-prerequisites.rst 给出了两种方法方法一用户组方式默认机制GPU 访问由video与render组控制# 将当前用户加入 render 和 video 组 sudo usermod -a -G render,video $LOGNAME方法二udev 规则系统级、更灵活可免去用户组管理并实现细粒度 GPU 访问sudo tee /etc/udev/rules.d/70-amdgpu.rules EOF KERNELkfd, GROUPrender, MODE0666 SUBSYSTEMdrm, KERNELrenderD*, GROUPrender, MODE0666 EOF sudo udevadm control --reload-rules sudo udevadm trigger两种方式应用后均需重启系统生效。卸载与升级注意事项安装指南 明确指出如果系统已安装 ROCm 7.2.4 或更早版本升级前需要先卸载旧版本再继续。Windows 用户还需注意不要将 ROCm 编译器与运行时 DLL 复制到 System32以免引发冲突。性能验证与运维辅助ROCm Extras除 Core SDK 外仓库还提供ROCm Extrasdocs/components/extras.rst用于基准测试、验证与管理 ROCm 部署的补充工具不参与 GPU 应用开发但适合验证硬件健康、测量系统性能与管理 GPU 集群。核心工具包括ROCm Validation SuiteRVS验证 ROCm 安装与 AMD GPU 硬件的测试套件覆盖 GPU 功能、内存、电源行为与点对点通信帮助诊断安装问题与硬件故障TransferBench在用户指定设备CPU、GPU、NIC之间对同时进行的存储器传输做基准测试的实用工具随 RVS 一同安装。另外发布说明 提到 ROCm Bandwidth TestRBT在 7.14.0 达到生命周期终点功能由 TransferBench 与 RVS 承接——迁移时建议优先采用这两个工具。仓库布局与进一步探索想深入理解 ROCm 的文档与数据组织方式可以从以下仓库路径继续阅读docs/index.md入口页本文骨架docs/about/what-is-rocm.rstROCm 平台定义与 Core SDK/Extras 概览docs/components/core.rstCore SDK 七大组件分组的模板与渲染逻辑docs/data/components.yamlCore SDK 组件清单数据源docs/data/components-default.yaml 与 docs/data/components-previous.yaml 为对照数据docs/compatibility/compatibility-matrix.rst兼容性矩阵与系统要求docs/install/rocm.rst完整安装指南docs/about/release-notes.md7.14.0 发布说明、已知问题与解决记录docs/about/transition-guide-TheRock.mdTheRock 迁移指南README.md仓库总览与核心组件清单。ROCm 的设计脉络可以用一句话概括以精简的 Core SDK 为底座用 HIP 提供 CUDA 兼容的可移植编程模型通过 AI 生态与领域 Toolkit 覆盖上层工作负载再以兼容性矩阵、驱动与运维工具保证规模化部署的可靠性。从入口文档出发沿着上述仓库路径逐层深入你就能建立起对 AMD ROCm 软件栈完整而准确的技术认知。【免费下载链接】legacy-rocm-buildAMD ROCm™ Software - GitHub Home项目地址: https://gitcode.com/GitHub_Trending/ro/legacy-rocm-build创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考