如何在 Windows 和 Linux 上安装 AMD ROCm:分步指南和兼容性

最后更新: 27/10/2025
作者: 艾萨克
  • ROCm 将 CPU 和 GPU 集成到一个开放平台中,​​重点在于 Linux 以及先前的支持 Windows 适用于 PyTorch。
  • 兼容性不断增强:RDNA 4、部分 RDNA 3 型号,以及对 Ryzen APU 的初步支持。
  • 灵活的安装方式:软件包管理器、多版本、运行文件和离线模式。
  • 坚实的生态系统:PyTorch/TensorFlow、vLLM、JAX(推理)、带有 MIGraphX 的 ONNX Runtime 和性能实用程序。

Windows 和 Linux 系统上安装 AMD ROCm 的指南

如果您与 IA如果您从事高性能计算或科学计算,并且拥有 Radeon GPU 或 Ryzen APU,那么您可能听说过 ROCm。 AMD 的平台旨在成为编程和加速 GPU 任务的开放基础。本书主要针对 Linux 系统,并在初步版本中针对某些情况提供 Windows 版本。在这里,您将找到安装和运行该软件的详细步骤。

首先,值得关注的是营销中经常被忽视的一点: 安装成功和性能很大程度上取决于 硬件操作系统和ROCm的确切版本以下各节汇总了所有关键信息(官方安装方法、兼容性等)。 技巧 性能、Windows 状态和真实体验)让您不会措手不及。

什么是 AMD ROCm?它为何如此重要?

ROCm是AMD面向高性能计算(HPC)和机器学习的软件栈。本质上, 集成 CPU 和 GPU 以加速密集型工作负载允许在以开源为主的生态系统中对内核进行编程并在 GPU 上运行。它一直以来专注于 Linux,因为它在 Linux 上提供最佳的支持和成熟度。

在桌子上, 与 Radeon 本地开发所用的 ROCm 基础相同 它还兼容数据中心中的 AMD Instinct 加速器(CDNA 架构)。这种兼容性使得团队可以轻松进行开发,然后无需重复工作即可大规模部署,并利用同一套库和工具。

对于人工智能而言,这意味着像 PyTorch 或 TensorFlow 这样的框架可以在 AMD GPU 上运行,以及 推理和训练的关键工具目标很明确:为研究、工程和生产工作负载提供开放且可扩展的途径,而无需专有技术锁定。

AMD ROCm 硬件和系统兼容性

硬件和平台兼容性

ROCm 7.0.2 版本因其扩展的兼容设备范围而脱颖而出。 支持 Radeon 9000 系列(RDNA 4)和部分 7000 系列型号(RDNA 3)它还引入了对 Ryzen APU 的初步支持,为在紧凑型和高性能计算机上运行 AI 工作流程打开了大门。 手提 得益于共享内存(在某些情况下高达 128 GB)。

就...而言 操作系统, 在 Linux 上保持稳定的支持。其中特别提到了 Ubuntu 和 Red Hat Enterprise Linux 9.6。在 Windows 上,ROCm 对 PyTorch 处于“预览”阶段,无论是在 Radeon GPU 还是在某些 Ryzen APU 上,这都允许您开始进行原生开发,尽管需要注意预览版固有的注意事项。

一个重要的细节:并非所有 Radeon GPU 都受到所有版本的官方支持。 有用户指出,像 7800 XT 这样的型号似乎并非官方认可的兼容型号。 在某些版本的 Linux 版 ROCm 中存在兼容性问题。因此,在安装之前,建议查阅官方文档中的 AMD 兼容性列表,并确认 ROCm 和系统版本,必要时, 从 GPU-Z 导出日志.

就容量而言,桌面级Radeon显卡最高可配备48GB显存。 这使得本地工作站成为云的强大且私密的替代品对于那些需要在本地开发和数据中心部署之间切换的用户来说,与 Instinct 的交叉兼容性简化了迁移过程。

  申请 Cash App 卡的最佳方式是什么?

Linux 系统中的安装方法

AMD 记录了在 Linux 上安装 ROCm 的几种方法,旨在 不同的使用场景和环境限制如果您是 ROCm 新手,最好先阅读指南。 快速入门 官。

原生软件包管理器。这是 Ubuntu 或 RHEL 上的首选方法: 您可以使用系统管理器本身来安装、更新或卸载 软件包的优势在于它们能更好地与系统集成,并且您可以继承发行版原有的生态系统支持。如果您的发行版提供了合适的软件仓库,这种方法既方便又可复现。

安装一个或多个版本。当您需要测试兼容性、维护旧项目或检查回归问题时, 您可以并行安装多个版本的 ROCm。AMD 针对这些多版本场景发布了专门的流程,以隔离依赖关系并避免冲突。

ROCm 离线安装程序创建器。如果您的目标计算机无法访问互联网或环境是隔离的, 您可以创建离线安装包。 适用于 AMDGPU 驱动程序、ROCm 或两者。此实用程序会生成断开连接部署所需的一切。

ROCm Runfile 安装程序。作为包管理器的替代方案, 有一个“运行文件”安装程序 它允许您在有网络连接或无网络连接的情况下进行安装,并且无需依赖发行版的软件包管理系统。这在受控环境或需要特定版本时非常有用。

SUSE/SLES 用户请注意:在 SUSE Linux Enterprise Server 上安装之前, 注册并更新您的企业版 Linux 根据发行版自身的流程。这是避免依赖错误和获取必要软件仓库的先决条件。

在 Ubuntu 及其衍生版本上的实际安装

在最新的 Ubuntu 环境中,有一些安装流程是从……开始的。 由 AMD 员工维护的存储库 (并非官方方法)。其思路是将相应的软件仓库添加到你的版本中,然后安装所需的软件包。这种方法可以加快面向人工智能的测试和部署速度。

Ubuntu 版本。如果您运行的是 Ubuntu 24.04“Noble”或 22.04“Jammy”, 请根据您的版本调整存储库引用。。在 repo 下载行中将“noble”更改为“jammy”(或反之亦然)足以使软件包与您的特定版本对齐。

待安装软件包。这里有一个特别功能: 没有单一的元包“模式”。 此路径会拉取所有必需的文件,因此在某些过程中,组件会单独安装。此外,此路径通常还包含 FlashAttention 等库所需的编译依赖项。

Python 以及必要的工具。建议使用 Python 3.10 至 3.13 版本以及 Git。 按照最方便的顺序安装 ROCm、SDK 和 Python。 根据您使用的发行版,检查 PIP 和 virtualenv 是否已准备好创建隔离环境。这将允许您编译或安装适用于 ROCm 的正确 PyTorch 或 TensorFlow 绑定。

其他发行版。此方法主要在 Ubuntu 上测试过,但有些人也将其扩展到其他发行版。 openSUSE Leap 和 Slowroll 修改仓库和软件包名称。在这种情况下,请务必彻底验证仓库,因为这些场景尚未经过同等程度的官方测试。

ROCm 与 SD.Next:标志、Docker 和微调

如果您的目标是将稳定扩散下一代(SD.Next)与 AMD GPU 配合使用,那么流程非常简单: 首先安装 ROCm 库,然后使用 –use-rocm 标志启动 SD.Next。这将强制安装适合您的 ROCm 环境的正确版本的 Torch。

启动 初始性能较慢。首次使用时,例如首次更改分辨率后或更新 PyTorch 时,ROCm 会执行以下操作: 搜索最优核函数 这可能需要 5 到 8 分钟。每次分辨率提升都会发生一次;后续运行速度会快得多。

  什么是 BOT(二进制优化工具)?它与二进制机器人有何不同?

MIOPEN 控制。如果初始预热过程很麻烦,您可以调整环境变量: MIOPEN_FIND_MODE=FAST 降低 El Temppo 最初是以略微降低性能为代价的,而 MIOPEN_FIND_ENFORCE=搜索 它优先考虑最佳性能(但会加大初始启动的代价)。请根据您的工作流程明智地使用它们。

精度和 VRAM。在 RDNA 3 及更高版本的显卡上,SD.Next 可以自动检测 bf16在某些情况下,解码最终图像或使用无延迟放大器进行放大时,这会导致显存使用量激增(16 GB 或更多)。为了缓解这种情况,请设置 FP16 精度提高,并禁用 VAE 上行传输 在设置中。许多用户还发现强制使用 fp16 可以提升性能。

RDNA 3 上的 Flash Attention。为了充分利用交叉注意力机制的性能,您可以启用 CK 闪现注意力 在“计算设置”>“交叉注意力”>“SDP选项”中进行设置。这需要安装rocm-hip-sdk,因为它会在启动时下载并编译一个额外的软件包。

Docker:是或否?您可以选择 使用预构建的镜像 为了加快部署速度,或者您可以构建包含所需确切版本的自定义镜像。如果您希望完全控制依赖项,使用 Docker 和固定 requirements.txt 文件进行 DIY 部署是一个不错的实践。

兼容的生态系统和框架

ROCm 最新版本非常注重实用人工智能。 PyTorch 和 TensorFlow 已经建立了对训练和推理的支持。 在 Linux 系统上使用 Radeon 显卡。这种组合涵盖了当前大多数研究和部署工作流程。

对于大型和服务型机型, vLLM 已获得全面支持这有助于在 AMD GPU 上高效地进行 LLM 推理。如果您使用的是 JAX,目前支持主要集中在推理方面,因此如果您的流程依赖于 XLA 训练,请仔细规划。

在“C++优先”的世界里, llama.cpp 在 ROCm 上运行 它适用于快速、内存占用较小的推理,尤其适合需要可移植性和资源消耗精细控制的情况。对于边缘环境或资源受限的系统而言,它是一个绝佳的选择。

ONNX Runtime 与 MIGraphX 结合使用,扩展了部署范围。 扩展支持 INT8 和 INT4 在推理中。这有助于减少 VRAM 消耗并加快处理量化模型时的处理时间,同时又不牺牲可接受的生产精度。

最后,在高效训练部分, FlashAttention-2 启用反向传递这样可以提高 Transformer 的性能并减少内存使用量,如果您在本地训练或微调大型模型,这将是一个优势。

Windows 中的状态:预览和替代方案

这是 PyTorch 的首次亮相。 它在 Windows 上以“预览”模式获得官方支持 在 Radeon GPU 和 Ryzen APU 上,这对于那些无法切换到 Linux 的用户来说是个好消息,但同时也需要理解,目前仍有一些方面正在开发中,性能可能会随着每个版本的发布而有所提升。

如果您正在寻找替代方案,还有一些非官方支持,例如: 兹鲁达有些人使用这种方法在搭载 AMD 硬件的 Windows 系统上运行某些工作负载。例如: DirectML、ONNX 或 Olive 用于 Microsoft 生态系统中的模型加速和编译,每个工具都有其特定的细微差别和局限性。

值得强调的是,由于它目前处于预览阶段, 在 Windows 上使用 ROCm 运行 PyTorch 可能无法涵盖所有​​情况 它们也不具备像 Linux 那样的稳定性。如果您的项目至关重要,请考虑在 Linux 上使用双启动环境或容器,因为 Linux 的技术栈更加成熟。

性能和故障排除:优点、缺点以及您应该检查的内容

用户体验差异很大。一方面, 兼容性和性能均有明显提升 每次发布新版本,尤其是在应用人工智能(PyTorch、TensorFlow、vLLM)领域,都会有报告描述令人沮丧的安装问题,例如依赖项错误或软件包与系统不兼容。

  在互联网上免费阅读 EPUB 的 7 个最佳程序

一个现实生活中的例子涉及一位测试用户 Metal 中的六个 Ubuntu 发行版 而且,在所有这些情况下,amdgpu_install 都返回了缺失或不兼容的软件包。我将结果与……进行了比较 Nvidia公司 (其中安装 驱动程序 发现它“轻而易举”,并批评了市场营销与现实不符的情况,因为其 7800 XT 没有被 ROCm 列为 Linux 上的官方支持产品。

在这种情况下,第一步是审查 硬件兼容性矩阵和版本 AMD官方对特定GPU缺乏支持通常是导致安装失败或崩溃的原因。第二步是确保所使用的发行版、内核和ROCm版本与AMD官方文档中明确列出的“适用于”该硬件的版本相匹配。

如果仍然遇到困难,请考虑其他方法: 使用运行文件进行安装此外,还可以使用离线安装程序创建工具,或者在特定情况下,使用由 AMD 员工维护的软件仓库。同时,保留多版本选项,以便在不影响主环境的情况下尝试旧版本或新版本。

为了获得最佳性能,请记住以下设置: MIOPEN_FIND_MODE 和 MIOPEN_FIND_ENFORCE检查精度(在 RDNA 3+ 架构上,fp16 通常是平衡 VRAM 和速度的稳妥选择),并在适用时启用 CK Flash Attention。这些小小的改动就能显著缩短推理时间并降低功耗。

社区和有用资源

社区在日常生活中扮演着重要的角色。如果你能运用创意流程, 非官方的 ComfyUI 子版块 这是一个分享技巧、窍门和工作流程的好地方。他们要求你发布的内容适合所有年龄段观看,避免付费工作流程,围绕主题展开,最重要的是,要善待新手。

此外,您还可以轻松找到脚本和配置。 自动化 ROCm 安装、使用兼容的 PyTorch 设置环境,或调整 SD.Next。请务必将阅读的内容与官方文档和当前支持矩阵进行交叉引用,以免浪费时间。

如果你是新手,AMD的建议很明确: 请使用快速入门指南 然后,在明确高级方法(多版本、运行文件、离线)能解决什么具体问题之后,再逐步扩展到这些高级方法。这样可以避免不必要的返工。

概述。让我们重点关注以下几个关键部分: 目前,基于 Linux 的 ROCm 是最稳定的方案。 对于 Radeon GPU;Windows 系统目前处于构建阶段,PyTorch 处于“预览”阶段;硬件兼容性非常重要;并且有一些经过验证的工具(vLLM、带有 MIGraphX 的 ONNX Runtime、llama.cpp、FlashAttention-2)可以为真正的 AI 和计算工作流程提供强大的支持。

任何想要为爱荷华州设立私人本地车站的人都有一条路线。 Radeon显卡,最高配备48GB显存对于那些寻求笔记本电脑或小型台式机的用户来说,可以考虑采用共享内存的 Ryzen APU。同时,Docker 和其他安装程序则为受控环境或离线环境提供了解决方案。

虽然不能承诺奇迹,但只要安装合适的零件并选择适合您硬件的版本, ROCm 使您能够构建一个严肃而高效的环境 适用于人工智能和高性能计算,无论是在开发还是部署阶段。如果第一次尝试失败,也无需担心:社区和文档可以帮助您进行微调。

什么是 AMD ROCm 以及如何安装它?
相关文章:
什么是 AMD ROCm 以及如何安装它?