8月28日,AMD发布了GPU加速计算开放软件堆栈ROCm的10.0.0版本。这一版本号旨在纪念ROCm诞生十周年。新版本将重心放在Instinct、Radeon、Ryzen AI平台上的AI推理、开发者工具与性能分析能力上,同时扩展了GPU与虚拟化支持范围。
ROCm(Radeon Open Compute)是AMD推出的开源计算平台,对标NVIDIA的CUDA生态,为高性能计算和AI工作负载提供底层软件支撑。此次10.0.0版本的发布,标志着该平台在经历十年迭代后进入新的发展阶段。AMD在版本说明中强调,新版本针对AI推理场景进行了专项优化,意图在生成式AI和大型语言模型部署需求持续增长的背景下,提升其硬件在推理环节的竞争力。
在硬件支持方面,ROCm 10.0.0新增了对8GB与4GB显存版本Radeon RX 9050显卡的支持,进一步降低了开发者使用AMD消费级GPU进行AI开发的入门门槛。同时,该版本扩展了虚拟化支持,使更多企业用户能够在虚拟化环境中运行ROCm工作负载,这对于需要资源隔离和灵活调度的云服务场景具有重要意义。
软件栈的更新覆盖了主流AI框架。ROCm 10.0.0升级了对PyTorch、JAX、vLLM、SGLang、MIGraphX和ONNX Runtime的支持,这些框架是当前AI模型训练与推理的核心工具链。通过同步优化底层运行库,AMD旨在确保其硬件在主流AI生态中能够获得更稳定的性能表现。此外,新版本改进了HIP(Heterogeneous Interface for Portability)性能,HIP是AMD提供的异构计算接口,允许开发者将CUDA代码迁移至AMD平台运行。数学库、稀疏计算库和通信库也在此次更新中同步迭代。
值得关注的是,AMD同步向用户开放了ROCm.AI服务。这是一套利用人工智能技术加速AMD硬件上开发速度和性能优化的工具集,包含三个核心组件:ROCm Hyperloom自主智能体系统、AMD Skills技能库和ROCm CLI命令行界面。其中,Hyperloom系统旨在通过智能体自动执行部分开发与调优任务,减少开发者在性能分析上的手动操作;Skills技能库则提供了可复用的优化模块;ROCm CLI则简化了命令行操作流程。这些工具的推出,反映出AMD正在尝试将AI能力引入开发者工具链本身,以降低使用门槛并提升开发效率。
从行业视角看,ROCm 10.0.0的发布是AMD在AI算力市场竞争中的一次关键落子。当前,NVIDIA凭借CUDA生态的成熟度在AI加速计算领域占据主导地位,而AMD通过持续完善ROCm的框架兼容性、硬件覆盖范围和开发者体验,试图在AI推理这一增长最快的细分市场建立差异化优势。此次对消费级GPU的扩展支持,以及AI辅助开发工具的引入,均指向更广泛的开发者群体和更轻量化的部署场景。
随着AI推理需求从云端向边缘和终端设备扩散,AMD在ROCm中同时覆盖Instinct数据中心GPU、Radeon消费级显卡和Ryzen AI处理器,显示出其构建全栈AI计算能力的意图。ROCm 10.0.0的发布,为开发者在AMD平台上构建和部署AI应用提供了更完整的软件基础,其后续生态建设效果值得持续观察。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。