首页 / 资讯 / AMD想让AI智能体完成工程师从未能对CUDA做到的事
AMD

AMD想让AI智能体完成工程师从未能对CUDA做到的事

2026年8月7日7 分钟阅读
AMD想让AI智能体完成工程师从未能对CUDA做到的事

专栏概述

十七年来,让NVIDIA的GPU业务无懈可击的从来不是芯片本身,而是建立在芯片之上十七年积累的肌肉记忆——数百万行CUDA内核代码、调优技巧和机构习惯,让切换到其他任何平台都感觉像重新学走路。AMD在7月22日至23日于旧金山举行的"Advancing AI 2026"大会上给出的答案是:不再试图在工程能力上超越这条护城河,而是把重新学习这件事交给机器。其赌注在于,AI编程智能体可以在数周内完成人类工程师数年都不愿尝试的工作:为AMD的ROCm技术栈移植和重新调优CUDA工作负载,而无需任何员工先成为ROCm专家。

AMD实际发布了什么

核心产品是ROCm.AI,一个构建在ROCm之上的AI原生层,将于2026年8月开始推出,由三个旨在协同工作而非独立交付的组件构成。ROCm CLI为开发者提供了一条统一的命令行路径,用于在AMD硬件上安装、验证、服务、更新和排查AI工作负载——这类不起眼的基础设施工作决定了平台是给人完整成熟的感觉,还是永远处于测试版状态。AMD Skills是更具争议性的部分:它将AMD编写的专业知识直接嵌入开发者日常使用的编程助手(包括Claude Code、Cursor和Codex)中,使开发者可以用自然语言描述意图,让智能体处理AMD特定的GPU编程,而无需手写内核。最后是Hyperloom,一个开源智能体系统,旨在自动化优化AMD硬件上的端到端推理工作负载。

综合来看,其卖点不是"我们的芯片更快"——MI300X的原始规格已经证明了这一点,192GB的HBM3内存是NVIDIA H100的2.4倍,且价格具有竞争力。卖点是"我们的芯片终于可用了,你不需要自己完成最困难的部分"。这是一个值得深思的区别,因为它重新定义了整个竞争格局。AMD不再试图赢得基准测试之战,而是试图赢得劳动力成本之战,押注智能体辅助移植的边际成本会快速下降,使ROCm的采用成为理性的默认选择,而非一次信仰之跃。

鸡生蛋蛋生鸡的问题,被自动化解决

MI300X的内存优势已经存在了一段时间,却未能转化为市场份额,原因是一个熟悉的陷阱:开发者不会在工具成熟之前投入大量工程时间到ROCm,而工具在没有大量开发者压力测试的情况下又无法成熟。NVIDIA在AI GPU市场约80%的份额对AMD的5-7%,在很大程度上是这种僵局的纪念碑,而非任何永久性技术差距的体现——ROCm 7现在在大多数工作负载上的性能已达到CUDA的10%-30%以内,与几年前数倍甚至数十倍的差距已不可同日而语。

ROCm.AI直接攻击的是鸡生蛋蛋生鸡的动态本身,而非性能差距。其逻辑是:如果智能体能够承担调优负担,那么对于决定在哪里构建的新项目来说,"等它成熟再说"的借口就不再成立。这也正是AMD自身的表述值得质疑的原因:这是一家供应商在描述自己打破护城河的武器,而打破护城河的武器在主题演讲中听起来总比在凌晨两点的生产事故中要成熟得多。一些分析师指出了隐藏在智能体叙事之下的更平凡的风险——AMD可能根本没有足够的自有GPU集群来以企业客户最终要求的规模进行自用测试和实战检验。一个对内核优化自信满满但实际错误的智能体,可能比没有智能体更糟糕,而唯一能知道你构建的是哪一种的方法,是先在大规模真实工作负载上运行它。

NVIDIA不会坐以待毙,资金数据说明原因

将ROCm.AI解读为NVIDIA突然转入防守将是一个错误。CUDA在AI开发框架中仍占据约92%的份额——这个数字甚至超过了NVIDIA的硬件份额,反映出从研究代码到生产管线的AI技术栈中有多少是默认CUDA在其下运行而编写的。而NVIDIA对AMD正在逼近的推理层威胁也有自己的回应:TensorRT-LLM,专有的推理优化软件,旨在将AI管线中最高流量、对成本最敏感的工作负载锁定在NVIDIA的技术栈内,即使ONNX Runtime、vLLM和Triton等开放标准正推动模型走向硬件无关化。

然后是让整个竞争看起来不对称的数字:仅Blackwell一代预计就将在2026年为NVIDIA带来约3200亿美元的数据中心收入。这不仅仅是记分牌上的数字——这是燃料。如此规模的收入会直接再投资回CUDA、cuDNN和TensorRT,使下一代硬件比上一代更难被撼动,进而产生更多收入,为再下一代提供资金。这是一个飞轮效应,AMD的智能体赌注目前还没有对应的机制,因为Hyperloom和AMD Skills仍是尚未产生收入的基建投资,而非自我供血的循环。

裂缝究竟在哪里

自AMD主题演讲以来流传的"AI正在瓦解NVIDIA帝国"的说法是真实的,但它比听起来要狭窄得多,值得精确审视。结合更广泛的工具趋势——PyTorch的torch.compile日益将硬件差异从模型代码中抽象出来,OpenAI的Triton推动一次编写、多后端运行的GPU编程——浮现出的并非对CUDA存量安装基础的正面进攻,而是集中在两个特定领域的侵蚀:推理工作负载(经济性奖励每token服务成本最低的技术栈)和新建项目(没有既有CUDA投资需要保护,切换成本尚未固化)。

没有开裂的——至少在这个时间线上不会——是已经大规模运行的基于CUDA的训练和生产系统的深井。无论智能体写内核有多出色,重新优化和重新验证这些存量安装基础的成本仍然高得令人望而却步,分析师在这一点的共识是一致的:ROCm和Triton不会一夜之间取代CUDA。2026年及以后更有趣的问题不是AMD的智能体是否有效——而是"足够好且自动化"能否在边际上足够频繁地击败"最好但根深蒂固",从而累积成更大的成果。NVIDIA押注3200亿美元赌它不会。AMD押注的是,它不需要在所有地方获胜,只需要赢得下一个尚未选边站队的工作负载。

AMDNVIDIA