撰文:Techub News 整理
导语
2025年6月,AMD 在其年度 Advancing AI 活动上,于硅谷举办了一场信息量巨大的主题演讲。AMD 董事会主席兼 CEO 苏姿丰(Lisa Su)博士携多位重量级合作伙伴登台,共同描绘了 AI 计算的未来图景。在 ChatGPT 发布后 AI 以惊人速度发展的背景下,这场活动不仅是对 AMD 过去一年成果的检阅,更是对其未来战略——尤其是在与英伟达等巨头的激烈竞争中——的一次关键宣言。苏姿丰强调,在构建从 CPU、GPU 到 DPU 的广泛产品组合之外,“信任”与“开放”是 AMD 引领 AI 未来的核心。
摘要
- 发布 MI350 系列:AMD 推出新一代 Instinct MI350 AI 加速器,相比前代实现高达 4 倍的 AI 计算性能代际提升,配备 288GB HBM3E 内存,主打高效推理,宣称在部分场景下比竞品 B200 性价比高 40%。
- 预览未来平台 MI400 与 Helios 机架:首次展示 2026 年推出的 MI400 系列加速器及 Helios AI 机架,这是一个从头设计的统一机架级系统,集成下一代 EPYC “Venice” CPU、MI400 GPU 和 “Volcano” AI NIC,目标性能提升高达 10 倍。
- 强调开放软件生态 ROCm:宣布 ROCm 7 软件平台,通过与 PyTorch、vLLM、SGLang 等开源社区深度合作,显著提升易用性与性能,并强调开源框架在功能与性能上已开始超越封闭替代方案。
- 展示广泛的客户与合作伙伴生态:xAI、Meta、Oracle、Microsoft、Cohere 等客户现场分享使用 AMD Instinct 平台的经验,印证其在实际生产环境中的部署与效能,并共同强调开放合作与全栈优化的重要性。
- 描绘 AI 基础设施未来趋势:指出推理需求正以每年超 80% 的速度增长,成为 AI 算力主要驱动力;智能体(Agentic AI)将催生海量“虚拟用户”,同时消耗 GPU 和大量 CPU 资源;主权 AI 和超大规模集群(如 Oracle 的 2.7 万 GPU 集群)成为新焦点。
AI 市场演进:从训练到推理与智能体爆发
苏姿丰在开场回顾了过去九个月的行业剧变:更强大的推理模型、智能体(Agentic AI)的崛起,以及 AI 应用开始大规模部署。她指出,训练仍是模型开发的基础,但推理需求正以每年超过 80% 的速度增长,成为 AI 算力最大的驱动力。这得益于模型能力的提升和新用例的不断涌现。
苏姿丰特别强调了“智能体 AI”这一新趋势,她将其称为“一类新的用户”。这些智能体永不间断地访问数据、分析应用和系统,自主做出决策。这不仅需要高性能 GPU 进行实时洞察生成,更会催生海量的传统 CPU 计算需求。“我们实际上正在向全球计算基础设施中添加相当于数十亿新虚拟用户,”她总结道,这需要 GPU 和 CPU 在开放生态中协同工作。
基于此,AMD 更新了其市场预测。去年预计 2028 年数据中心 AI 加速器市场规模将达 5000 亿美元,而苏姿丰现在表示,基于当前趋势,这一数字将会更高。她重申了 AMD 的战略三支柱:提供广泛的计算引擎组合;投资于开放、开发者优先的生态系统;提供集硬件、软件、合作伙伴于一体的全栈解决方案。
MI350 系列发布:为规模化推理而生的性能怪兽
本次活动的硬件主角是 Instinct MI350 系列,包括 MI350 和散热与功耗设计更激进的旗舰型号 MI355。苏姿丰称这是 Instinct 历史上最大的一次代际性能飞跃。MI355 基于第四代 CDNA 架构,采用 3D 先进封装,集成了 1850 亿个晶体管,并支持新的 FP4 数据格式和最新的 HBM3E 内存。
其核心规格令人印象深刻:288GB 的行业领先内存容量,可在一张 GPU 上运行高达 5200 亿参数的模型;FP4 算力高达 161 PetaFLOPS;在服务器层面,一台 MI355X 服务器可提供 2.3TB 的 HBM3E 内存。苏姿丰强调,MI350 系列采用了与 MI300/325 相同的行业标准 UBB 接口,使其能够轻松部署到现有的数据中心基础设施中。
性能方面,AMD 设定了 3.5 倍代际提升的目标并宣称已实现。在 Llama 3.1 模型上,MI355 在代码补全等实时应用所需的超低延迟下,吞吐量提升了 35 倍。在聊天机器人、内容生成等广泛 AI 应用中,性能提升最高达 4.2 倍。在 DeepSeek、Llama 4 Maverick 等模型上,每秒生成的 token 数量可达前代的三倍。
与竞争对手的对比是重头戏。苏姿丰展示的数据显示,在运行 DeepSeek R1 或 Llama 3.1 时,使用 SGLang、vLLM 等开源框架的 MI355,其每秒生成 token 数比英伟达 B200 高出最多 30%,甚至与更昂贵、更复杂的 GB200 系统性能持平。她特别指出,这证明了开源软件框架已经取得了巨大进步,其性能可以超越封闭的、供应商特定的生态系统。
更重要的是成本效益。苏姿丰表示,结合更低的资本支出,MI355 可以比竞争解决方案提供高达 40% 的“每美元 token 数”优势,这为云服务商和企业带来了更高的吞吐量、更好的能效和更优的总体拥有成本(TCO)。
客户证言:xAI、Meta、Oracle 的实战经验
为了佐证 MI 系列的实力,苏姿丰邀请了多位核心客户上台分享。
xAI 联合创始人肖崧(Xiao Sun)分享了其小团队如何与 AMD 紧密合作,将 Grok 系列模型部署在 MI300X 上的经历。他用“ effortless ”(毫不费力)来形容使用体验,强调 AMD 工程师适应了 xAI 的快节奏,甚至常在晚上 9 点或午夜通电话解决问题。肖崧还盛赞了 AMD 的年更新节奏,并从第一性原理出发,展望了从硅片到产品的“人类历史上最大规模的协同设计”,呼吁全球人才加入这场变革。
Meta 工程副总裁 Yee Jiun Song 表示,MI300X 加速器已是其基础设施的关键部分,被广泛用于 Llama 3 和 Llama 4 的推理,并因其高性能和优异的 TCO 而扩展至训练和关键的排名、推荐工作负载。他对 MI350X 带来的显著算力提升、新一代内存和 FP4/FP6 支持感到兴奋,并强调 Meta 与 AMD 在从 EPYC 到 Instinct 的整个路线图上紧密合作。他预测,AI 不仅改进现有产品,更催生全新产品,驱动着前所未见的基础设施投资规模。
Oracle 云基础设施(OCI)执行副总裁 Mahesh Thiagarajan 阐述了与 AMD 的深度全栈整合。从为数据库提供动力的 EPYC CPU,到实现硬件级网络虚拟化的 Pensando DPU,再到 Instinct AI 加速器,OCI 利用 AMD Infinity Fabric 等技术,将数据以“AI 速度”移动到加速器附近。他宣布 OCI 将在两个月内上线一个超过 27,000 个 GPU 的单一集群,以支持zettascale(十万亿亿次级)规模的 AI 计算。Thiagarajan 认为,AMD 与 Oracle 的合作核心是为客户带来“价格性能比”的价值。
ROCm 7 与开放生态:软件成为差异化关键
AMD 深知,再强大的硬件也需要软件来释放潜能。AMD 高级副总裁、AI 业务总经理 Vamsi Bopanna 登台,重点介绍了 ROCm 开放软件平台的进展。他表示,通过与开源生态的深度合作,ROCm 正在提供一个“行业可以信赖的可靠替代方案”。
Bopanna 宣布推出 ROCm 7,其重点包括:大幅提升易用性,新功能和优化现以每两周一次的节奏发布;Llama、DeepSeek 等领先模型实现“第零日”支持;首次在 MLPerf 训练基准测试中展示了领先性能。他特别指出,超过 180 万个 Hugging Face 模型现在可以在 ROCm 上开箱即用。
在推理方面,ROCm 7 实现了超过 3.5 倍于 ROCm 6 的性能提升。Bopanna 强调,开源推理服务框架(如 vLLM、SGLang)的功能迭代速度和性能事实上正在超越专有替代方案。例如,通过与这些社区合作,MI355 在运行 DeepSeek FP8 模型时,吞吐量比 B200 高出 1.3 倍。
Microsoft AI 平台公司副总裁 Eric Boyd 作为合作伙伴登场,分享了在 Azure 上部署 AMD Instinct 的经验。他表示,Instinct 芯片的大内存和高带宽为服务大语言模型带来了出色的 TCO 优势,并已成功用于从 OpenAI 的 GPT-4 系列到开源模型 DeepSeek 的推理。更引人注目的是,微软研究团队已经使用 2100 块 MI300X 成功训练了一个最先进的多模态模型,证明了其训练能力。
Cohere 联合创始人兼 CEO Aidan Gomez(Transformer 论文作者之一) 则从模型公司的视角分享了使用 ROCm 进行训练的经验。他表示,Cohere 专注于为金融、医疗等高度监管的行业提供安全、私密的 AI,其 AI 工作空间“North”需要复杂的 AI 智能体。在 AMD 平台上,他们不仅进行推理,也运行训练工作负载,并且能够自信地进行大规模扩展。
主权 AI 与未来基础设施:从 UALink 到 MI400
苏姿丰将话题转向全球性的“主权 AI”趋势。AMD 正在与各国政府和研究机构合作,构建对其经济至关重要的高性能计算和 AI 基础设施。目前,AMD 在全球有超过 40 个活跃项目。她以收购的 Silo AI 团队为例,说明其如何与欧洲企业和政府合作,开发符合国家优先事项的模型。
更具体的案例是 AMD 与沙特新成立的公司 Humain 的合作。Humain CEO Tareq Amin 宣布与 AMD 成立合资公司,计划利用沙特丰富的土地和能源(包括传统能源和可再生能源),建设超大规模 AI 数据中心。他承诺,通过与 AMD 的合作,能为全球 AI 开发者降低高达 30% 的拥有成本,并公布了雄心勃勃的建设计划:2030 年达 1.9 吉瓦,2034 年达 6 吉瓦。
对于更大规模的 AI 集群互联,AMD 及其合作伙伴强调了开放标准的重要性。Astera Labs CEO 和 Marvell 高管分别介绍了对新兴标准 UALink(用于机架内 GPU 高速互联)和 Ultra Ethernet Consortium(UEC)(用于数据中心级规模扩展)的支持。UEC 1.0 标准已于2025 年 6 月正式发布,而 AMD 的 Pensando DPU 已成为业界首款支持 UEC 的 NIC。
所有这些技术最终汇聚于 AMD 对未来 AI 基础设施的终极愿景。苏姿丰重磅预览了定于 2026 年推出的 Instinct MI400 系列及 Helios AI 机架。Helios 被设计为一个统一的机架级系统,集成了下一代 EPYC “Venice” CPU(基于 2nm 工艺,Zen 6 架构)、MI400 GPU 和 “Volcano” AI 网络芯片。其目标是将多达 72 块 GPU 连接为一个单一的巨大计算引擎,提供 260 TB/s 的机架内带宽和 2.9 ExaFLOPS 的 FP4 性能。与竞争对手相比,AMD 宣称 Helios 将提供高出 50% 的 HBM4 内存容量、内存带宽和扩展带宽。苏姿丰预计,MI400 系列将为最前沿的模型带来高达 10 倍的性能提升。
与 Sam Altman 对话:AGI 之路与硬件协同设计
演讲的高潮部分是苏姿丰与 OpenAI 创始人兼 CEO Sam Altman(萨姆·奥尔特曼) 的对话。Altman 分享了当前 AI 发展的观察:模型已经变得足够好,使得人们能够构建真正伟大的产品,并且企业应用正在快速采纳。他特别指出,向“推理模型”的转变(模型进行长时间“思考”后给出答案)对模型效率、长上下文和算力(包括大量 CPU)提出了新的压力。
当被问及需要多少 GPU 时,Altman 给出了一个引人深思的回答:“理论上,在某个时间点,你会看到地球上相当大一部分电力将用于运行 AI 计算。也许我们正在朝着这个方向前进。”
Altman 透露,OpenAI 已经是 AMD MI400(代号 MI450)系列的早期设计合作伙伴,并对其内存架构大加赞赏,认为它对于推理“非常出色”,对于训练也可能是一个“不可思议的选择”。他回忆起初次听到 MI450 规格时的反应:“我当时想,‘这不可能’,这听起来太疯狂、太大了。” 他高度评价了 AMD 与 OpenAI 工程团队之间紧密的协同设计关系,并强调“灵活性”是关键,因为一切变化太快。
展望未来,Altman 预测,从 2020 年代初到 2025 年中的进步速度将在本世纪下半叶得以保持。到 2030 年,AI 系统将能够进行新颖的科学发现、运行极其复杂的社会功能。实现这一目标需要整个行业在研究、工程和硬件上进行深度协作。“如果我们能做到这一点,我们就能保持这条(增长)曲线。” Altman 总结道。
苏姿丰在最后总结中强调,AI 的未来不会由任何一家公司或在封闭的生态系统中构建,它将由整个行业的开放合作塑造。AMD 正以前所未有的速度,通过其全面的硬件组合、坚定的开放软件战略和广泛的合作伙伴生态,为这场塑造未来的竞赛提供关键动力。


