推理芯片之战:聊聊Groq、Cerebras与OpenAI三大路径与Bill Dally的设计哲学(点击收听本期音频👆)
采访|泓君
图文|朱婕
过去几年,推理消耗的token爆炸式增长,token经济随之成型,推理专用芯片也持续升温:去年年底,英伟达以约200亿美元与AI芯片初创公司Groq达成技术授权协议,并吸纳其创始人Jonathan Ross等核心团队,被外界视为一次变相收购(acqui-hire);做晶圆级“大芯片”的Cerebras今年6月…AI推理的新浪潮:英伟达在GTC 2026大会上深化与Groq的合作英伟达在GTC 2026前夕强调,AI领域的重点正从“能多快完成训练”转向“能多好提供服务”。如果说过去的训练阶段开启了现代AI时代,那么现在恰当的推理阶段正成为实际盈利的关键。
黄仁勋在近期财报会议上暗示,英伟达计划利用Groq的解码器技术进一步强化低延迟推理系统,并将在GTC公布具体细节。这是在保持架构兼容性的同时,最大化性能提升与成本效益的努力。
“…英伟达,与Groq签订28万亿韩元AI芯片合同…通过“反向收购”将技术与人才尽收囊中英伟达(NVDA)与AI推理技术初创公司Groq达成非独家技术许可协议,成为该行业史上最引人注目的交易之一。此次许可协议金额约达200亿美元(约合288万亿韩元),通过该协议,Groq部分核心人员也将加入英伟达。其中包括Groq联合创始人兼前首席执行官乔纳森·罗斯以及总裁桑尼·马德拉等。
业内将此类交易称为"反向人才收购(RAA·reverse acqui…XRP,11月反弹可能性引发AI期待……ChatGPT·Groq提出“最大涨幅281%”情景10月是市场整体呈现明显下跌趋势的时期,大多数加密货币都录得大幅下跌。瑞波币也不例外。尤其在币安交易所,瑞波币价格经历了跌破1美元的暴跌,加剧了投资者的不安心理。然而,市场对行情反弹的期待依然存在,时值11月,多个人工智能模型发布了关于瑞波币未来前景的预测。
OpenAI的ChatGPT对瑞波币给出了"温和上涨"的预期,但并未过于乐观。其提出的基本情景是恢…英伟达 Groq 3 LPX 芯片全面投产,Gemma 4 31B 推理速度达每秒 3400 tokenTechub News 消息,英伟达宣布其 Groq 3 LPX 推理芯片已进入全面生产阶段,在 Gemma 4 31B 模型上实现每秒 3400 token 的推理速度,宣称比 Cerebras 快四倍。但实际性能对比更为复杂,英伟达需要至少 64 个加速器才能达到此速度,而 Cerebras 仅需一至两个。该架构在大型 MoE 模型上的扩展能力仍有待观察。 (The Decoder)英伟达称 Groq 3 LPX 服务器机柜进入全面量产Techub News 消息,英伟达宣布,由 Groq 设计、三星制造的 Groq 3 LPX 服务器机柜已进入全面量产阶段。该产品为 AI 加速卡机柜,每个机柜包含 256 颗 Groq 3 芯片。(Tech in Asia)NVIDIA Groq 3 LPX 投入量产,为智能体系统提供高速推理Techub News 消息,NVIDIA 宣布其 Vera Rubin 机架级系统 NVIDIA Groq 3 LPX 已投入全面生产。该系统在运行开源智能体模型 Gemma 4 31B 的基准测试中,针对 10 万令牌的长上下文用例,每秒可生成 3400 个输出令牌,速度比最接近的替代平台快 4 倍。
全球行业合作伙伴正在采用 Vera Rubin 平台解决方案。SpaceXAI 宣布将使用 NVIDIA Vera CPU 为其下一代智能体 AI 提供动力。CoreWeave 已部署 Spectrum-X Multiplane 进入生产环境,该技术通过多个并行交换机连接 NVIDIA Vera Rubin 机架,提供高带宽、扁平且无损的 AI 网络。Nebius 成为首个采用 NVIDIA Groq 3 LPX 的 AI 云。
NVIDIA 表示,随着 AI 从训练转向推理和智能体化,推理已成为新前沿。智能体 AI 系统正在生成更多令牌,处理更大的上下文窗口,并越来越多地与其他 AI 系统协作以解决复杂问题。这些工作负载需要一类新型基础设施,不仅针对性能,还需在空前规模下优化吞吐量、响应能力和经济性。(NVIDIA Blog)CoreWeave 等五大 GPU 云服务商 2026 年定价与合同容量排名公布Techub News 消息,MarkTechPost 发布 2026 年五大 GPU 云服务商(Neoclouds)排名,涵盖 CoreWeave、Nebius、Lambda、Crusoe 和 Groq。文章从公开定价、已部署及合同容量、硬件路线图、合同结构和独立质量评级等维度进行比较。CoreWeave 是唯一获得 SemiAnalysis ClusterMAX 2.0 白金评级的 GPU 云,并在 H100、H200 和 B200 上享有溢价定价。
Nebius 是唯一公布 B300 按需定价的供应商,而 Lambda 则公布了最低的 B200 按需费率(6.69 美元/GPU小时)。Crusoe 是唯一在其价目表中包含 AMD MI300X/MI355X 的供应商。Groq 现已成为 NVIDIA 云合作伙伴,并计划在其 LPU 推理云基础上增加 NVIDIA GPU 容量。
数据显示,CoreWeave Q2 营收 25.75 亿美元,同比增长 112%;Nebius AI 云年度经常性收入达 30 亿美元;Crusoe 已签约容量 4.9 GW,管道容量超 40 GW;Groq 拥有 13 个数据中心,容量从 54 MW 计划增至 2027 年的 200+ MW。 (MarkTechPost)Nvidia 否认开发中国特供 AI 芯片Techub News 消息,Nvidia 否认其正为中国市场开发基于 Groq 技术的 LPU 芯片,称公司无相关产品在售或列入路线图。此前报道称该公司计划年底前小批量出货该芯片。
该公司在中国 AI 芯片市场面临美国出口管制压力,中国曾占其数据中心收入至少五分之一。目前该公司仅通过 H200 芯片获得有限销售许可,长期在华战略仍存不确定性。(CryptoBriefing)Groq 完成 6.5 亿美元融资,转型 AI 推理云服务Techub News 消息,AI 芯片公司 Groq 宣布完成 6.5 亿美元融资,此次融资距离该公司与 Nvidia 达成技术许可协议并被挖走核心团队约六个月。该公司未披露最新估值,此前在 2024 年 9 月的融资中估值为 69 亿美元。
Groq 此前专注于开发语言处理单元(LPU)芯片用于 AI 推理,但在 Nvidia 获得其 LPU 技术 IP 并推出自有硬件后,Groq 已转向 neocloud 业务,目前在北美、欧洲、中东和亚太地区运营 13 个数据中心,每周处理数万亿 token。该公司还聘请了来自 xAI、Meta 和微软的前高管组建新管理团队。(TechCrunch)(点击收听本期音频👆) 采访|泓君 图文|朱婕 过去几年,推理消耗的token爆炸式增长,token经济随之成型,推理专用芯片也持续升温:去年年底,英伟达以约200亿美元与AI芯片初创公司Groq达成技术授权协议,并吸纳其创始人Jonathan Ross等核心团队,被外界视为一次变相收购(acqui-hire);做晶圆级“大芯片”的Cerebras今年6月…
