由米拉·穆拉蒂领衔的人工智能初创公司Thinking Machines Lab将扩大与谷歌云的合作。业界预测,此次合同规模可能达到"数十亿美元"级别,折合韩元约为1.4774万亿至13.2966万亿韩元。
此次发布的核心内容是Thinking Machines Lab扩大对谷歌有限责任公司云平台的使用范围。TechCrunch援引消息人士称,合同价值达数十亿美元。Thinking Machines Lab由前OpenAI首席技术官米拉·穆拉蒂领导,运营着名为"Tinker"的云服务,帮助企业定制调整开源大语言模型。
AI基础设施迁移与核心规格
该公司计划将部分工作负载迁移至谷歌云的"A4X Max"实例。该实例是专为驱动AI模型而设计的高性能虚拟机。每个实例配备4块英伟达Blackwell Ultra GPU,并搭载2块72核中央处理器。
这些芯片在英伟达制造的液冷式"GB300 NVL72"系统中运行。该设备支持37TB内存和每秒130Tbps的内部带宽。谷歌云表示,Thinking Machines Lab是首批利用其NVL72基础设施的客户之一。
网络架构与运行环境
性能提升的背后也离不开网络架构。A4X Max实例利用"RoCE"技术,减少数据传输的部分环节并提高吞吐量。此外,还应用了"轨道对齐拓扑"结构,在GPU之间建立专用连接路径,并最小化了数据到达目的地所需经过的"跳数"。这有利于减少大规模AI训练和推理任务的延迟。
谷歌同时使用英伟达的ConnectX网络接口卡和自研的钛金NIC来协调GPU流量。ConnectX负责管理GPU间的数据流,而钛金NIC则负责处理与其他谷歌云服务连接的外部流量。Thinking Machines Lab已经在利用谷歌云存储、Spanner关系数据库、定制缓存系统及集群调度器来运行其工作负载。其中,集群调度器还承担着自动恢复部分技术故障的任务。
投资背景与市场解读
此次扩大合作,距离英伟达最近宣布对Thinking Machines Lab进行"重大投资"仅隔数周。据悉,这笔资金是该公司未来购买数十亿美元规模硬件更大合同的一部分。Thinking Machines Lab还计划引入Blackwell Ultra的后续产品"Rubin"。
市场将此次合同视为不仅是为了吸引云客户,更是生成式AI基础设施主导权竞争的延伸。谷歌云试图通过结合英伟达最新半导体与自身网络技术来抢占大型AI客户,而Thinking Machines Lab则希望借此提升模型开发与服务扩展的速度。有评价认为,AI初创公司与科技巨头的结合正变得更加紧密,这一趋势再次得到确认。
TP AI注意事项 使用TokenPost.ai基础语言模型对文章进行了摘要。可能遗漏了正文的主要内容或与事实不符。

