在人工智能(AI)推理需求激增的背景下,Aranya 公布了大规模集群操作系统 "ClusteredOS"。该公司强调,该产品降低了复杂 Kubernetes 的运营负担,使得即便没有专门的平台团队,也能快速构建达到 AI 超级计算机级别的基础设施。
成立于 2025 年的 Aranya Inc. 是一家致力于开发面向"下一代超级计算机"需求的集群规模操作系统的初创公司。在正式发布的同时,该公司还宣布了与 Nvidia 的云合作伙伴、在裸金属部署方面具有优势的 Hydra Host 的主要合作关系。裸金属是一种无需虚拟化层、直接利用物理服务器资源的方式,是高性能 AI 推理环境中备受关注的架构。
Aranya 提出的核心是 AI 基础设施的"运行"问题。该公司分析认为,迄今为止,要将高性能模型部署到实际服务中,大规模专职平台组织几乎是必不可少的。反之,没有这类组织的企业只能依赖托管云服务,但据其说明,这种方式初期引入虽然容易,然而在大规模扩展阶段,成本负担和控制权限制会显著增加。定制化基础设施虽然灵活,但难以确保能够运营它的高级工程人才也被视为一个瓶颈。
降低 Kubernetes 复杂性,提出"48 小时构建"
ClusteredOS 被介绍为一款基于开源、弥合 Kubernetes、分布式系统和 AI 基础设施之间差距的分布式操作系统。其目标是将原始计算资源直接转化为可投入生产环境的 AI 超级计算机形态,并以较低的运营负担处理从集群引导到维护、升级的整个生命周期。公司还解释说,其设计允许通过简单的上层功能标志方式,添加分布式云原生应用并进行版本管理。
据 Aranya 称,Hydra Host 在引入 ClusteredOS 后,将生产用集群的构建时间从原有的 2 到 6 周缩短至 48 小时以内。公司方面声称,他们还构建了能够抵消反复发生的数据中心故障的定制化架构,将集群停机时间降低了 90%。
Hydra Host 联合创始人兼首席执行官 Aaron Ginn 表示:"越来越多的客户不仅需要简单的基础设施,更希望获得一条更快、更可靠地进入生产环境的路径。Hydra Host 的裸金属计算和运营支持与 Aranya 的 Kubernetes 专业知识相结合,得以提供更完善的解决方案,能够以更低的复杂性部署和扩展实际工作负载。"
运营超过 1700 个 GPU……AI 基础设施竞争的新战场
Aranya 表示,在正式发布之前,合作伙伴已经利用 ClusteredOS 在超过 1700 个图形处理器上部署并运营着大规模的核心推理管线。公司补充说,该产品还提供 24 小时监控、安全补丁和定制化集成功能,从而减少了对单独平台团队的需求。
不过,公司并未在发布时公开投资者及其具体的融资细节。根据公开记录,该公司应已获得了初期阶段的风险投资资金。
从市场角度来看,此次发布显示出 AI 竞争的焦点正从模型性能本身转向"运营效率"。随着推理需求的增长,企业不仅关注 GPU 的获取,也开始更加重视能够将 GPU 稳定整合并连接到服务阶段的软件层。特别是推理成本的优化、故障应对以及部署速度,这些因素直接关系到 AI 服务的盈利能力。
Aranya 认为,未来当 AI 助手深度融入日常工作时,单个开发者所需的计算资源可能接近过去一个团队的水平。在这种情况下,集群操作系统很可能不再是可选品,而是必备的基础设施。归根结底,Aranya 的胜负手在于,它能否在实际场景中充分证明其"让任何人都能轻松驾驭大规模推理集群"的承诺。
TP AI 注意事项 此文章使用基于 TokenPost.ai 的语言模型进行摘要。正文主要内容可能被遗漏或与事实不符。

