红帽公司近期正寻求新的方案,以支持在AI基础设施中日益重要的"推理"环节。特别是随着大规模语言模型的普及,能够可靠且经济地运行这些模型的系统需求愈发迫切。作为解决方案,红帽向云原生计算基金会捐赠了开源项目"llm-d",该项目支持在Kubernetes集群中运行大规模语言模型。这一项目是将AI推理从实验阶段扩展到企业环境的重要举措。
红帽技术总监布莱恩·史蒂文斯强调:"AI由数据科学家开发,他们目前正在构建并使用自己的基础设施。但AI最终将成为首席信息官需要面对的问题,而首席信息官必须借助Kubernetes等平台来处理。"这预示着AI基础设施正从实验室走向企业运营体系。
为优化推理过程,"llm-d"项目专注于提升大规模语言模型的推理速度与可移植性,旨在构建能够跨硬件环境轻松管理的系统。该项目在推理过程中引入"无服务器服务"概念,使推理的每个阶段都能被独立配置和优化。
红帽计划持续完善这一开源模型,以使其能高效适配企业的多样化应用场景。此举旨在未来进一步提升AI系统效率,为基于Kubernetes的平台奠定AI推理核心能力的基础。


