Techub News 消息,AI 基础设施公司 Prime Intellect 推出 Prime Inference 推理服务平台,为前沿开源模型提供无服务器端点和预留容量服务。该平台运行在 Prime Intellect 自有的多数据中心 GPU 集群上,在公开发布前内部每日处理近万亿个 Token。 Prime Inference 是 Prime Intellect 开放训练堆栈的推理层,支持 OpenAI 兼容的 API。其堆栈结合了 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer 等技术,旨在优化智能体工作负载,并报告其 GLM-5.3 端点在 OpenRouter 上速度领先,工具调用错误率接近零,自推出以来保持 100% 的正常运行时间。 平台提供两种服务模式:无服务器端点用于可变需求,预留容量用于持续工作负载。硬件目前采用 NVIDIA Blackwell,未来将支持 Vera Rubin。团队级统一账单和用量跟踪已上线,但具体按模型定价尚未完全公布。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,AI 基础设施公司 Prime Intellect 推出 Prime Inference 推理服务平台,为前沿开源模型提供无服务器端点和预留容量服务。该平台运行在 Prime Intellect 自有的多数据中心 GPU 集群上,在公开发布前内部每日处理近万亿个 Token。 Prime Inference 是 Prime Intellect 开放训练堆栈的推理层,支持 OpenAI 兼容的 API。其堆栈结合了 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer 等技术,旨在优化智能体工作负载,并报告其 GLM-5.3 端点在 OpenRouter 上速度领先,工具调用错误率接近零,自推出以来保持 100% 的正常运行时间。 平台提供两种服务模式:无服务器端点用于可变需求,预留容量用于持续工作负载。硬件目前采用 NVIDIA Blackwell,未来将支持 Vera Rubin。团队级统一账单和用量跟踪已上线,但具体按模型定价尚未完全公布。(MarkTechPost)
君联资本,投出万亿智谱和长鑫后
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。