Techub News 消息,AI 基础设施公司 Prime Intellect 推出 Prime Inference 推理服务平台,为前沿开源模型提供无服务器端点和预留容量服务。该平台运行在 Prime Intellect 自有的多数据中心 GPU 集群上,在公开发布前内部每日处理近万亿个 Token。 Prime Inference 是 Prime Intellect 开放训练堆栈的推理层,支持 OpenAI 兼容的 API。其堆栈结合了 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer 等技术,旨在优化智能体工作负载,并报告其 GLM-5.3 端点在 OpenRouter 上速度领先,工具调用错误率接近零,自推出以来保持 100% 的正常运行时间。 平台提供两种服务模式:无服务器端点用于可变需求,预留容量用于持续工作负载。硬件目前采用 NVIDIA Blackwell,未来将支持 Vera Rubin。团队级统一账单和用量跟踪已上线,但具体按模型定价尚未完全公布。(MarkTechPost)