OpenAI Build Hour 深度解析:GPT-Realtime-2 如何重塑语音交互与实时智能体撰文:Techub News 整理
在 OpenAI 最新一期的「Build Hour」技术分享会上,产品经理 Terry、解决方案工程师 Erica 与来自 AI 智能体公司 Sierra 的工程师 Ken 和研究负责人 Soham,共同深入探讨了2026 年 5 月发布的 GPT-Realtime-2 模型及其相关技术。这场对话不仅展示了新模型在实时翻…OpenAI,公开可实时对话的“GPT-Realtime-2”……语音AI时代正式到来OpenAI公开了即使打断或修改用户话语也能自然反应的实时语音人工智能模型,生成式人工智能的竞争正从以文本为中心迅速扩展到基于语音的交互。
OpenAI于当地时间7日推出了具备GPT-5级推理性能的语音模型“GPT-Realtime-2”。该模型的核心在于其能像人与人对话一样保持流畅的交流。现有的AI语音服务通常是在用户说完话后才给出回答,因此对话略显机械…阿里通义千问团队推出 Qwen3.8-LiveTranslate 实时翻译模型Techub News 消息,阿里通义千问团队发布新一代实时同传模型 Qwen3.8-LiveTranslate。该模型采用新的 Interleave 架构,支持边听边说,平均翻译延迟从 2.8 秒降至 2.3 秒,覆盖 60 种语言。模型新增实时说话人分离、双语同步显示和长上下文消歧功能。
模型已上线阿里云 Model Studio 和 QwenCloud,通过 WebSocket API 提供服务。输入支持音频和可选图像,输出为文本和语音。模型支持为特定术语设置固定翻译的热词表。
定价方面,新加坡地区每百万 token 音频输入、图像输入、文本输出、音频输出费用分别为 7.5 美元、0.55 美元、20 美元和 30 美元。北京区域定价更低。(MarkTechPost)Microsoft 预览 MAI-Realtime 双向语音模型Techub News 消息,Microsoft 宣布推出 MAI-Realtime 双向语音模型预览版,该模型支持实时双向音频处理,可实现更自然的对话体验,并支持多语言及与 Copilot 等工具的集成。
该模型与此前发布的 MAI-Voice-1 和 MAI-Transcribe-1 共同构成 Microsoft 的端到端语音 AI 体系。此举旨在减少对 OpenAI 的依赖,使公司能够自主掌控产品路线图并降低推理成本。(CryptoBriefing)Boson AI 将推 Higgs RealTime 实时语音模型Techub News 消息,AI 初创公司 Boson AI 正准备发布其首款端到端语音模型 Higgs RealTime,支持直接从语音到语音的处理,无需经过文本转换,以实现更低延迟的自然人机交互。
与 OpenAI、Google 及 ElevenLabs 等厂商的语音产品相比,Higgs RealTime 专注于生产级低延迟场景。Boson AI 此前已推出支持 100 余种语言的 Higgs TTS 3 文本转语音模型,以及可根据单张图片生成实时说话人视频的 Higgs Avatar API。该公司早期模型 Higgs TTS 2 曾在 Hugging Face 开源,训练数据超过 1000 万小时。(CryptoBriefing)阶跃星辰 StepAudio 2.5 登顶五项语音 AI 基准测试Techub News 消息,据 CryptoBriefing 报道,阶跃星辰(StepFun)发布的语音模型 StepAudio 2.5 Realtime 在 2026 年 4 月的五项主流基准测试中均排名第一,主观人类评价得分 80.41 分,较前代基线提升 10 分。
该模型采用端到端架构,支持中英文实时交互,并引入副语言理解能力以识别语调、情绪和语速。技术报告显示,其通过角色扮演特定的 RLHF 技术保持角色一致性,区别于传统的语音识别-语言模型-语音合成流水线。撰文:Techub News 整理 在 OpenAI 最新一期的「Build Hour」技术分享会上,产品经理 Terry、解决方案工程师 Erica 与来自 AI 智能体公司 Sierra 的工程师 Ken 和研究负责人 Soham,共同深入探讨了2026 年 5 月发布的 GPT-Realtime-2 模型及其相关技术。这场对话不仅展示了新模型在实时翻…
