OpenAI公开了即使打断或修改用户话语也能自然反应的实时语音人工智能模型,生成式人工智能的竞争正从以文本为中心迅速扩展到基于语音的交互。
OpenAI于当地时间7日推出了具备GPT-5级推理性能的语音模型“GPT-Realtime-2”。该模型的核心在于其能像人与人对话一样保持流畅的交流。现有的AI语音服务通常是在用户说完话后才给出回答,因此对话略显机械,而这一新模型即使使用者在回答中途插话或修正之前说过的话,也能立即反映语境。它可以根据情况调整语气,开发者还能根据工作性质选择回答速度和推理水平。
同时公开的其他模型也聚焦于实用性。“GPT-Realtime-Translate”是用于将语音实时转换成其他语言的翻译模型,“GPT-Realtime-Whisper”则是一个将会议或通话内容直接听写成文本的模型。OpenAI解释称,实时语音技术正超越简单的问答,向着聆听用户发言、理解含义进行推理、翻译或记录,并协助完成实际工作任务的方向发展。这表明人工智能已超越简单的聊天机器人,正成为工作工具和服务接触点。
在企业现场,这种变化已在测试中。美国房地产平台Zillow正在构建一个语音助手,能够根据客户用语音说出的条件查找房产并预约看房时间。欧洲电信公司德国电信正在测试基于实时翻译的客户支持服务,以便客户能用自己最方便的语言进行咨询。对企业而言,可以减少咨询人员或提高响应效率;对消费者而言,搜索、预约和咨询流程有望变得更加简便。
有分析认为,此次发布也与OpenAI自身的设备战略相关联。OpenAI在去年以65亿美元收购了曾主导苹果产品设计的乔纳森·艾维的初创公司“io”后,一直在筹备可通过语音操作的人工智能设备。市场上猜测的设备候选包括智能眼镜、可别在衣服上的别针式设备以及智能音箱等。而天风国际证券分析师郭明錤最近也观测到,OpenAI正在开发搭载AI智能体功能的自有智能手机。最终,语音模型的升级很可能超越软件竞争,演变为对下一代设备主导权的争夺。
OpenAI当天还扩大了安全功能。如果ChatGPT在对话过程中检测到自残等心理健康危机信号,可以向用户预先指定的家人或朋友等可信联系人发送通知,以便获得帮助。这是将此前仅适用于青少年等未成年人账户的功能扩展到了成人账户。这一趋势表明,未来人工智能服务的竞争不仅在于性能提升,还可能朝着同时具备日常实用性、设备生态系统及安全机制的方向发展。


