扫码下载
搜索“Voice”共有10条相关结果
Techub News 消息,Grok Voice 已集成至 AI 开发平台 fal.ai,旨在为开发者提供低延迟的 AI 语音代理服务。该集成简化了 AI 语音开发流程,降低了延迟和基础设施复杂性,以增强全球 AI 交互体验。 (Crypto Briefing)
Techub News 消息,巴黎语音 AI 公司 Gradium 推出 Voice Design 功能,用户只需输入一段文本描述,即可在几秒内生成全新的合成语音,无需参考音频或处理版权问题。该功能已在其 API 和 Studio 平台上线,所有套餐包括免费层均可使用。 用户可通过描述性别、年龄、口音、音调、语速等属性来生成语音,支持英语、法语、西班牙语、葡萄牙语和德语。每次请求可生成 1 至 5 个候选声音,通常在 3 至 5 秒内完成。生成的语音可通过其文本转语音端点直接用于流媒体。 Gradium 公布的盲测结果显示,其 Voice Design 在口音提示的对比测试中,以 72.6% 的胜率领先于 ElevenLabs、Inworld 等竞争对手。该公司称其在区域口音(如魁北克法语、巴伐利亚德语)的生成上优势明显。 (MarkTechPost)
Techub News 消息,微软(Microsoft)在开源模型平台 HuggingFace 上架了新的语音识别模型权重 "microsoft/VibeVoice-ASR-Streaming-1.5B"。该模型名为 VibeVoice-ASR-Streaming,参数量为 15 亿,专注于流式自动语音识别任务。此类权重上架通常早于官方正式发布。 (HuggingFace)
Techub News 消息,Meta 旗下 Meta Superintelligence Labs 推出 Muse Voice Transcribe 实时音频感知模型,支持流式语音转文本及说话人分割功能。 该模型能够实现实时音频流处理,支持识别超过 20 位不同说话人,适用于会议转录、实时字幕生成等多场景应用。(Cointelegraph)
Techub News 消息,Meta Superintelligence Labs 本周发布了实时音频感知模型 Muse Voice Transcribe。该模型将流式自动语音识别、超过 20 人的说话人分离和端点检测三项任务整合到一个自回归模型中,无需后处理。该模型已作为托管 API 上线 Meta Model API,价格为每 1000 音频分钟 3 美元,并已为 Meta AI for Mac 和 Muse Code 的听写功能提供支持。 该模型基于 70 多种语言进行训练,其中 25 种在发布时经过广泛验证和推荐。它原生支持超过一小时的音频输入和 20 多名说话人,无需后处理步骤。Meta 报告称,截至 2026 年 9 月 1 日,该模型在 Artificial Analysis 的流式语音转文本和公开的说话人分离基准测试中均排名第一。(MarkTechPost)
Techub News 消息,为警员提供实时法律与政策指导的应用 Blue Voice 已完成 600 万美元种子轮融资,此轮融资由 SignalFire 和 Las Olas VC 领投。该公司旨在打造一个面向执法人员的“Harvey”(AI法律助手)。(TechCrunch)
Techub News 消息,2026年第一季度中国发布的12.8万部短剧中,95%为AI生成。据《金融时报》报道,一些演员在被迫将声音和肖像权交给AI工具后遭解雇,AI相关的劳动纠纷正在迅速增加。 (The Decoder)
Techub News 消息,SpaceX 旗下卫星互联网服务 Starlink 已采用 xAI 开发的语音 AI 模型 Grok Voice 来处理客户支持通话,该系统每日处理约 1.5 万次通话。该 AI 驱动的支持系统展示了 AI 在提升客服效率与销售转化率方面的潜力。 (Crypto Briefing)
Techub News 消息,Elon Musk 旗下 xAI 发布的 Grok Voice Think Fast 2.0 在 Artificial Analysis Speech-to-Speech Index 中排名第一,该模型于 2026 年 7 月 29 日上线,综合得分 79.0%,语音推理和任务成功率分别为 97% 和 94.7%。 该模型支持超过 25 种语言,处理多步骤对话的 agentic 性能得分达 56.5%,推理 token 使用量比前代减少约 60%,定价为每分钟 0.08 美元。xAI 已为使用 grok-voice-latest API 的开发者设置自动升级路径,迁移工作于 2026 年 8 月 5 日启动。(CryptoBriefing)
Techub News 消息,OpenAI 已向全球教育版、商业版及企业版用户推出 GPT-Live 语音功能。 该功能集成于 ChatGPT Voice 中,为 Edu、Business 及 Enterprise 用户群体提供实时语音交互服务。(Cointelegraph)