扫码下载
搜索“Transcribe”共有7条相关结果
Techub News 消息,苹果公司表示其新款 Apple Watch 不会保存原始音频,但其 AI 功能可转录近期语音并总结环境对话,引发了关于用户同意、隐私以及人们在可能被持续录音情况下行为的讨论。(TechCrunch)
Techub News 消息,微软 AI 部门发布新一代语音转录模型 MAI-Transcribe-2,其在定价与处理速度上均优于市场同类产品。此举可能重塑 AI 转录市场格局,并对竞争对手构成创新压力。(Crypto Briefing)
Techub News 消息,Meta 旗下 Meta Superintelligence Labs 推出 Muse Voice Transcribe 实时音频感知模型,支持流式语音转文本及说话人分割功能。 该模型能够实现实时音频流处理,支持识别超过 20 位不同说话人,适用于会议转录、实时字幕生成等多场景应用。(Cointelegraph)
Techub News 消息,Meta Superintelligence Labs 本周发布了实时音频感知模型 Muse Voice Transcribe。该模型将流式自动语音识别、超过 20 人的说话人分离和端点检测三项任务整合到一个自回归模型中,无需后处理。该模型已作为托管 API 上线 Meta Model API,价格为每 1000 音频分钟 3 美元,并已为 Meta AI for Mac 和 Muse Code 的听写功能提供支持。 该模型基于 70 多种语言进行训练,其中 25 种在发布时经过广泛验证和推荐。它原生支持超过一小时的音频输入和 20 多名说话人,无需后处理步骤。Meta 报告称,截至 2026 年 9 月 1 日,该模型在 Artificial Analysis 的流式语音转文本和公开的说话人分离基准测试中均排名第一。(MarkTechPost)
Techub News 消息,谷歌发布 Gemini 3.5 Transcribe 语音转录模型,可识别超过 85 种语言,实时去除填充词并修正口误。在流式模式下,其词错率为 4.0%,延迟比前代 Chirp 3 降低 70%。该模型还可通过函数调用将任务移交其他 Gemini 模型处理。 (The Decoder)
Techub News 消息,Google 在 2026 年 I/O 大会发布 Gemini 3.5 Transcribe 模型,支持情绪检测、说话人识别、时间戳标记及翻译功能。 该模型拥有 96K Token 上下文窗口,可处理长音频文件,适用于会议记录、法律取证等场景。Google 明确建议实时转录需使用 Cloud Speech-to-Text API 而非本模型。(CryptoBriefing)
Techub News 消息,谷歌旗下 AI 研究实验室 DeepMind 宣布推出 Gemini 3.5 Transcribe,这是一款更智能的语音转文本转录工具。该工具基于 Gemini 3.5 模型构建,旨在提供更准确、更具理解力的转录服务。 (DeepMind)