Techub News 消息,印度 AI 公司 Sarvam AI 发布新一代语音识别模型 Saaras V4,覆盖全部 22 种印度官方语言及全球英语口音。该模型通过 API 提供,支持实时流式转录、批量处理及说话人分离功能,实时转录价格为每小时 30 印度卢比。 Saaras V4 采用编码器-解码器架构,解码器基于自研的 3B 参数混合状态空间语言模型 Sarvam-3B。模型提供转录、逐字记录、代码混合、拉丁化转写及翻译五种输出模式,并新增关键词提示功能以提升特定术语识别准确率。 Sarvam AI 报告称,Saaras V4 在多项基准测试中取得最优结果,在嘈杂音频数据集上的错误率低于 Deepgram Nova-3 和 GPT-4o Transcribe。不过,上述数据均为厂商自行报告,尚未有独立复现结果发布。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Semua maklumat di laman web ini adalah untuk rujukan sahaja.
Laman web ini tidak menjamin ketepatan, kesahan, ketepatan masa atau kelengkapan maklumat.
Pengguna menanggung sendiri risiko bagi tindakan berdasarkan maklumat di laman web ini.
Techub News 消息,印度 AI 公司 Sarvam AI 发布新一代语音识别模型 Saaras V4,覆盖全部 22 种印度官方语言及全球英语口音。该模型通过 API 提供,支持实时流式转录、批量处理及说话人分离功能,实时转录价格为每小时 30 印度卢比。 Saaras V4 采用编码器-解码器架构,解码器基于自研的 3B 参数混合状态空间语言模型 Sarvam-3B。模型提供转录、逐字记录、代码混合、拉丁化转写及翻译五种输出模式,并新增关键词提示功能以提升特定术语识别准确率。 Sarvam AI 报告称,Saaras V4 在多项基准测试中取得最优结果,在嘈杂音频数据集上的错误率低于 Deepgram Nova-3 和 GPT-4o Transcribe。不过,上述数据均为厂商自行报告,尚未有独立复现结果发布。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Semua maklumat di laman web ini adalah untuk rujukan sahaja. Laman web ini tidak menjamin ketepatan, kesahan, ketepatan masa atau kelengkapan maklumat. Pengguna menanggung sendiri risiko bagi sebarang tindakan berdasarkan maklumat ini.