Techub News 消息,印度 AI 公司 Sarvam AI 发布新一代语音识别模型 Saaras V4,覆盖全部 22 种印度官方语言及全球英语口音。该模型通过 API 提供,支持实时流式转录、批量处理及说话人分离功能,实时转录价格为每小时 30 印度卢比。 Saaras V4 采用编码器-解码器架构,解码器基于自研的 3B 参数混合状态空间语言模型 Sarvam-3B。模型提供转录、逐字记录、代码混合、拉丁化转写及翻译五种输出模式,并新增关键词提示功能以提升特定术语识别准确率。 Sarvam AI 报告称,Saaras V4 在多项基准测试中取得最优结果,在嘈杂音频数据集上的错误率低于 Deepgram Nova-3 和 GPT-4o Transcribe。不过,上述数据均为厂商自行报告,尚未有独立复现结果发布。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,印度 AI 公司 Sarvam AI 发布新一代语音识别模型 Saaras V4,覆盖全部 22 种印度官方语言及全球英语口音。该模型通过 API 提供,支持实时流式转录、批量处理及说话人分离功能,实时转录价格为每小时 30 印度卢比。 Saaras V4 采用编码器-解码器架构,解码器基于自研的 3B 参数混合状态空间语言模型 Sarvam-3B。模型提供转录、逐字记录、代码混合、拉丁化转写及翻译五种输出模式,并新增关键词提示功能以提升特定术语识别准确率。 Sarvam AI 报告称,Saaras V4 在多项基准测试中取得最优结果,在嘈杂音频数据集上的错误率低于 Deepgram Nova-3 和 GPT-4o Transcribe。不过,上述数据均为厂商自行报告,尚未有独立复现结果发布。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。