英伟达($NVDA)发布了能够同时处理文本、图像和语音的全新推理人工智能模型"Nemotron 3 Nano Omni"。该模型采用无需单独识别模块即可整合并解析多种输入的结构,旨在成为更快速、更智能的"代理型AI"的核心大脑。
此次发布的模型参数规模约为300亿,其特点是采用了"专家混合"结构,同时实现了低延迟和高灵活性。英伟达表示,该模型通过结合视觉与音频编码器与30B-AD3B混合MoE架构设计而成,能够在一个模型中处理文档、电脑屏幕、语音活动、视频等多种数据。
公司称,通过这种方式,该模型在大规模环境中提升了效率,其处理吞吐量比市场上其他开放式全模态模型快达9倍。尤其是在屏幕解析速度至关重要的代理型AI领域,这一优势尤为突出。H公司首席执行官戈蒂埃·克卢瓦(Gauthier Cloît)表示:"要打造有用的代理,模型不能在解析屏幕时等待数秒。基于Nemotron 3 Nano Omni,即使全高清屏幕录制也能快速解析,从而使得以前不切实际的任务变得可行。"
英伟达强调,该模型在成本节约和可扩展性方面同样具有竞争力。该模型尺寸相对较小,能够在高端消费级硬件上压缩运行,也可在企业级云环境中高效部署。此外,其设计支持与独立的云模型或其他Nemotron开放模型协同运行,对于高频执行任务可使用"Nemotron 3 Super",对于复杂规划则可组合其他高级模型。
其核心作用在于充当人与机器之间的接口。它能快速将用户的交互式输入转化为推理过程,并综合理解文档、视频和语音,从而支持更加自然的交互。这与当前AI行业重心从简单聊天机器人转向执行实际工作的"代理型AI"的趋势相契合。
据英伟达称,Nemotron产品系列在过去一年中已被下载超过5000万次。此次发布的"Omni"版本具有较强的扩展性,旨在将现有的Ultra、Super、Nano产品线拓展至多模态和代理型AI领域。
新模型目前以英伟达NIM微服务的形式在Hugging Face、OpenRouter和Build.nvidia.com上提供。作为开放式轻量级模型发布,开发者可以在本地设备以及英伟达DGX Spark等硬件上直接构建和使用。
此次发布表明,AI性能竞赛正从"更大的模型"转向"更快、更实用的模型"。英伟达正从一家半导体公司,向提供整体代理型AI基础设施的企业迈进。
TP AI注意事项 本文基于TokenPost.ai语言模型进行了摘要。正文中的主要内容可能已被省略或与事实不符。

