Techub News 消息,阿里云旗下通义千问团队发布多模态模型 Qwen3.8-Omni-Flash。该模型是其首个围绕智能体能力构建的“全模态”模型,可同时理解文本、图像、音频和视频输入,并输出文本,集音视频理解、推理与工具调用于一体。模型现已通过 QwenCloud、阿里云 Model Studio 和 Qwen Studio 提供 API 服务,但未开源权重。 Qwen3.8-Omni-Flash 基于 Qwen3.8-Flash-Next 架构构建,上下文窗口为 100 万令牌。在处理长视频时,模型采用基于问题的代理感知方法,动态选择关键片段进行分析,据称在 OmniVideoBench 基准上准确率提升至 67.8,同时令牌使用量减少约 45.7%。 官方数据显示,在 29 项评测中,其平均得分较 Qwen3.5-Omni-Plus 提升超 25%。团队称其音视频性能接近 Gemini 3.8 Flash,整体音频性能优于后者。API 定价为每百万输入令牌 0.15 美元,每百万输出令牌 0.47 美元,音视频输入成本较前代降低超 90%。(@Alibaba_Qwen)