微软今日发布了拥有1500亿参数的多模态推理模型"Phi-4-reasoning-vision-15B"。该模型的特点在于能够处理科学图表等多模态文件,并注重硬件效率。其核心算法"SigLIP-2"可将图像压缩为神经网络能够理解的数字数据,而"Phi-4 Reasoning"作为推理模型已于去年4月开源发布。
这两种算法通过"中间融合"方式结合。通常人工智能模型由多个神经元层构成,在中间融合模型中,仅部分层处理多模态数据。这种方式通过大幅降低硬件使用量,相应地在输出质量上做出了一定取舍。
据微软介绍,用户可通过停用模型的推理功能进一步减少基础设施使用量。该功能可通过提示词开启或关闭。大部分训练数据来源于开源资源,并通过内部生成数据及针对性数据采集提升了质量。此举还增加了防止模型产生有害输出的训练示例。
Phi-4-reasoning-vision-15B在多项对比测试中表现出色,尤其在"MathVista_Mini"评估中比谷歌的"gemma-3-12b-it"高出17%。微软研究人员在博客中表示,该模型在综合性能方面获得高度评价。
开发者可利用该模型构建能与应用程序用户界面交互的AI智能体。Phi-4-reasoning-vision-15B能够基于截图推断界面元素的功能。该模型还能分析科学图表等复杂视觉素材。微软在演示中展示了用户上传土星照片并询问行星为何呈现倾斜状态时,模型给出的解释。
模型说明这种现象与年份更迭及拍摄望远镜的位置有关。该模型代码已在Hugging Face、GitHub及Azure平台开放获取。


