Techub News 消息,何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生的 Harness 框架 VISTA。该框架让多模态模型直接观察环境、保存原始画面,并可在推理时随时回看、放大和检查细节,无需额外训练模型。 在评测中,搭配 VISTA 的 Claude Opus 5.0 在 ARC-AGI-3 全部 25 个公开游戏中达到满分 100 分,所用动作数比人类基线少 57.4%;GPT-5.6 Sol 同样全部通关,得分 99。团队还在浏览器游戏、迷宫等任务中验证了该方法,并将具身任务列为后续研究方向。 VISTA 包含视觉观测、无损视觉记忆和主动视觉检查三个核心组件,分别负责提供画面、保存历史以及按需回看。框架通过保存原始画面并让模型主动调取,提升了现有多模态模型在视觉交互任务中的表现。(量子位)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生的 Harness 框架 VISTA。该框架让多模态模型直接观察环境、保存原始画面,并可在推理时随时回看、放大和检查细节,无需额外训练模型。 在评测中,搭配 VISTA 的 Claude Opus 5.0 在 ARC-AGI-3 全部 25 个公开游戏中达到满分 100 分,所用动作数比人类基线少 57.4%;GPT-5.6 Sol 同样全部通关,得分 99。团队还在浏览器游戏、迷宫等任务中验证了该方法,并将具身任务列为后续研究方向。 VISTA 包含视觉观测、无损视觉记忆和主动视觉检查三个核心组件,分别负责提供画面、保存历史以及按需回看。框架通过保存原始画面并让模型主动调取,提升了现有多模态模型在视觉交互任务中的表现。(量子位)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。