Techub News 消息,何恺明氏のチームは論文『VISTA: A Visual Harness for Reasoning in an Interactive World』において、視覚ネイティブのHarnessフレームワークVISTAを提案した。このフレームワークは、マルチモーダルモデルが直接環境を観察し、生の映像を保存し、推論時にいつでも過去の映像を振り返り、拡大して詳細を確認できるようにするもので、追加のモデルトレーニングを必要としない。 評価では、VISTAを搭載したClaude Opus 5.0 は、ARC-AGI-3 の全ての 25 つの公開ゲームで満点の 100 点を達成し、使用したアクション数は人間のベースラインよりも 57.4%少なかった。GPT-5.6 Solも同様に全てのゲームをクリアし、スコアは 99 だった。チームはブラウザゲームや迷路などのタスクでもこの手法を検証し、具現化タスクを今後の研究テーマとして挙げた。 VISTAは、視覚観測、無損失視覚記憶、能動的視覚検査の三つのコアコンポーネントを含み、それぞれ映像の提供、履歴の保存、必要に応じた過去の映像の参照を担当する。フレームワークは生の映像を保存し、モデルが能動的にそれを呼び出すことで、既存のマルチモーダルモデルの視覚的インタラクションタスクにおけるパフォーマンスを向上させた。(量子位)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

当サイトの情報は参考目的でのみ提供しています。
当サイトは情報の正確性、有効性、適時性、完全性を保証しません。
当サイトの情報に基づく行動は、すべて利用者ご自身の責任となります。
Techub News 消息,何恺明氏のチームは論文『VISTA: A Visual Harness for Reasoning in an Interactive World』において、視覚ネイティブのHarnessフレームワークVISTAを提案した。このフレームワークは、マルチモーダルモデルが直接環境を観察し、生の映像を保存し、推論時にいつでも過去の映像を振り返り、拡大して詳細を確認できるようにするもので、追加のモデルトレーニングを必要としない。 評価では、VISTAを搭載したClaude Opus 5.0 は、ARC-AGI-3 の全ての 25 つの公開ゲームで満点の 100 点を達成し、使用したアクション数は人間のベースラインよりも 57.4%少なかった。GPT-5.6 Solも同様に全てのゲームをクリアし、スコアは 99 だった。チームはブラウザゲームや迷路などのタスクでもこの手法を検証し、具現化タスクを今後の研究テーマとして挙げた。 VISTAは、視覚観測、無損失視覚記憶、能動的視覚検査の三つのコアコンポーネントを含み、それぞれ映像の提供、履歴の保存、必要に応じた過去の映像の参照を担当する。フレームワークは生の映像を保存し、モデルが能動的にそれを呼び出すことで、既存のマルチモーダルモデルの視覚的インタラクションタスクにおけるパフォーマンスを向上させた。(量子位)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

当サイトの情報は参考目的でのみ提供しています。当サイトは情報の正確性、有効性、適時性、完全性を保証しません。当サイトの情報に基づく行動は、すべて利用者ご自身の責任となります。