Techub News 消息, pasukan He Kaiming dalam kertas kerja "VISTA: A Visual Harness for Reasoning in an Interactive World" telah mencadangkan rangka kerja Harness berasaskan visual VISTA. Rangka kerja ini membolehkan model multimodal memerhati persekitaran secara langsung, menyimpan rakaman asal, dan boleh melihat semula, membesarkan serta memeriksa butiran pada bila-bila masa semasa membuat inferens, tanpa perlu melatih model tambahan. Dalam penilaian, Claude Opus 5.0 yang dipasangkan dengan VISTA mencapai markah penuh 100 dalam kesemua 25 permainan awam ARC-AGI-3, dengan bilangan tindakan yang digunakan adalah 57.4% kurang daripada garis dasar manusia; GPT-5.6 Sol juga berjaya melengkapkan semua permainan dengan markah 99. Pasukan juga telah mengesahkan kaedah ini dalam tugas seperti permainan pelayar dan labirin, serta menyenaraikan tugas berbadan sebagai arah penyelidikan selanjutnya. VISTA mengandungi tiga komponen teras: pemerhatian visual, ingatan visual tanpa kehilangan, dan pemeriksaan visual aktif, yang masing-masing bertanggungjawab untuk menyediakan rakaman, menyimpan sejarah, dan melihat semula mengikut keperluan. Rangka kerja ini meningkatkan prestasi model multimodal sedia ada dalam tugas interaksi visual dengan menyimpan rakaman asal dan membolehkan model mengaksesnya secara aktif. (Qubit)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Semua maklumat di laman web ini adalah untuk rujukan sahaja.
Laman web ini tidak menjamin ketepatan, kesahan, ketepatan masa atau kelengkapan maklumat.
Pengguna menanggung sendiri risiko bagi tindakan berdasarkan maklumat di laman web ini.
Techub News 消息, pasukan He Kaiming dalam kertas kerja "VISTA: A Visual Harness for Reasoning in an Interactive World" telah mencadangkan rangka kerja Harness berasaskan visual VISTA. Rangka kerja ini membolehkan model multimodal memerhati persekitaran secara langsung, menyimpan rakaman asal, dan boleh melihat semula, membesarkan serta memeriksa butiran pada bila-bila masa semasa membuat inferens, tanpa perlu melatih model tambahan. Dalam penilaian, Claude Opus 5.0 yang dipasangkan dengan VISTA mencapai markah penuh 100 dalam kesemua 25 permainan awam ARC-AGI-3, dengan bilangan tindakan yang digunakan adalah 57.4% kurang daripada garis dasar manusia; GPT-5.6 Sol juga berjaya melengkapkan semua permainan dengan markah 99. Pasukan juga telah mengesahkan kaedah ini dalam tugas seperti permainan pelayar dan labirin, serta menyenaraikan tugas berbadan sebagai arah penyelidikan selanjutnya. VISTA mengandungi tiga komponen teras: pemerhatian visual, ingatan visual tanpa kehilangan, dan pemeriksaan visual aktif, yang masing-masing bertanggungjawab untuk menyediakan rakaman, menyimpan sejarah, dan melihat semula mengikut keperluan. Rangka kerja ini meningkatkan prestasi model multimodal sedia ada dalam tugas interaksi visual dengan menyimpan rakaman asal dan membolehkan model mengaksesnya secara aktif. (Qubit)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Semua maklumat di laman web ini adalah untuk rujukan sahaja. Laman web ini tidak menjamin ketepatan, kesahan, ketepatan masa atau kelengkapan maklumat. Pengguna menanggung sendiri risiko bagi sebarang tindakan berdasarkan maklumat ini.