撰文:Techub News 整理
导语
在巴黎举行的欧洲顶级科技盛会 VivaTech 2024 上,Meta 首席人工智能科学家、纽约大学教授 Yann LeCun(杨立昆)发表了主题演讲,并与《金融时报》AI 记者进行了一场深度对话。作为深度学习领域的奠基人之一,LeCun 一直引领着 Meta 在人工智能基础研究方面的前沿探索。此次对话的核心,围绕其团队最新发布的视频联合嵌入预测架构模型 V-JEPA V2 展开,并深入探讨了 Meta 实现人类水平乃至超级人工智能的长期战略路线图。在当前 AI 模型能力竞赛白热化的背景下,LeCun 提出了与主流生成式大语言模型(LLM)不同的技术路径,其观点对理解 AI 的未来发展方向具有重要参考价值。
摘要
- V-JEPA V2 是一个旨在让 AI 理解物理世界、并具备初步推理与规划能力的视频预测模型,其核心在于学习世界的抽象表征而非像素级重建。
- LeCun 认为,实现人类水平智能(AGI)需要克服四大挑战:理解物理世界、拥有持久记忆、具备推理能力、能够规划,并确保系统的可控与安全。
- Meta 的长期目标是发展“友好机器智能”(AMI),并最终实现“人工超级智能”(ASI),即 AI 在多数领域超越人类,成为人类智能的增强工具。
- 以 JEPA 为代表的非生成式、基于抽象表征学习的架构,是 Meta 为实现超级智能所押注的长期研究范式,与当前主流的生成式 LLM 路径并行。
- LeCun 强调开放研究与合作的重要性,并宣布 V-JEPA V2 模型将开源,以汇聚全球科学界智慧共同攻克规划、分层推理等核心难题。
V-JEPA V2:让 AI 学会“想象”物理世界
Yann LeCun(杨立昆)开宗明义地介绍了 V-JEPA V2 模型的目标:推动 AI 在理解物理世界、进行推理和规划这三个关键挑战上取得进展。他指出,当前大多数 AI 系统缺乏对物理世界的基本常识,而 V-JEPA 正是为此设计的“第一步”。
与直接预测视频下一帧像素的传统方法不同,V-JEPA 采用了一种名为“联合嵌入预测架构”的方法。其核心思想是:系统并不试图精确重建缺失的视频细节,而是学习视频的抽象表征。在这个抽象空间中,大量无关细节被过滤,系统专注于预测世界状态的变化趋势。LeCun 比喻道,这就像人类无需记住每一片树叶的飘动轨迹,却能理解风吹树摇的因果关系。这种从像素预测到抽象表征预测的转变,是模型能够有效学习物理规律的关键。
V-JEPA 的训练过程分为两阶段。第一阶段,通过海量视频进行自监督学习,让模型学会预测视频中缺失部分(无论是时间上还是空间上)的抽象表征。第二阶段,则利用这些学到的表征来训练一个“世界模型”。这个世界模型能够根据当前观察到的世界状态(一段短视频)和一个假设的动作(例如机器人手臂的移动),预测执行该动作后世界状态将如何变化。
“一旦拥有了这样的世界模型,”LeCun 解释道,“系统就可以在‘脑海’中模拟一系列动作的后果,从而规划出能够达成特定目标(如抓取物体、开门)的动作序列。”虽然目前展示的任务相对简单,但其突破性在于,系统并非通过针对这些任务的专门训练学会的,而是纯粹通过其内建的世界模型进行推理和规划得出的。这为构建具备通用规划能力的智能体奠定了基础。
从 AMI 到 ASI:Meta 的超级智能蓝图
当话题转向人工智能的终极目标——人工通用智能时,Yann LeCun(杨立昆)表达了对“AGI”这一术语的保留意见。他认为,“通用”一词建立在人类智能是“通用”的这一假设上,而事实上人类智能相当 specialized(专门化)。许多动物在某些方面比人类更聪明,计算机在特定任务上也早已超越人类。
因此,他更倾向于使用 Meta 内部常用的两个概念:ASI 和 AMI。ASI 即“人工超级智能”,指在大多数领域达到并超越人类水平的智能系统。LeCun 强调,超级智能不等于通用智能,它意味着 AI 能在众多任务上比人类做得更好,而这正是计算机辅助人类的本质——弥补人类不擅长之处。
而 AMI,在法语中发音类似“朋友”,全称为“友好机器智能”。这是 Meta 为实现 ASI 制定的具体技术蓝图和路线图。LeCun 透露,这实际上是公司十年前就已设定的长期目标,当时更多是探索性研究,而现在正逐渐转变为清晰的产品战略方向。AMI 旨在系统性地攻克他之前提到的几大挑战:让系统理解物理世界、拥有常识和持久记忆、能够推理和规划,并且确保其可控与安全。
对于2025 年 6 月媒体报道 Meta 计划成立新的超级智能 AI 部门,LeCun 没有直接评论具体人事,但指出这反映了公司内部将这一长期愿景变为现实的决心正在加强。他表示,Meta 基础人工智能研究部门的目标自创立之初就是实现并超越人类智能,现在只是路径变得更加清晰,而 V-JEPA 正是沿此方向迈出的一步。
展望超级智能的具体形态,LeCun 描绘了一个人人拥有 AI 助手的未来。这些助手内置于智能眼镜等设备中,可以随时对话、回答问题、提供信息,如同拥有一支比你自己更聪明的虚拟团队随时协助。“这将极大地增强个人能力,”他说,“就像每位 CEO、部长或教授都拥有一群比自己更聪明的‘学生’作为参谋。”他认为,与更聪明的机器协作并非威胁,而是一种赋能。
JEPA 范式 vs. LLM 范式:两条并行的技术路径
在阐述 Meta 的 AI 研究战略时,Yann LeCun(杨立昆)清晰地区分了两种不同的技术范式:以 JEPA 为代表的非生成式、基于抽象表征学习的架构,以及当前主导市场的大语言模型所代表的生成式架构。
他重申,JEPA 架构的核心在于学习世界的抽象表征,并在此空间中进行预测和规划,它并不直接生成或重建原始数据(如像素或文本)。LeCun 认为,这套范式是实现人类水平智能所必需的长期研究方向,因为它更接近生物智能学习世界模型的方式。Meta 的 FAIR 部门正是将赌注押在了这条路径上,致力于解决三到十年后的前沿问题。
然而,这绝不意味着否定大语言模型的价值。LeCun 明确表示,LLM 在当下有着巨大的应用潜力,Meta 也在积极投入开发,并坚定地支持开源。他强调,相信通向超级智能需要新范式,与承认并开发现有大语言模型的实用性,这两者并不矛盾。Meta 的策略是“长短结合”:一方面通过开源 LLM 推动当前生态发展,另一方面通过 JEPA 等前沿研究布局未来。
这种策略也体现在 Meta 对 AI 产品的规划上。除了聊天机器人,LeCun 提到了更具“智能体”特性的系统:能够在数字世界自主行动、对用户有心理模型(了解用户的知识水平和兴趣)、能规划复杂任务序列(如旅行预订)。此外,Meta 也正大力投入机器人领域,希望将类似的规划能力应用于物理世界。他特别以代码生成为例,指出当前 AI 辅助编程大多是基于已有代码的“复述”,而理想中的系统应能想象代码执行后的状态,并规划指令序列以实现目标——这本质上仍是世界模型和规划能力的问题。
开放、协作与未来挑战
对于实现超级智能的时间表,Yann LeCun(杨立昆)保持了科学家特有的谨慎。他回顾了历代 AI 研究者对预测时间线的失误,表示如果一切顺利,所有技术设想都得以实现,可能在 3 年内就能验证 JEPA 路径是否真正有效,5 年内或许能看到具备猫或老鼠水平物理世界理解能力的原型系统。但要达到人类水平的抽象领域规划能力,很可能比想象中更难。不过,他确信在这一过程中会产生大量有用的中间成果和应用。
谈到未来六个月的优先事项,LeCun 指出团队面临大量待解难题。首先是扩展 V-JEPA 的规模和应用场景,目前模型已在约百万量级的视频上训练,证明了可扩展性。其次,他们相信存在比现有方法更优的 JEPA 训练“配方”,需要继续探索。而最大的挑战之一,是解决“分层规划”问题。
LeCun 用从纽约办公室飞往巴黎的生动例子解释了分层规划:人类无法以毫秒级的肌肉控制来规划整个旅程,而是先制定“去机场-乘飞机”这样的高层抽象计划,再将“去机场”分解为“下楼-打车”等子目标,层层细化直至可执行的动作。这种将复杂任务分解为层次化子目标的能力,是目前 AI 尚未解决的难题,涉及深层的优化和数学问题。
如何攻克这些难题?LeCun 的答案是:开放研究与全球协作。他强调,这本质上是科学问题,而非单纯的工程技术开发,需要汇聚全球学术界、产业界,特别是欧洲公共研究机构的人才与智慧。因此,坚持开放研究、开源代码至关重要。这也正是 Meta 决定将 V-JEPA V2 模型开源的原因——通过共享成果,吸引最广泛的科学共同体共同参与,加速通向超级智能的探索进程。在演讲的最后,LeCun 以此作为结语,重申了开放与协作对于突破 AI 研究深水区不可或缺的价值。










