撰文:Techub News 整理
导语
2025 年 9 月,图灵奖得主、Meta 首席人工智能科学家 Yann LeCun(杨立昆)受邀在哈佛大学数学与科学应用中心(CMSA)发表演讲。在这场面向更广泛听众的讲座中,LeCun 没有重复当下关于大语言模型(LLM)能力的乐观叙事,而是尖锐地指出了当前 AI 架构的根本缺陷,并勾勒了他心目中通向更通用、更接近人类或动物智能的 AI 发展蓝图。作为深度学习先驱和卷积神经网络之父,LeCun 对 AI 未来路径的思考,在业界具有重要的风向标意义。
摘要
- 当前 AI(尤其是大语言模型)在学习和推理能力上远未达到人类或动物水平,其架构存在根本性限制。
- 仅靠文本训练永远无法实现人类水平的 AI,因为文本数据缺乏视觉等模态的丰富性和冗余性。
- 未来的突破在于构建能理解物理世界的「世界模型」,使机器能像婴儿一样通过观察学习常识和直观物理。
- 主流的自回归生成模型会导致「幻觉」且无法进行复杂规划,应转向「联合嵌入预测架构」(JEPA),在抽象表示空间进行预测。
- 实现智能体的关键模块包括:感知、世界模型、记忆、成本函数(目标与护栏),并通过优化进行规划。
当前 AI 的局限:我们离猫的智能还有多远?
Yann LeCun(杨立昆)开篇便抛出一个清醒的论断:我们目前的人工智能技术,距离匹配人类甚至动物的智能还非常遥远。尽管 AI 系统可以通过律师考试、解决数学难题,完成许多对人类而言颇具智力挑战的任务,但它们却无法完成一个十岁孩子第一次被要求「收拾餐桌并启动洗碗机」就能做到的事。一个青少年能在十到二十小时的练习后学会开车且基本不出事故,而我们拥有数百万小时的训练数据,却仍无法实现完全自主(L5级)的自动驾驶汽车,仍需依赖激光雷达和高精地图等辅助。
LeCun 将此现象称为「莫拉维克悖论」的另一个例证:许多对人类来说需要「思考」的任务(如下棋、解积分),对机器而言算法上相对简单;而人类和动物凭借直觉就能完成的感知和行动任务(如抓取、导航),对机器却异常困难。他认为,这揭示了当前 AI 架构和机器学习技术的根本不足。
他进一步用一个简单的估算来强化观点:一个典型的大型语言模型(如 Llama 3)使用约 30 万亿 token(约 10^14 字节)的文本进行训练。一个人需要 40 万年才能读完这些数据。然而,一个四岁孩子在四年清醒时间内通过视觉皮层接收的信息量,大约也是 10^14 字节。虽然视觉信息冗余度更高,但这恰恰是学习世界结构和依赖关系所需要的。「冗余」是学习的前提,从完全随机的比特串中什么也学不到。
这个比较说明了两点:第一,仅通过文本训练永远无法达到人类水平的 AI;第二,如果我们想要制造出真正有用的机器人,还需要取得重大进展。 LeCun 指出,目前许多人形机器人公司展示的炫酷视频背后,一个不为人知的秘密是:他们并不知道如何让这些机器人变得足够智能以应对广泛任务,只能在非常狭窄、经过精心训练的任务中表现良好。
推理与规划:为何自回归模型注定「幻觉」?
LeCun 深入分析了当前主流 AI,特别是大语言模型在推理机制上的局限性。他认为,现有的推理主要依赖于固定层数的前向神经网络传播,这种计算方式能力有限。许多任务需要更复杂的计算,而一种更强大的推理方式是通过「优化」进行。
他描述了一种理想架构:系统有一个「能量函数」,用于衡量输入与一个假设输出之间的「不兼容」程度。推理过程就是搜索能使这个能量值最小化的输出。这种基于优化的推理可以实现「零样本学习」,即无需针对特定问题进行训练,就能产生新的解决方案。这或许更接近人类「系统二」的思维模式——通过思考,运用对世界的心理模型来预测行动后果,从而做出审慎决策。
相比之下,大语言模型采用「自回归预测」:给定一个符号序列窗口,预测下一个符号,然后将预测出的符号移入输入,再预测下一个,如此循环。这种方式存在两个核心问题:
首先,它为生成每个 token 分配了固定量的计算。如果想让它对复杂问题投入更多资源,唯一的办法是「欺骗」它生成更多 token(例如使用「思维链」技巧),但这只是一种变通方案。
其次,也是更严重的问题,自回归生成是一个发散过程。模型在每一步都输出一个可能 token 的概率分布。由于每次选择都可能偏离正确答案的路径,并且一旦偏离就无法回头(因为序列生成是树状结构),导致生成完全错误答案的概率随着序列长度呈指数级增长。这就是 LLM「幻觉」的一个根本原因。 LeCun 强调,人类回答问题并非一个词接一个词地「脱口而出」,而是先形成一个抽象的答案思想,再将其转化为文本。
尽管 LLM 存在这些局限,但其训练简单且扩展性良好的特点使其目前占据主导。然而,LeCun 认为,要实现更通用的智能,我们必须转向能模拟人类和动物「世界模型」能力的架构。
世界模型:智能的基石与 JEPA 的提出
什么是世界模型?LeCun 解释道,它是一个允许系统预测未来、特别是自身行动后果的心理模型。这正是规划和智能行为的基础。婴儿在生命最初几个月就能学习关于世界的基本概念(如物体恒存性、类别)和直观物理(如重力),而我们尚未让机器以类似的方式学习。
一个自然的想法是模仿 LLM,训练一个生成模型来预测视频的下一帧。但 LeCun 指出,这在像素级别上是一个「不可能完成的任务」。因为世界是非确定性的,未来有多种合理可能。如果训练神经网络做出单一预测,最好的结果只能是预测所有可能未来的某种「平均」,导致预测画面模糊不清。虽然可以通过引入潜在变量来参数化不同的可能未来,但这对于自然视频仍然无效,因为无法预测所有细节(如房间纹理、每个人的样貌)。
于是,LeCun 提出了他的解决方案:不要在像素层面预测,而是在「表示层面」预测。 他称之为「联合嵌入预测架构」(Joint-Embedding Predictive Architecture, JEPA)。其核心思想是,通过编码器将输入(如视频)转换为抽象表示,然后训练一个预测器在表示空间中进行预测,从而忽略那些不可预测的细节,使预测任务变得可行。
「这恰恰是我们理解世界的方式,」LeCun 说,「我们寻找那些允许我们进行预测的表示,这些表示会忽略细节。科学的全部目的就是找到这样的表示。」他以行星运行为例:要预测木星一百年后的位置,你不需要知道关于木星的所有细节,只需要六个数字(位置和速度)。找到能消除细节、从而允许预测的适当抽象表示,对科学和智能都至关重要。
他进一步阐述了世界的层次化表示:从量子场、粒子、原子、分子,到蛋白质、细胞、有机体、社会、生态系统。每一层都允许我们做出更宏大、更长远的预测,同时忽略下一层的细节。物理学中的「重正化群」和「熵」的概念正是处理这种抽象的工具。「或许,一个科学领域(至少自然科学)正是由我们选择进行预测的抽象层次所定义的。」 LeCun 总结道。
通往自主智能体的认知架构
拥有世界模型后,如何构建一个完整的智能体?LeCun 展示了他三年前提出并至今坚持的蓝图。一个智能 AI 智能体应包含以下模块:
- 感知模块: 观察世界,估计当前可感知的世界状态。
- 记忆模块: 存储关于世界(如家的状态)的当前不可感知的信息。
- 世界模型: 接收当前状态(感知+记忆)和一个假设的行动序列,预测由此产生的未来状态序列。
- 成本函数: 包括「任务目标」(衡量任务完成度)和「护栏目标」(确保安全、符合约束)。
智能体的运作方式是基于优化的规划:它搜索一个行动序列,使得根据其内部世界模型预测的结果,能够同时最小化任务目标成本并满足护栏目标(即成本保持为零或很低)。「如果你设置了护栏,它别无选择,只能满足它。这是由构造决定的。」 LeCun 强调,这为实现可控、安全的 AI 提供了途径。
然而,现实世界的复杂性和非确定性带来了巨大挑战。世界模型可能是一个从海量数据中学习到的大型神经网络,其输入可能是视频,行动可能是复杂的,成本函数在行动空间可能极其不规则,甚至不连续。此外,世界是非确定性的,需要通过潜在变量来处理多重可能未来,这使得在不确定性下的规划更加复杂。
LeCun 特别指出了「分层规划」的必要性。人类从纽约去巴黎,不会规划每一毫秒的肌肉控制,而是先规划高层动作(去机场、乘飞机),再逐层细化到低层动作(下楼、打车)。这需要一套能在不同时间尺度和抽象层次上工作的分层世界模型。「如何训练一个系统学习适当的抽象层次?然后,一旦拥有它,如何用它进行分层规划?……这完全未解决,是一个开放性问题。」 他鼓励研究者投身于此。
自监督学习与 JEPA 的实践进展
如何通过自监督学习训练世界模型?LeCun 回顾了联合嵌入架构的历史(可追溯到 90 年代的「连体网络」),并重点介绍了近期成功的「蒸馏」方法,如 DINO。这类方法属于「正则化」方法,通过一个巧妙的技巧(让目标编码器的权重是主编码器权重的指数移动平均)来防止模型崩溃,尽管其理论原因尚未完全明晰。
重要的是,当规模扩大时,这类自监督学习方法在图像理解任务上的性能已经匹配甚至超越了需要大量标注数据的纯监督学习方法。「如果你有钱要花,最好把钱花在科学家身上,去微调自监督学习方法并收集无标签数据,而不是花在给人标注数据上。」 LeCun 指出,这是直到2025 年 9 月几个月才明确的结论。
更关键的是,这些学习到的表示可以用于构建世界模型并进行规划。LeCun 展示了其团队在 NYU 和 Meta 的研究成果:
- 使用 DINO 编码器提取图像表示,训练动作条件预测器,成功用于机器人操作任务的零样本规划(如将蓝色筹码推到目标位置)。
- 在机器人导航任务中,训练模型根据当前视图和机器人位移预测下一视图的表示,并能成功规划路径到达指定目标(如蓝色垃圾桶)。
- 最新的 V-JEPA(视频 JEPA)模型,通过掩码视频进行训练,不仅能学习视频的有效表示,还展现出一定的「常识」——当视频中出现违反物理规律的事件(如球突然消失)时,其预测误差会急剧上升。
这些实验证明,基于 JEPA 的世界模型能够使智能体通过规划来完成新任务,无需针对该任务进行强化学习或策略训练。
未来方向与大胆建议
在演讲尾声,LeCun 给出了他对于 AI 未来研究的明确建议,其中不少观点与当前主流背道而驰:
- 放弃生成模型,转向联合嵌入预测架构(JEPA): 生成模型(预测原始输入)仅适用于离散符号(如文本),对于物理世界的连续信号,应在表示空间进行预测。
- 采用基于能量的框架来理解模型: 概率建模(如归一化能量函数)通常导致难以处理的计算,且非必需。
- 放弃对比方法,偏爱正则化方法: 对比方法在高维空间中难以扩展。
- 尽量减少强化学习的使用: 强化学习效率极低,需要大量试错,应作为最后手段。
「当我说出所有这些,这些都是目前机器学习中最流行的概念支柱。这让我不太受欢迎,特别是第一条,在硅谷我得带着保镖出门了——开玩笑的。」LeCun 幽默地说道。他最后总结并呼吁:「如果你有兴趣将 AI 提升到下一个水平,达到人类水平,或者哪怕是猫的水平,不要研究 LLM,去研究 JEPA。」


