撰文:Techub News 整理
导语
2025 年 3 月,Meta 首席 AI 科学家、图灵奖得主 Yann LeCun(杨立昆)做客知名科技播客《Big Technology Podcast》,与主持人 Alex Kantrowitz 进行了一场深度对话。在近一小时的访谈中,LeCun 以他一贯的清晰和批判性思维,剖析了当前以大语言模型(LLM)为主导的 AI 热潮背后的根本局限。作为深度学习先驱和 Meta AI 的掌舵人,LeCun 的观点不仅基于深厚的学术研究,也反映了产业最前沿的思考。他直言不讳地指出,LLM 无法实现真正的科学发现或创新,并阐述了为何以及如何通过全新的架构(如他提出的 JEPA)来迈向具备理解、推理和规划能力的下一代 AI 系统。本次对话是理解当前 AI 发展瓶颈与未来方向的重要窗口。
摘要
- LLM 本质是“复读机”:大语言模型仅能基于训练数据的统计规律进行检索和重组,无法进行真正的推理、规划或提出新问题,因此不可能实现自主的科学发现。
- 规模扩大无法通向 AGI:仅靠增加数据和算力来扩展 LLM,无法达到人类水平的人工智能(AGI)。当前范式已现收益递减,亟需架构层面的根本性革新。
- 理解物理世界是关键瓶颈:人类和动物通过视觉等感官直接学习“常识”和世界如何运作。AI 需要能从视频等非文本数据中学习抽象的世界模型,才能进行可靠的预测和规划。
- “联合嵌入预测架构”(JEPA)是出路之一:LeCun 团队正在研究的 JEPA 等非生成式架构,旨在让 AI 学习世界的抽象表征,从而忽略不可预测的细节,专注于对可能性的高层级预测,这是实现推理和规划的基础。
- 开源加速创新,AGI 不会一蹴而就:开源社区在推动 AI 进步上效率更高,DeepSeek 等成果即是例证。AGI 的实现将是渐进过程,依赖于全球研究社区的集体智慧,而非某个公司的“秘密武器”。
LLM 的“阿喀琉斯之踵”:为何无法诞生爱因斯坦?
访谈始于一个尖锐的问题:为何生成式 AI 已“吞下”人类几乎全部知识,却未能做出任何独立的科学发现?Yann LeCun(杨立昆)的回答直指核心:“从 AI 的角度说,可以;但从大语言模型的角度说,不行。” 他解释道,LLM 的训练基于海量文本,其本质是学习并“复述”符合训练数据统计规律的答案。它们擅长信息检索和重组,甚至能产生令人惊艳的文本,但在最纯粹的形式下,它们“完全无法发明新事物”。
LeCun 引用了他与 Hugging Face 联合创始人 Thomas Wolf 的讨论。Wolf 曾指出,要创造“数据中心里的爱因斯坦”,需要的不是一个知晓所有答案的系统,而是一个能提出“无人想过或敢问”之问题的系统。LeCun 对此表示完全赞同,并强调“以目前的形式,LLM 做不到这一点”。他比喻道,人类大脑中负责语言输出的布罗卡区(Broca‘s area)很小,就像是我们的“LLM”。但真正的思考发生在更广阔的脑区,我们通过心理表征和世界模型进行思考,这恰恰是 LLM 所缺失的“真正的智能”。
他将智能能力分为三个层次:记忆与检索、解决问题(给定问题,找到方案)以及最高级的提出正确问题。LLM 只在第一层表现出色,在第二层(解决新问题)表现不佳,在第三层(提出新问题)则完全无能为力。这也是为什么他认为,即使一个 LLM 能像博士一样回答问题,它也并非真正的博士,因为它缺乏发明新解决方案的核心能力。
“推理”的幻觉与物理理解的缺失
当主持人提及当前 AI 领域正试图为 LLM 添加“推理”能力,例如通过“思维链”(Chain-of-Thought)技术时,LeCun 指出了其中的根本局限。他认为,这些方法只是在现有范式上“打补丁”,试图通过让模型生成更多中间令牌(tokens)来分配更多计算资源,但“这并不能产生真正的推理”。
LeCun 阐述了古典 AI 中对“推理”的经典定义:在可能的解决方案空间中搜索,直到找到满足约束条件的解。而 LLM 内部完全没有这种搜索机制。当前一些方法让 LLM 生成大量答案序列,再由另一个系统挑选最佳答案,这就像随机生成代码指令然后测试哪个能运行一样,效率极低,并非真正的推理。
更关键的是,人类和动物的推理并非发生在“令牌空间”(即语言文本)。我们是在内心操纵对世界的心理模型来进行推理和规划的。LeCun 举了一个生动的例子:想象一个漂浮的立方体,将其沿垂直轴旋转90度,你立刻能“看到”结果——它看起来和原来一样。这种基于抽象、连续空间的心理模拟,是 LLM 完全无法实现的。
对于近期一些 AI 视频生成模型(如 Sora)似乎表现出对物理世界的理解,LeCun 持怀疑态度。他认为这更多是针对特定场景(如人类动作)收集大量数据训练的结果,而非对物理规律的真正理解。他举例说,如果让系统生成“汽车撞上干草堆”的视频,可能会出现干草堆从引擎盖里长出来的荒谬画面。这暴露了系统缺乏对物体持久性、因果关系等基本物理常识的理解。“通过生成像素来理解世界,这不是正确的路径。” LeCun 总结道。
数据墙与投资热潮背后的隐忧
LeCun 明确表示,当前 LLM 的发展正在接近“收益递减”的拐点。模型已经使用了近乎整个互联网的公开文本数据进行训练(约10^13至10^14个令牌)。虽然可以通过合成数据或雇佣专家(如 PhD)来生成更多数据填补空白,但成本飙升而收益增长有限。“我们需要一个新的范式。”
他特别指出了当前热门的“智能体”(Agentic Systems)概念面临的尴尬:人人都在谈论,但除了让系统复现训练过的模式外,没人真正知道如何构建能解决全新问题的智能体。这需要系统具备面对新情况时“零样本”或快速学习解决问题的能力,如同人类学开车,初期需要全神贯注(系统二),熟练后则变为下意识行为(系统一)。
面对全球涌入 AI 领域的巨额投资(如 OpenAI、Anthropic 的数十亿美元融资),LeCun 提醒人们注意“时间线错配”的风险。他斩钉截铁地表示:“仅通过扩大 LLM 的规模,我们绝对无法达到人类水平的 AI……两年内绝无可能(no way in hell)。” 那种认为很快就能在数据中心里拥有“天才国度”的想法被他斥为“完全胡说八道”。
不过,他也分析了大型科技公司(如 Meta、微软、谷歌)投资的合理性:大部分资金流向了推理所需的基础设施建设。例如,Meta 计划年底前通过智能眼镜、独立应用等让10亿用户用上 Meta AI,这需要巨大的计算资源。因此,即使新范式革命没有在未来两三年内到来,这些基础设施投资仍有其市场和价值,属于不得不做的战略布局。
然而,对于企业级应用,问题更为棘手。LeCun 承认,当前 AI 系统在从“惊艳演示”到“可靠部署”的“最后一英里”上面临巨大挑战,就像自动驾驶领域十年来的困境一样。系统可能存在5%的幻觉率,而这未知的5%错误在关键企业应用中是不可接受的。他回顾了历史上 AI 的起伏周期,如1980年代的专家系统热潮及其后的“AI 寒冬”,暗示如果期望过高而进展不及预期,行业可能再次面临调整。但他也强调,这次的基础更为坚实,应用也更广泛。
新范式初探:JEPA 与学习世界模型
那么,LeCun 心目中的新范式是什么?他将其核心概括为四个关键能力:理解物理世界、拥有持久记忆、能够推理、能够规划。这要求 AI 能够像婴儿一样,从视频等自然传感器数据中学习“常识”,而非仅仅从人类生产的文本中学习。
LeCun 指出,一个孩子在大约四年的清醒时间里,通过视觉接收的数据量(约10^14字节)与最大规模 LLM 的训练数据量级相当。但孩子在这期间学会了直观物理学的全部基础(重力、物体持久性、动量守恒等),而 LLM 却难以掌握。这凸显了文本信息的“贫瘠”以及从丰富感官数据中学习的必要性。
他介绍了其团队长期致力的解决方案:“联合嵌入预测架构”(Joint Embedding Predictive Architecture, JEPA)。这源于他对“自监督学习”的深入研究。LLM 是自监督学习在文本上的成功特例:通过预测下一个词来学习。但将同样的生成式、重建式方法应用于图像或视频时,效果不佳,因为在高维连续空间中表示所有可能性的概率分布极其困难。
JEPA 则采取了不同的路径。它不是生成或重建像素,而是学习数据的抽象表征(嵌入)。具体而言,系统同时处理完整图像(或视频)和经过掩码遮挡的版本,分别通过编码器得到它们的抽象表征,然后训练一个预测器,根据遮挡版本的表征来预测完整版本的表征。关键在于,系统学习的是在抽象表征空间中进行预测,从而自动忽略那些不可预测的底层细节(如一滴水下落的精确轨迹),专注于高层级、本质的预测(如水会洒出来)。
LeCun 透露,他们在视频上的 JEPA(V-JEPA)已取得积极进展。当系统在大量自然视频上训练后,给它播放一段物理上不可能的视频(如物体凭空消失),模型的预测误差会急剧飙升,这表明它已经内化了一些关于世界可能性的“常识”。更进一步的,动作条件化的 JEPA 可以让系统学习“状态-动作-结果”的模型,从而在抽象空间中预测行动后果,并逆向搜索达成目标的最优行动序列——这才是真正的规划和推理。
他强调,JEPA 这类架构是让机器获得“世界模型”的关键一步,而世界模型是实现可靠推理、规划和真正智能体的基石。他预测,这方面的实质性进展可能需要3到5年时间,并将是一个渐进的过程,而非某个突然的突破。
开源的力量与 AGI 的未来之路
在访谈最后,LeCun 简短而有力地表达了对开源 AI 的坚定支持。当被问及像 DeepSeek 这样的开源模型是否已超越专有模型时,他表示“超越”一词或许过于强烈,但“开源世界的进步无疑更快”。
他指出,开源模式能汇聚全球的智慧与创意,没有任何一个实体能垄断好的想法。DeepSeek 的成功表明,一个拥有长期视野和宽松约束的小团队,完全可以催生出颠覆性的新思路。而开源分享则能让整个生态加速前进。在商业部署上,许多客户在原型阶段可能使用专有 API,但在生产环境中往往会转向 Llama 等开源引擎,因其成本更低、更安全、可控,且可本地部署。
LeCun 也驳斥了所谓“开源会帮助竞争对手(如中国)”的狭隘观点。他以2015年最具影响力的深度学习论文之一“ResNet”出自微软亚洲研究院(北京)为例,说明顶尖科学家和创意遍布全球。首个 Llama 模型也来自 Meta 在巴黎的小团队。“硅谷并不垄断好的创意。” 他认为,要想科学技术快速发展,必须利用全世界多元化的思想和创造力,而开源正是实现这一点的最佳方式。
关于 AGI(通用人工智能)的未来,LeCun 的展望是务实而开放的:它不会是一个由某个公司突然揭晓的“秘密武器”,也不会是“前一天没有 AGI,后一天就有了”的孤立事件。AGI 将是一个持续的、渐进的过程,由全球研究社区共同推动,融合众多理念,并在试错中前进。那些分享研究成果的人,将比那些封闭的人走得更快。这或许正是 Yann LeCun(杨立昆)——这位“AI 教父”——在喧嚣的技术热潮中,为我们指出的那条通向真正智能的、更加坚实可靠的道路。










