Meta 首席 AI 科学家 Yann LeCun(杨立昆):人类智能并非通用智能撰文:Techub News 整理
导语
2025 年 4 月,Meta 首席 AI 科学家、图灵奖得主 Yann LeCun(杨立昆)做客知名播客 AI Inside,与主持人 Jason 和 Jeff 进行了一场长达 46 分钟的深度对话。作为深度学习领域的奠基人之一,LeCun 以其对技术发展冷静、务实的判断而著称。在当前生成式 AI 与大语言模型(LLM)席卷全球、业界对通用人工智能(AGI)的讨论甚嚣尘上之际,他的观点尤为值得关注。本次对话中,LeCun 不仅尖锐地指出了 LLM 的天花板,更系统阐述了他心中通往更高级机器智能的必由之路——构建能理解物理世界的“世界模型”。
摘要
LLM 有用但非终极答案:LLM 在代码助手等特定领域价值显著,但其基于自回归预测的机制存在根本局限,无法可靠处理真实世界复杂任务。
人类智能远非“通用”:所谓“通用智能”是误导性概念,人类智能高度特化,由进化塑造以解决生存相关任务,AI 的目标应是实现“人类级别智能”。
下一代 AI 需构建“世界模型”:实现人类级别智能的关键在于让机器像人类和动物一样,通过观察学习物理世界的运作规律,形成可预测和规划的内部心理模型。
开源是加速创新的核心策略:Meta 开源 Llama 系列模型旨在激活全球创新生态,这对促进学术研究、催生多元化 AI 应用及防止技术垄断至关重要。
未来属于“智能助手群”:终极产品形态是围绕个人的多个智能助手,它们将中介所有数字交互,其多样性(语言、文化、价值观)是健康生态的基石。
LLM 的辉煌与局限:我们为何尚未触及智能核心
对话伊始,主持人便抛出了当前 AI 界的核心矛盾:一方面,以 OpenAI 为代表的公司凭借 LLM 技术获得破纪录融资,行业热情高涨;另一方面,包括 Yann LeCun(杨立昆)在内的许多研究者却不断强调 LLM 的局限性,认为其回报正在递减。对此,LeCun 首先肯定了 LLM 的实用性,特别是在代码助手等场景。但他随即指出,从令人惊艳的演示到真正可靠、可供日常使用的系统,其间存在巨大鸿沟。他以自动驾驶为例,十年前就有演示,但至今仍未达到人类水平的可靠性。
LeCun 回顾了 AI 七十年的发展史,指出一种反复出现的模式:每当有新范式出现(如专家系统、深度学习),人们便宣称“就是它了,十年内机器将成为地球上最聪明的实体”。然而每次预言都落空了,因为新范式要么遇到了未曾预见的限制,要么只是擅长解决某个子类问题,而非真正的通用智能问题。LLM 很可能正面临类似的局面。
“我不想贬低 LLM,它们很有用,值得投资。” LeCun 强调,投资大部分流向了运行 LLM 的基础设施,而非训练本身。就像所有计算机技术一样,即使达不到人类智能水平,LLM 也可以很有用。但如果我们以人类级别智能为目标,“我们需要发明新技术。我们还远未达到那个水平。”
主持人 Jeff 提到,LeCun 曾将当前最先进的 AI 系统类比为“聪明的猫”或“三岁小孩”。LeCun 甚至认为这个评价可能过高了。他指出,尽管 LLM 能通过律师考试、总结文本、生成代码,但这些能力很大程度上依赖于在训练数据中见过的模式。当面对全新的、未曾见过的问题时——例如最新的数学奥林匹克竞赛题目——最好的 LLM 表现也近乎为零。这暴露了当前系统缺乏真正理解和解决新问题的能力。
LeCun 犀利地指出,LLM 操纵语言的能力让我们误以为它们很聪明,因为我们习惯将语言能力与智慧挂钩。然而,真正的考验在于现实世界:“我的家用机器人在哪里?我的 L5 级自动驾驶汽车在哪里?能做出猫那样行为的机器人(哪怕是模拟的)又在哪里?” 问题的关键不是造不出具有相应物理能力的机器人,而是无法让它们足够“聪明”。处理现实世界、产生实际动作的系统,远比处理语言的系统要复杂得多,因为现实世界是混乱、不可预测、非确定性的连续高维空间。
通往人类级别智能之路:世界模型与非生成式架构
那么,研究应该走向何方?LeCun 透露,早在三年前(即 LLM 席卷全球之前),他就撰写了一篇长文,勾勒了未来十年 AI 研究的方向,而这一愿景并未因 LLM 的成功而改变。他认为,要实现人类级别智能,机器需要具备四个关键能力:理解物理世界、进行推理与规划、拥有持久记忆,以及安全可控。
这一切的核心是一个称为“世界模型”的概念。人类和动物大脑中都有一个世界模型,它是一个心理模型,允许我们预测世界将发生什么,或者我们采取某个行动会带来什么后果。如果我们能预测行动的后果,那么当我们设定一个目标时,就可以利用世界模型来“想象”特定的行动序列是否能实现该目标,这就是规划和推理的本质——心理学家称之为“系统 2”的深思熟虑的思维过程。
在机器人学和控制理论中,类似的概念被称为“模型预测控制”,即通过方程预测行动后果并优化行动序列。但关键区别在于,对于通用 AI 系统,这个世界模型必须能从经验或观察中学习,就像婴儿通过观察学习世界如何运作一样。这部分是目前最难复现的。
LeCun 认为,实现这一目标可以基于一个简单原则:自监督学习。这正是 LLM 成功的基础——通过预测文本中的下一个词来训练。我们可以设想将这一原则应用于图像和视频,训练一个大型神经网络预测视频的下一帧或后续发展。如果系统能学好并做出准确预测,就意味着它理解了物理世界的许多底层规律。
然而,直接套用文本预测的方法到视频上却行不通。预测下一帧太简单,学不到有用东西;预测长期发展又极其困难,因为视频中有太多可能性。文本预测之所以可行,是因为词典大小有限,可以预测所有词的概率分布。但对于视频,我们不知道如何表示所有可能图像或视频帧的合适概率分布,这在数学上是难以处理的。
大约五六年前,LeCun 及其团队提出了一个解决方案:改变架构思路。不再预测视频中的所有细节,而是训练系统学习视频的一种“表示”,并在这个表示空间中进行预测。 这种表示会过滤掉视频中不可预测或无用的细节。这种架构被称为“联合嵌入预测架构”(JEPA)。
LeCun 透露了一个可能令人惊讶的观点:“我的直觉是,下一代 AI 系统将基于非生成式模型。” 在当前所有人都在谈论生成式 AI 的浪潮中,这无疑是一个反主流的前瞻性判断。JEPA 正是这样一种非生成式架构的代表,它专注于学习数据的抽象表示和它们之间的关系,而非生成具体的像素或词汇。
AGI 迷思与开源哲学:为何多样性是未来关键
对于业界热炒的“AGI”概念,LeCun 直言不讳地称之为“无稽之谈”,并且极具误导性。他认为,如果 AGI 指的是“像人类智能一样通用”的智能,那么这个说法本身就错了,因为“人类智能根本不通用,它极度特化。” 人类被进化塑造成只擅长完成与生存相关的任务。我们无法构想那些我们无法处理的问题,这反而让我们误以为自己拥有通用智能。在 Meta 内部,他们更倾向于使用“高级机器智能”或直接称为“人类级别智能”。
LeCun 坚信,未来某个时刻,机器在人类擅长的所有领域至少会与人类一样聪明,甚至更聪明。但这不会发生在明年或后年,可能在十年内取得一定进展。“如果目前我们正在研究的所有方向都取得成功,那么也许十年后,我们就能更好地判断是否能实现那个目标。” 他保持乐观,但强调这很可能比我们想象的更难,AI 史上的每一次突破都比预期更艰难。
话题转向 Meta 的开源策略。主持人 Jeff 盛赞开源 Llama 模型对学术界和创业生态的巨大推动作用,并询问其背后的战略思考。LeCun 明确表示,开源 Llama 对少数几家(暗指闭源商业公司)来说是“搅局者”,但对成千上万的公司和研究者来说是“赋能者”。从伦理角度看,这显然是正确之举,它极大地激活了整个 AI 生态系统。
LeCun 指出,Meta 的最终产品愿景是构建 AI 助手,甚至是一组 AI 助手,它们可能常驻于智能眼镜中,与我们随时相伴。为了让这些助手发挥最大效用,它们需要达到人类级别的智能。而实现这一目标,是当今世界面临的最大科技挑战之一,需要汇聚全球的智慧。“好点子可能来自世界任何地方。” 他提到近期 DeepSeek 的崛起令硅谷惊讶,但在开源世界看来却不足为奇,这正是开源理念的验证。
他批评了某些地区(暗指硅谷部分人士)存在的“极度膨胀的优越感”,认为没有人能垄断好创意。AI 过去十几年的快速发展,正是得益于代码和科学信息的共享。而 Meta 的商业模式依赖于广告和社交网络的网络效应,而非直接售卖 AI 技术本身,因此开源技术不仅无害,反而有益。
展望未来,LeCun 描绘了一幅图景:我们与数字世界的绝大多数交互将由 AI 系统中介。搜索引擎可能会被直接与 AI 助手对话所取代。更重要的是,作为全球公民,没有人会希望自己的信息食谱仅由美国西海岸或中国少数几家公司打造的 AI 助手来提供。 我们需要高度多样化的 AI 助手,它们能说各种语言(包括小众方言),理解不同的文化、价值体系和偏见。这就像我们需要多元化的媒体一样。
实现这种文化多样性的唯一现实途径,就是让世界各地的人们能够基于强大的开源基础模型来构建自己的助手,因为他们没有资源从头训练模型。LeCun 预见,市场压力将促使 AI 基础模型走向开源和免费,就像互联网的软件基础设施(Linux 和商用硬件)最终战胜了专有系统一样。AI 基础模型将成为类似互联网基础设施的存在,由大型公司或国际联盟训练,但开放给全球创新者在其之上构建丰富多彩的应用。这,才是 Yann LeCun(杨立昆)所坚信的、能够引领我们走向真正高级机器智能的健康生态。
Meta AI 首席科学家 Yann LeCun(杨立昆):V-JEPA 与通向超级智能的路线图撰文:Techub News 整理
导语
在巴黎举行的欧洲顶级科技盛会 VivaTech 2024 上,Meta 首席人工智能科学家、纽约大学教授 Yann LeCun(杨立昆)发表了主题演讲,并与《金融时报》AI 记者进行了一场深度对话。作为深度学习领域的奠基人之一,LeCun 一直引领着 Meta 在人工智能基础研究方面的前沿探索。此次对话的核心,围绕其团队最新发布的视频联合嵌入预测架构模型 V-JEPA V2 展开,并深入探讨了 Meta 实现人类水平乃至超级人工智能的长期战略路线图。在当前 AI 模型能力竞赛白热化的背景下,LeCun 提出了与主流生成式大语言模型(LLM)不同的技术路径,其观点对理解 AI 的未来发展方向具有重要参考价值。
摘要
V-JEPA V2 是一个旨在让 AI 理解物理世界、并具备初步推理与规划能力的视频预测模型,其核心在于学习世界的抽象表征而非像素级重建。
LeCun 认为,实现人类水平智能(AGI)需要克服四大挑战:理解物理世界、拥有持久记忆、具备推理能力、能够规划,并确保系统的可控与安全。
Meta 的长期目标是发展“友好机器智能”(AMI),并最终实现“人工超级智能”(ASI),即 AI 在多数领域超越人类,成为人类智能的增强工具。
以 JEPA 为代表的非生成式、基于抽象表征学习的架构,是 Meta 为实现超级智能所押注的长期研究范式,与当前主流的生成式 LLM 路径并行。
LeCun 强调开放研究与合作的重要性,并宣布 V-JEPA V2 模型将开源,以汇聚全球科学界智慧共同攻克规划、分层推理等核心难题。
V-JEPA V2:让 AI 学会“想象”物理世界
Yann LeCun(杨立昆)开宗明义地介绍了 V-JEPA V2 模型的目标:推动 AI 在理解物理世界、进行推理和规划这三个关键挑战上取得进展。他指出,当前大多数 AI 系统缺乏对物理世界的基本常识,而 V-JEPA 正是为此设计的“第一步”。
与直接预测视频下一帧像素的传统方法不同,V-JEPA 采用了一种名为“联合嵌入预测架构”的方法。其核心思想是:系统并不试图精确重建缺失的视频细节,而是学习视频的抽象表征。在这个抽象空间中,大量无关细节被过滤,系统专注于预测世界状态的变化趋势。LeCun 比喻道,这就像人类无需记住每一片树叶的飘动轨迹,却能理解风吹树摇的因果关系。这种从像素预测到抽象表征预测的转变,是模型能够有效学习物理规律的关键。
V-JEPA 的训练过程分为两阶段。第一阶段,通过海量视频进行自监督学习,让模型学会预测视频中缺失部分(无论是时间上还是空间上)的抽象表征。第二阶段,则利用这些学到的表征来训练一个“世界模型”。这个世界模型能够根据当前观察到的世界状态(一段短视频)和一个假设的动作(例如机器人手臂的移动),预测执行该动作后世界状态将如何变化。
“一旦拥有了这样的世界模型,”LeCun 解释道,“系统就可以在‘脑海’中模拟一系列动作的后果,从而规划出能够达成特定目标(如抓取物体、开门)的动作序列。”虽然目前展示的任务相对简单,但其突破性在于,系统并非通过针对这些任务的专门训练学会的,而是纯粹通过其内建的世界模型进行推理和规划得出的。这为构建具备通用规划能力的智能体奠定了基础。
从 AMI 到 ASI:Meta 的超级智能蓝图
当话题转向人工智能的终极目标——人工通用智能时,Yann LeCun(杨立昆)表达了对“AGI”这一术语的保留意见。他认为,“通用”一词建立在人类智能是“通用”的这一假设上,而事实上人类智能相当 specialized(专门化)。许多动物在某些方面比人类更聪明,计算机在特定任务上也早已超越人类。
因此,他更倾向于使用 Meta 内部常用的两个概念:ASI 和 AMI。ASI 即“人工超级智能”,指在大多数领域达到并超越人类水平的智能系统。LeCun 强调,超级智能不等于通用智能,它意味着 AI 能在众多任务上比人类做得更好,而这正是计算机辅助人类的本质——弥补人类不擅长之处。
而 AMI,在法语中发音类似“朋友”,全称为“友好机器智能”。这是 Meta 为实现 ASI 制定的具体技术蓝图和路线图。LeCun 透露,这实际上是公司十年前就已设定的长期目标,当时更多是探索性研究,而现在正逐渐转变为清晰的产品战略方向。AMI 旨在系统性地攻克他之前提到的几大挑战:让系统理解物理世界、拥有常识和持久记忆、能够推理和规划,并且确保其可控与安全。
对于2025 年 6 月媒体报道 Meta 计划成立新的超级智能 AI 部门,LeCun 没有直接评论具体人事,但指出这反映了公司内部将这一长期愿景变为现实的决心正在加强。他表示,Meta 基础人工智能研究部门的目标自创立之初就是实现并超越人类智能,现在只是路径变得更加清晰,而 V-JEPA 正是沿此方向迈出的一步。
展望超级智能的具体形态,LeCun 描绘了一个人人拥有 AI 助手的未来。这些助手内置于智能眼镜等设备中,可以随时对话、回答问题、提供信息,如同拥有一支比你自己更聪明的虚拟团队随时协助。“这将极大地增强个人能力,”他说,“就像每位 CEO、部长或教授都拥有一群比自己更聪明的‘学生’作为参谋。”他认为,与更聪明的机器协作并非威胁,而是一种赋能。
JEPA 范式 vs. LLM 范式:两条并行的技术路径
在阐述 Meta 的 AI 研究战略时,Yann LeCun(杨立昆)清晰地区分了两种不同的技术范式:以 JEPA 为代表的非生成式、基于抽象表征学习的架构,以及当前主导市场的大语言模型所代表的生成式架构。
他重申,JEPA 架构的核心在于学习世界的抽象表征,并在此空间中进行预测和规划,它并不直接生成或重建原始数据(如像素或文本)。LeCun 认为,这套范式是实现人类水平智能所必需的长期研究方向,因为它更接近生物智能学习世界模型的方式。Meta 的 FAIR 部门正是将赌注押在了这条路径上,致力于解决三到十年后的前沿问题。
然而,这绝不意味着否定大语言模型的价值。LeCun 明确表示,LLM 在当下有着巨大的应用潜力,Meta 也在积极投入开发,并坚定地支持开源。他强调,相信通向超级智能需要新范式,与承认并开发现有大语言模型的实用性,这两者并不矛盾。Meta 的策略是“长短结合”:一方面通过开源 LLM 推动当前生态发展,另一方面通过 JEPA 等前沿研究布局未来。
这种策略也体现在 Meta 对 AI 产品的规划上。除了聊天机器人,LeCun 提到了更具“智能体”特性的系统:能够在数字世界自主行动、对用户有心理模型(了解用户的知识水平和兴趣)、能规划复杂任务序列(如旅行预订)。此外,Meta 也正大力投入机器人领域,希望将类似的规划能力应用于物理世界。他特别以代码生成为例,指出当前 AI 辅助编程大多是基于已有代码的“复述”,而理想中的系统应能想象代码执行后的状态,并规划指令序列以实现目标——这本质上仍是世界模型和规划能力的问题。
开放、协作与未来挑战
对于实现超级智能的时间表,Yann LeCun(杨立昆)保持了科学家特有的谨慎。他回顾了历代 AI 研究者对预测时间线的失误,表示如果一切顺利,所有技术设想都得以实现,可能在 3 年内就能验证 JEPA 路径是否真正有效,5 年内或许能看到具备猫或老鼠水平物理世界理解能力的原型系统。但要达到人类水平的抽象领域规划能力,很可能比想象中更难。不过,他确信在这一过程中会产生大量有用的中间成果和应用。
谈到未来六个月的优先事项,LeCun 指出团队面临大量待解难题。首先是扩展 V-JEPA 的规模和应用场景,目前模型已在约百万量级的视频上训练,证明了可扩展性。其次,他们相信存在比现有方法更优的 JEPA 训练“配方”,需要继续探索。而最大的挑战之一,是解决“分层规划”问题。
LeCun 用从纽约办公室飞往巴黎的生动例子解释了分层规划:人类无法以毫秒级的肌肉控制来规划整个旅程,而是先制定“去机场-乘飞机”这样的高层抽象计划,再将“去机场”分解为“下楼-打车”等子目标,层层细化直至可执行的动作。这种将复杂任务分解为层次化子目标的能力,是目前 AI 尚未解决的难题,涉及深层的优化和数学问题。
如何攻克这些难题?LeCun 的答案是:开放研究与全球协作。他强调,这本质上是科学问题,而非单纯的工程技术开发,需要汇聚全球学术界、产业界,特别是欧洲公共研究机构的人才与智慧。因此,坚持开放研究、开源代码至关重要。这也正是 Meta 决定将 V-JEPA V2 模型开源的原因——通过共享成果,吸引最广泛的科学共同体共同参与,加速通向超级智能的探索进程。在演讲的最后,LeCun 以此作为结语,重申了开放与协作对于突破 AI 研究深水区不可或缺的价值。
Meta 首席 AI 科学家 Yann LeCun(杨立昆):LLM 无法实现科学发现,通往 AGI 需要新范式撰文:Techub News 整理
导语
2025 年 3 月,Meta 首席 AI 科学家、图灵奖得主 Yann LeCun(杨立昆)做客知名科技播客《Big Technology Podcast》,与主持人 Alex Kantrowitz 进行了一场深度对话。在近一小时的访谈中,LeCun 以他一贯的清晰和批判性思维,剖析了当前以大语言模型(LLM)为主导的 AI 热潮背后的根本局限。作为深度学习先驱和 Meta AI 的掌舵人,LeCun 的观点不仅基于深厚的学术研究,也反映了产业最前沿的思考。他直言不讳地指出,LLM 无法实现真正的科学发现或创新,并阐述了为何以及如何通过全新的架构(如他提出的 JEPA)来迈向具备理解、推理和规划能力的下一代 AI 系统。本次对话是理解当前 AI 发展瓶颈与未来方向的重要窗口。
摘要
LLM 本质是“复读机”:大语言模型仅能基于训练数据的统计规律进行检索和重组,无法进行真正的推理、规划或提出新问题,因此不可能实现自主的科学发现。
规模扩大无法通向 AGI:仅靠增加数据和算力来扩展 LLM,无法达到人类水平的人工智能(AGI)。当前范式已现收益递减,亟需架构层面的根本性革新。
理解物理世界是关键瓶颈:人类和动物通过视觉等感官直接学习“常识”和世界如何运作。AI 需要能从视频等非文本数据中学习抽象的世界模型,才能进行可靠的预测和规划。
“联合嵌入预测架构”(JEPA)是出路之一:LeCun 团队正在研究的 JEPA 等非生成式架构,旨在让 AI 学习世界的抽象表征,从而忽略不可预测的细节,专注于对可能性的高层级预测,这是实现推理和规划的基础。
开源加速创新,AGI 不会一蹴而就:开源社区在推动 AI 进步上效率更高,DeepSeek 等成果即是例证。AGI 的实现将是渐进过程,依赖于全球研究社区的集体智慧,而非某个公司的“秘密武器”。
LLM 的“阿喀琉斯之踵”:为何无法诞生爱因斯坦?
访谈始于一个尖锐的问题:为何生成式 AI 已“吞下”人类几乎全部知识,却未能做出任何独立的科学发现?Yann LeCun(杨立昆)的回答直指核心:“从 AI 的角度说,可以;但从大语言模型的角度说,不行。” 他解释道,LLM 的训练基于海量文本,其本质是学习并“复述”符合训练数据统计规律的答案。它们擅长信息检索和重组,甚至能产生令人惊艳的文本,但在最纯粹的形式下,它们“完全无法发明新事物”。
LeCun 引用了他与 Hugging Face 联合创始人 Thomas Wolf 的讨论。Wolf 曾指出,要创造“数据中心里的爱因斯坦”,需要的不是一个知晓所有答案的系统,而是一个能提出“无人想过或敢问”之问题的系统。LeCun 对此表示完全赞同,并强调“以目前的形式,LLM 做不到这一点”。他比喻道,人类大脑中负责语言输出的布罗卡区(Broca‘s area)很小,就像是我们的“LLM”。但真正的思考发生在更广阔的脑区,我们通过心理表征和世界模型进行思考,这恰恰是 LLM 所缺失的“真正的智能”。
他将智能能力分为三个层次:记忆与检索、解决问题(给定问题,找到方案)以及最高级的提出正确问题。LLM 只在第一层表现出色,在第二层(解决新问题)表现不佳,在第三层(提出新问题)则完全无能为力。这也是为什么他认为,即使一个 LLM 能像博士一样回答问题,它也并非真正的博士,因为它缺乏发明新解决方案的核心能力。
“推理”的幻觉与物理理解的缺失
当主持人提及当前 AI 领域正试图为 LLM 添加“推理”能力,例如通过“思维链”(Chain-of-Thought)技术时,LeCun 指出了其中的根本局限。他认为,这些方法只是在现有范式上“打补丁”,试图通过让模型生成更多中间令牌(tokens)来分配更多计算资源,但“这并不能产生真正的推理”。
LeCun 阐述了古典 AI 中对“推理”的经典定义:在可能的解决方案空间中搜索,直到找到满足约束条件的解。而 LLM 内部完全没有这种搜索机制。当前一些方法让 LLM 生成大量答案序列,再由另一个系统挑选最佳答案,这就像随机生成代码指令然后测试哪个能运行一样,效率极低,并非真正的推理。
更关键的是,人类和动物的推理并非发生在“令牌空间”(即语言文本)。我们是在内心操纵对世界的心理模型来进行推理和规划的。LeCun 举了一个生动的例子:想象一个漂浮的立方体,将其沿垂直轴旋转90度,你立刻能“看到”结果——它看起来和原来一样。这种基于抽象、连续空间的心理模拟,是 LLM 完全无法实现的。
对于近期一些 AI 视频生成模型(如 Sora)似乎表现出对物理世界的理解,LeCun 持怀疑态度。他认为这更多是针对特定场景(如人类动作)收集大量数据训练的结果,而非对物理规律的真正理解。他举例说,如果让系统生成“汽车撞上干草堆”的视频,可能会出现干草堆从引擎盖里长出来的荒谬画面。这暴露了系统缺乏对物体持久性、因果关系等基本物理常识的理解。“通过生成像素来理解世界,这不是正确的路径。” LeCun 总结道。
数据墙与投资热潮背后的隐忧
LeCun 明确表示,当前 LLM 的发展正在接近“收益递减”的拐点。模型已经使用了近乎整个互联网的公开文本数据进行训练(约10^13至10^14个令牌)。虽然可以通过合成数据或雇佣专家(如 PhD)来生成更多数据填补空白,但成本飙升而收益增长有限。“我们需要一个新的范式。”
他特别指出了当前热门的“智能体”(Agentic Systems)概念面临的尴尬:人人都在谈论,但除了让系统复现训练过的模式外,没人真正知道如何构建能解决全新问题的智能体。这需要系统具备面对新情况时“零样本”或快速学习解决问题的能力,如同人类学开车,初期需要全神贯注(系统二),熟练后则变为下意识行为(系统一)。
面对全球涌入 AI 领域的巨额投资(如 OpenAI、Anthropic 的数十亿美元融资),LeCun 提醒人们注意“时间线错配”的风险。他斩钉截铁地表示:“仅通过扩大 LLM 的规模,我们绝对无法达到人类水平的 AI……两年内绝无可能(no way in hell)。” 那种认为很快就能在数据中心里拥有“天才国度”的想法被他斥为“完全胡说八道”。
不过,他也分析了大型科技公司(如 Meta、微软、谷歌)投资的合理性:大部分资金流向了推理所需的基础设施建设。例如,Meta 计划年底前通过智能眼镜、独立应用等让10亿用户用上 Meta AI,这需要巨大的计算资源。因此,即使新范式革命没有在未来两三年内到来,这些基础设施投资仍有其市场和价值,属于不得不做的战略布局。
然而,对于企业级应用,问题更为棘手。LeCun 承认,当前 AI 系统在从“惊艳演示”到“可靠部署”的“最后一英里”上面临巨大挑战,就像自动驾驶领域十年来的困境一样。系统可能存在5%的幻觉率,而这未知的5%错误在关键企业应用中是不可接受的。他回顾了历史上 AI 的起伏周期,如1980年代的专家系统热潮及其后的“AI 寒冬”,暗示如果期望过高而进展不及预期,行业可能再次面临调整。但他也强调,这次的基础更为坚实,应用也更广泛。
新范式初探:JEPA 与学习世界模型
那么,LeCun 心目中的新范式是什么?他将其核心概括为四个关键能力:理解物理世界、拥有持久记忆、能够推理、能够规划。这要求 AI 能够像婴儿一样,从视频等自然传感器数据中学习“常识”,而非仅仅从人类生产的文本中学习。
LeCun 指出,一个孩子在大约四年的清醒时间里,通过视觉接收的数据量(约10^14字节)与最大规模 LLM 的训练数据量级相当。但孩子在这期间学会了直观物理学的全部基础(重力、物体持久性、动量守恒等),而 LLM 却难以掌握。这凸显了文本信息的“贫瘠”以及从丰富感官数据中学习的必要性。
他介绍了其团队长期致力的解决方案:“联合嵌入预测架构”(Joint Embedding Predictive Architecture, JEPA)。这源于他对“自监督学习”的深入研究。LLM 是自监督学习在文本上的成功特例:通过预测下一个词来学习。但将同样的生成式、重建式方法应用于图像或视频时,效果不佳,因为在高维连续空间中表示所有可能性的概率分布极其困难。
JEPA 则采取了不同的路径。它不是生成或重建像素,而是学习数据的抽象表征(嵌入)。具体而言,系统同时处理完整图像(或视频)和经过掩码遮挡的版本,分别通过编码器得到它们的抽象表征,然后训练一个预测器,根据遮挡版本的表征来预测完整版本的表征。关键在于,系统学习的是在抽象表征空间中进行预测,从而自动忽略那些不可预测的底层细节(如一滴水下落的精确轨迹),专注于高层级、本质的预测(如水会洒出来)。
LeCun 透露,他们在视频上的 JEPA(V-JEPA)已取得积极进展。当系统在大量自然视频上训练后,给它播放一段物理上不可能的视频(如物体凭空消失),模型的预测误差会急剧飙升,这表明它已经内化了一些关于世界可能性的“常识”。更进一步的,动作条件化的 JEPA 可以让系统学习“状态-动作-结果”的模型,从而在抽象空间中预测行动后果,并逆向搜索达成目标的最优行动序列——这才是真正的规划和推理。
他强调,JEPA 这类架构是让机器获得“世界模型”的关键一步,而世界模型是实现可靠推理、规划和真正智能体的基石。他预测,这方面的实质性进展可能需要3到5年时间,并将是一个渐进的过程,而非某个突然的突破。
开源的力量与 AGI 的未来之路
在访谈最后,LeCun 简短而有力地表达了对开源 AI 的坚定支持。当被问及像 DeepSeek 这样的开源模型是否已超越专有模型时,他表示“超越”一词或许过于强烈,但“开源世界的进步无疑更快”。
他指出,开源模式能汇聚全球的智慧与创意,没有任何一个实体能垄断好的想法。DeepSeek 的成功表明,一个拥有长期视野和宽松约束的小团队,完全可以催生出颠覆性的新思路。而开源分享则能让整个生态加速前进。在商业部署上,许多客户在原型阶段可能使用专有 API,但在生产环境中往往会转向 Llama 等开源引擎,因其成本更低、更安全、可控,且可本地部署。
LeCun 也驳斥了所谓“开源会帮助竞争对手(如中国)”的狭隘观点。他以2015年最具影响力的深度学习论文之一“ResNet”出自微软亚洲研究院(北京)为例,说明顶尖科学家和创意遍布全球。首个 Llama 模型也来自 Meta 在巴黎的小团队。“硅谷并不垄断好的创意。” 他认为,要想科学技术快速发展,必须利用全世界多元化的思想和创造力,而开源正是实现这一点的最佳方式。
关于 AGI(通用人工智能)的未来,LeCun 的展望是务实而开放的:它不会是一个由某个公司突然揭晓的“秘密武器”,也不会是“前一天没有 AGI,后一天就有了”的孤立事件。AGI 将是一个持续的、渐进的过程,由全球研究社区共同推动,融合众多理念,并在试错中前进。那些分享研究成果的人,将比那些封闭的人走得更快。这或许正是 Yann LeCun(杨立昆)——这位“AI 教父”——在喧嚣的技术热潮中,为我们指出的那条通向真正智能的、更加坚实可靠的道路。
Meta 首席 AI 科学家 Yann LeCun(杨立昆):AI 需要理解物理世界才能进化撰文:Techub News 整理
导语
2025 年 3 月,Meta 首席 AI 科学家、图灵奖得主 Yann LeCun(杨立昆)接受了科学传播者、前欧盟数字大使 Matt Keçi 博士的深度访谈。作为深度学习领域的奠基人之一,LeCun 不仅回顾了该领域数十年来的起伏,更着重剖析了当前以大型语言模型(LLM)为代表的 AI 系统的根本性局限,并勾勒了他眼中下一代 AI 的演进蓝图。在 AI 技术日新月异、竞争与合作格局日益复杂的当下,这位顶尖学者的思考为我们理解 AI 的未来发展方向提供了至关重要的视角。
摘要
当前 AI(尤其是 LLM)虽能熟练操纵语言,但在理解物理世界、持久记忆、推理与规划方面“非常愚蠢”,远未达到人类或动物智能水平。
实现人类级别 AI 的关键在于让机器像婴儿或动物一样,通过感官输入高效学习“直观物理”,这需要全新的架构,如他提出的 JEPA(联合嵌入预测架构)。
开源与开放研究是 AI 领域过去十年飞速发展的基石,封闭系统将阻碍整体进步;AI 的未来是全球协作,而非零和竞争。
真正的自主机器人(包括 L5 自动驾驶)依赖于能理解物理世界、具备常识的 AI 系统,这可能是“机器人十年”即将到来的前提。
AI 的情感可能源于对行动结果的“预期”,而非被硬编码的愤怒或嫉妒;意识目前尚无明确定义,不应成为研究焦点。
从深度学习浪潮到 AI 的“愚蠢”现状
Yann LeCun(杨立昆)回顾了深度学习的两次浪潮:第一次在 80 年代末至 90 年代中期,因计算力和数据限制而沉寂;第二次则自 2013 年左右开始爆炸性增长,并因 2015 年他与 Geoffrey Hinton(杰弗里·辛顿)在《自然》上发表的那篇标志性综述论文而广为人知。然而,面对如今 ChatGPT 等模型引发的狂热,LeCun 却给出了冷静甚至尖锐的评价:“目前的 AI 系统在很多方面非常愚蠢。”他指出,我们被其流畅的语言能力所迷惑,误以为它们很聪明,但实际上,它们无法理解物理世界,缺乏人类那样的持久记忆,也不能真正进行推理和规划——而这些正是智能行为的核心特征。
LeCun 强调,语言之所以看起来复杂,实则因为它是离散符号的序列,处理起来相对简单。相比之下,通过视觉等感官接收的关于物理世界的信息量是海量且连续的,理解和预测这个世界要困难得多。这就是所谓的“莫拉维克悖论”:让计算机完成抽象思维任务(如下棋)相对容易,但让它们具备婴儿或小猫级别的物理直觉和行动能力却极其困难。他举例道,一个大型语言模型训练所用的文本数据总量(约 10^14 字节),一个幼儿在大约四年的视觉体验中就能通过眼睛接收到同等量级的信息。这启示我们,仅靠文本训练永远无法达到人类水平的 AI,必须让 AI 学会理解真实的物理世界。
下一代 AI 蓝图:理解物理、记忆、推理与情感
那么,如何构建能够理解物理世界的 AI?LeCun 介绍了其团队在 Meta FAIR 实验室和纽约大学正在探索的新路径。他们致力于设计一种仍然基于深度学习、但能力更全面的新型 AI 系统。这套系统的关键能力包括:
理解物理世界:掌握直观物理,能够预测自身行动可能带来的后果。
持久记忆:拥有类似人类的记忆系统。
推理与规划:能够进行层次化规划,将复杂目标分解为可执行的子任务序列。
LeCun 特别指出,当前 LLM 的推理方式(在“词元空间”中大量生成再筛选)效率低下且不似人类。人类是在内心的“世界模型”中进行模拟和推理,预测不同行动路径的结果,从而制定计划。构建这样的世界模型是重大挑战。
关于情感与意识,LeCun 提出了一个有趣的观点:未来先进的 AI 系统可能会拥有“情感”,但这并非被编程的愤怒或嫉妒,而是源于对行动结果的“预期”。当系统预测自己的行动将成功达成目标时,会产生类似“快乐”的积极信号;反之则产生消极信号。这是一种基于预测机制的内在驱动。至于意识,他认为目前尚无清晰定义和测量方法,过度关注可能像历史上纠结于“视网膜成像是倒置的为何我们看到正像”一样,是问错了问题。
学习范式演进与世界模型架构 JEPA
LeCun 梳理了机器学习的三大范式:监督学习、强化学习和自监督学习。他指出,强化学习效率低下(不适合训练自动驾驶,因为会撞毁成千上万次),而近年来取得巨大成功的 LLM 主要依赖于自监督学习(如预测文本中被掩盖的词)。然而,将这种适用于离散文本的自监督学习直接套用到连续、高维度的物理世界(如视频预测)时,却遭遇了失败。因为无法有效表示对未来视频帧的预测概率分布。
为此,LeCun 提出了 JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)作为解决方案。JEPA 的核心思想是:不在原始输入空间(如像素)进行预测,而是让系统学习输入的抽象表征,并在这种抽象表征空间中进行预测。这避免了系统浪费资源去预测不可预测的细节(例如摄像机转动后墙上画作的全部细节),转而关注更高层次、更本质的变化。JEPA 是一个宏观架构,其中可以包含 Transformer 等模块。它并非直接替代 Transformer,而是为处理物理世界信息提供了一种更可行的框架。
开源协作、机器人未来与行业洞见
针对 AI 领域的竞争,尤其是近期中国团队推出高性能开源模型 DeepSeek 引发的讨论,LeCun 坚决捍卫开源与开放研究的价值。他强调,开源让整个领域乃至全世界受益,是过去十年 AI 飞速进步的根本原因。PyTorch 等开源框架被整个行业广泛使用就是明证。他认为,基础研究方法层面的竞争并非零和游戏,而是全球性的合作。好的想法来自世界各地,开放环境能加速整个领域的进步。对于微软等公司传闻的千亿美元级“星际之门”(Stargate)计算项目,LeCun 指出其投资规模与 Meta、微软当前的投入同属一个量级,且大部分投资将用于服务亿万用户的推理需求,而非训练。
谈到机器人时,LeCun 认为未来十年将是“机器人的十年”,但其实现前提是 AI 在理解物理世界方面取得突破。当前的人形机器人演示虽令人印象深刻,但其智能程度还远不足以应对真实世界的复杂性。他特别评论了 Elon Musk(埃隆·马斯克)对特斯拉自动驾驶的预测,直言“必须停止相信他在这方面的说法”,因为其预测已连续八年未能实现。L5 自动驾驶的难点不在于传感器,而在于 AI 缺乏对物理世界的理解和常识。
对于欧洲在 AI 竞争中的角色,LeCun 指出欧洲拥有顶尖人才,但在监管明确性上面临挑战(例如其 Meta 智能眼镜的视觉功能因监管不确定性未在欧洲推出)。他相信欧洲将继续扮演重要角色。
反思、遗产与未来方向
被问及职业生涯是否有遗憾时,LeCun 坦言,他可能过晚地认识到自监督学习的重要性,并希望自己当年能更努力地维持社区对神经网络的兴趣,以避免“AI 寒冬”的出现。他推测 Geoffrey Hinton(杰弗里·辛顿)的遗憾或许在于花了太长时间寻找大脑可能使用的、不同于反向传播的学习算法,最终才发现反向传播本身已经非常有效。
作为卷积神经网络(CNN)的发明者,LeCun 的遗产已深入日常生活,从手机图像识别、语音助手到汽车自动紧急刹车系统,背后都有 CNN 的身影。如今,他将目光投向更前沿的“世界模型”,致力于为 AI 赋予真正的物理理解和常识。在访谈最后,他也表达了对 AI 在医疗等领域(如乳腺癌诊断)应用的积极期待,并担任了相关初创公司的顾问,相信深度学习将为人类健康带来巨大福祉。
卓銳證券「AI·CRYPTO 全球資產配置」線下主題論壇吸引近200名投資者八家資管與數位資產機構同場 共探雙主線配置新範式
(香港,2026 年 8 月 27 日)適逢 Bitcoin Asia 2026 在港召開,由卓銳證券(香港)有限公司(下稱「卓銳證券」)主辦的「AI·CRYPTO 全球資產配置」主題論壇,於今日下午在香港萬麗海景酒店舉行。論壇聚焦 AI 與數位資產雙主線驅動下的宏觀週期研判,現場吸引近 200 名投資者參與,互動環節反應熱烈。
論壇匯聚華夏基金(香港)、易方達基金(香港)、Animoca Brands、VDX、BE Trust、Metalpha、BigQuant、北水金控等機構的業界領袖,議題涵蓋數位資產 ETF 的發展路徑、比特幣的機構化進程以及 AI 算力週期的資本傳導,回應投資者在雙主線交匯下對配置方向的關注。
圖註:「AI·CRYPTO 全球資產配置」論壇現場,吸引近 200 名投資者參與。
宏觀研判:AI 牛市能否繼續,需要爆款應用持續接力
卓銳證券基金經理 Jerry Ou 以「AI 與比特幣雙重敘事下的全球資產配置展望」為題發表主題演講,從宏觀週期出發拆解兩條主線對全球資金流向的影響。
他指出 AI 是過去三年美股牛市的絕對主力,而目前 CAPEX 已經到了 CSP 自由現金流轉負的時刻。繼續高強度 CAPEX 只能靠巨額借債,這要求 AI 應用在 2030 年形成 1 萬億美元 ARR(vs.2026 年才 1 千多億美元)才夠還債。目前全球 AI to C 商業化都沒跑通,今年 ARR 大漲幾乎全靠 Anthropic 跑通了 AI to B,主要是編程 AI 取代程式設計師,這導致美國程式設計師職位大幅萎縮,尤其是應屆畢業生。然而,非農就業總人數為何未見顯著下滑,主要是因為 AI 數據中心建設產生的新工作崗位大多位於共和黨執政州和關鍵搖擺州。接下來,AI to B 的爆款應用方向主要在金融、法律、諮詢等高薪白領崗位。而最終衝上 1 萬億美元 ARR,則需要 AI+機器人跑通,目的是大幅降低勞動力成本,實現美國製造業回流。目前 AI 股票尤其是半導體的估值已經處於歷史頂峰,但是否回落甚至轉熊關鍵要看上述 AI 爆款應用能否持續接力,2000 年代科網泡沫破裂是三重利空的意外疊加。
至於比特幣,他認為按四年減半規律,當前處於熊市週期階段,而熊市底部價格通常由挖礦成本決定。
圖註:卓銳證券基金經理 Jerry Ou 就 AI 與比特幣雙重敘事下的資產配置展望發表主題演講。
配置視角:比特幣與主要資產相關性低,配置價值受關注
華夏基金(香港)投資組合管理總監 William Kung以「比特幣新機遇」為題分享。他從資產配置角度指出,過去十年比特幣與主要資產類別的相關性很低——與標普 500、納斯達克 100 的相關係數分別為 0.17 與 0.19,與黃金、債券則接近於零,具備獨特的風險收益特徵。以過去五年的回測為例,在傳統 60/40 組合中納入比特幣,配置比例較高的組合表現相對更佳。
就市場空間,他提到數位資產目前占全球財富總量的比重不足 0.4%,比特幣市值約相當於黃金的 3.5%。機構資金的動向亦在同步變化:根據截至 2026 年 8 月中旬的 13 F 申報,摩根士丹利與摩根大通的比特幣相關敞口環比分別增加約 3.7% 與 12.2%,以太幣相關敞口增幅更為顯著。他並指出,第四次減半後,效率最高礦工的現金生產成本約在 6 萬美元附近,可作為觀察支撐位的參考。
圖註:華夏基金(香港)投資組合管理總監 William Kung 分享比特幣的配置價值與下半年展望。
圓桌一|比特幣的機構化進程
首場圓桌由 Techub News 聯合創始人 Bobby 主持,VDX 首席戰略官 Paolo、Animoca Brands 投資與戰略合作總監 David Ching 及 BE Trust 投資總監 Yaney 參與討論,議題聚焦 ETF、流動性與新一輪市場週期。三位嘉賓的共同判斷是:這輪上漲並非週期反轉,而是流動性預期、ETF 淨流入與空頭回補疊加的階段性修復。更值得關注的是交易結構的變化。BE Trust 投資總監 Yaney 形容,市場正處於「早期持幣者向華爾街機構換手的關鍵階段」,四年一輪的週期效應正在弱化,波動率將逐步向成熟大類資產收斂。VDX 首席戰略官 Paolo 亦觀察到比特幣與納斯達克科技資產的相關性持續走高,已成為機構眼中的高 Beta 資產。
圖註:圓桌一「比特幣的機構化進程:ETF、流動性與新一輪市場週期」討論現場。
產業滲透:成本下降,反而推高算力需求
易方達香港數碼營銷總監 Sapphire Wang 則從產業滲透與需求端切入,分享 AI 時代的投資新格局。她引述史丹福大學 2026 年 AI Index 報告指出,全球企業的 AI 採用率已超過 88%,滲透速度明顯快於互聯網普及初期。就算力需求的走向,她以傑文斯悖論作解釋:模型推理成本下降並不會減少總消耗,反而因應用場景擴張,推動 Token 與算力需求進一步上升。
她並提到中美 AI 產業鏈高度互補——美國主導模型層與算力晶片,但發電量相對不足,數據中心擴張受制於電力供應;中國掌握光模組、PCB 等硬體產能與能源優勢,先進製程則依賴進口。單一市場難以形成閉環,兩者互為必要條件。
圖註:易方達香港數碼營銷總監 Sapphire Wang 就 AI 時代的投資新格局發表主題演講。
圓桌二|算力新週期:從晶片到雲端,資本開支如何傳導為投資機會
第二場圓桌由卓銳證券市場副總裁 Miranda 主持,BigQuant 首席執行官梁舉、北水金控聯合創始人 Kylie Li 及 Metalpha 生態負責人 Max參與討論。議題圍繞 AI 資本開支沿產業鏈向下游延伸後,投資機會分佈的變化。三位嘉賓認為,近期 AI 資產回撤是高位擁擠交易的出清,而非產業週期見頂——產業仍在高速成長,只是商業化兌現跟不上炒作預期,二級市場估值已明顯透支。Metalpha 生態負責人 Max 將當前的 AI 行業類比早期的區塊鏈行業:「基建投入巨大、資本熱度極高,但真正跑通閉環、持續盈利的應用仍然稀少。」機會的位置也在移動——從堆算力轉向降本與落地,定製晶片、光通信、液冷、電力基建等效率優化環節,以及垂直應用層,被視為下一階段的主戰場。
圖註:圓桌二「算力新週期:從晶片到雲端,資本開支如何傳導為投資機會」討論現場。
跨界對話延續至會後
論壇最後設自由交流環節,與會機構代表就各自關注的議題繼續深入交流。公募基金、數位資產投資平台與量化科技公司,過往關注重點各有不同,但隨著數位資產合規化推進與 AI 產業週期演進,其面臨的核心課題日趨接近:在市場變數增多、週期縮短的環境下,如何建立清晰且可複製的配置方法。
從傳統證券到虛擬資產,從香港到新加坡、澳洲,卓銳證券正沿著同一條路徑推進——讓不同類型的資產,回到同一張配置表上。目前,卓銳證券持有香港證監會第 1、2、4、5 及 9 類牌照,其中第 1 類牌照已獲批面向專業投資者及零售客戶提供虛擬資產存入、交易及提取的全流程服務;自主研發的一站式平台 ZR,讓投資者以單一帳戶完成股票、ETF 與虛擬資產的配置。
「成為備受信賴的全球金融科技平台」——這是卓銳證券的願景,也是舉辦本次主題論壇的初衷。公司表示,未來將持續圍繞全球資產配置議題舉辦更多線下交流活動,與投資者一同把握雙主線下的市場機遇。
風險提示:嘉賓發言僅為個人觀點分享,不構成任何證券、金融產品或工具要約、招攬、建議、意見或任何保證。
Meta 首席 AI 科学家 Yann LeCun(杨立昆):自回归大模型将在 3-5 年内消失撰文:Techub News 整理
导语
在2025 年 2 月举办的 ChatGPT Talks 2023 大会上,图灵奖得主、纽约大学教授、Meta 首席 AI 科学家 Yann LeCun(杨立昆)发表了一场引人深思的主题演讲。作为深度学习与卷积神经网络领域的先驱,LeCun 在 Meta 主导前沿 AI 研究,并2025 年 2 月推动发布了开源大模型 Llama 2。在这场演讲中,他并未过多赞誉当前火热的大语言模型(LLM),而是犀利地指出了其核心局限,并勾勒了他心目中下一代 AI 系统的蓝图——「目标驱动 AI」。这场演讲不仅是技术前瞻,更是对 AI 发展路径与开放生态的深刻思考。
摘要
当前自回归大语言模型存在「根本缺陷」,无法真正理解世界、进行推理与规划,且幻觉问题无法通过现有架构根除。
LeCun 预测,现有大模型将在 3 到 5 年内消失,被能够进行内部规划与推理的「目标驱动 AI」系统所取代。
通往人类水平 AI 需攻克三大挑战:学习世界模型、学习推理、学习规划复杂动作序列。
开源是 AI 基础设施的必然未来,正如互联网的基础软件,封闭的专有系统将无法被全球接受。
需要抛弃当前流行的生成模型、概率模型、对比方法和强化学习,转向基于「联合嵌入预测架构」的自监督学习来构建世界模型。
自回归大模型的辉煌与根本缺陷
Yann LeCun(杨立昆)开宗明义地指出,尽管以 ChatGPT 为代表的自回归大语言模型取得了令人惊叹的成就,但它们在 AI 研究社区看来「真的不怎么样」。这些模型仅通过海量文本进行训练,缺乏对物理世界的直接体验,因此不具备常识,对现实世界的理解极其有限。它们本质上是一个「发散过程」:模型以自回归方式逐个预测下一个词元(token),任何一步微小的预测误差都会在后续步骤中被指数级放大,导致最终输出的答案可能在长文本中完全偏离事实。这是其架构固有的、无法通过简单修补解决的缺陷。
LeCun 将大语言模型的能力类比于心理学家丹尼尔·卡尼曼所说的「系统一」思维,即快速、直觉式、无需深思的反应。然而,人类智能的核心——「系统二」思维,即通过深思熟虑、推理和规划来解决问题的能力,是目前大模型所完全缺失的。它们无法进行复杂的多步骤规划,例如策划一次从纽约到巴黎的旅行,并将其分解为订票、前往机场、登机等一系列子任务和具体动作。
更关键的是,LeCun 强调,人类和动物的大部分知识是非语言的。婴儿在学会说话前,通过观察和互动已经掌握了大量关于物理世界的直观知识(如物体恒存、重力)。这些构成常识基础的知识,是大语言模型仅从文本中永远无法真正获得的。因此,他认为,仅凭文本训练,永远无法达到人类水平的 AI。
开源 AI:不可避免的未来基础设施
在深入技术批判之前,LeCun 首先谈到了 Meta 2025 年 2 月发布开源大模型 Llama 2 背后的理念。他认为,AI,尤其是未来将作为人类与数字世界交互中介的 AI 助手,将成为全人类知识的存储库和基础设。回顾互联网历史,其底层基础设施(如 Linux、Apache、HTTP)无一不是开源的。专有商业解决方案最终都输给了开放生态。
LeCun 断言,AI 领域将重演这一历史。未来的 AI 基础设施必须是开源的,原因有三:其一,从安全角度看,开源软件经过更广泛的审查,往往比闭源软件更安全;其二,构建涵盖全人类知识的系统需要全球数百万人的贡献,这类似于维基百科的模式,不可能由少数几家专有公司完成;其三,世界许多国家和地区不会接受其公民的所有信息都来自美国西海岸少数科技公司控制的闭源系统。
因此,Meta 坚定地站在开源研究的一边。LeCun 展望,未来只需要少数几个开源的基础大模型,整个生态系统就可以在其之上进行微调和开发各种应用产品,这将极大地促进创新和普及。
目标驱动 AI:下一代系统的蓝图
那么,应该构建什么样的 AI 系统来克服现有大模型的缺陷呢?LeCun 提出了「目标驱动 AI」的认知架构。其核心是一个可预测结果的「世界模型」。该系统包含几个关键模块:感知模块(估计世界状态)、世界模型(预测行动后果)、演员模块(想象行动序列)和成本模块(评估结果好坏)。
系统的运作原理是:给定一个目标(例如「去巴黎」),演员模块想象一系列行动,世界模型预测这些行动将导致的结果,成本模块则评估这些结果是否符合目标以及是否满足一系列「护栏」目标(如安全性、无害性)。整个系统通过优化(推理)过程,寻找能够最小化总成本的动作序列。这个过程本身就是规划和推理。
LeCun 特别指出,这种架构是本质安全的。只要护栏目标(如毒性检测)被硬编码在成本模块中,系统在推理时就会自动优化以避免产生有害输出,无需像现在这样通过复杂的「基于人类反馈的强化学习」来微调整个模型,且难以防范「越狱」攻击。
真正的挑战在于实现分层规划。人类可以轻松地将「去巴黎」分解为「去机场」、「登机」等高层目标,再进一步分解为「站起来」、「开门」、「打车」等具体动作,直至控制肌肉的毫秒级指令。当前 AI 完全无法自发学习这种分层表示和规划能力,这是实现人类水平 AI 必须攻克的核心难题之一。
抛弃生成模型:用联合嵌入架构学习世界模型
如何构建能够准确预测的世界模型?LeCun 给出了一个可能让当前 AI 界感到意外的答案:放弃生成模型。当前火爆的生成式 AI(包括自回归大模型)都属于生成模型,它们试图直接预测未来的具体数据(如下一个词元或下一帧视频图像)。但在面对高度不确定的现实世界(如预测视频下一帧)时,生成模型往往只能输出模糊的平均结果,因为它被迫为所有可能性分配概率。
LeCun 力推的方法是「联合嵌入预测架构」。其核心思想是:不再直接预测原始数据 Y,而是预测数据 Y 的抽象表示。系统通过编码器将输入 X(如当前视频片段)和待预测目标 Y(如下一视频片段)分别映射到表示空间,然后在这个抽象空间中进行预测。编码器的关键在于,它可以选择性地丢弃那些难以预测但对当前任务无关紧要的细节信息(如风中树叶的随机晃动),只保留易于预测且相关的特征(如道路上汽车的移动)。这使得预测任务变得可行且高效。
然而,训练此类架构面临「坍塌」风险:系统可能学会输出恒定表示来轻松最小化预测误差。为此,LeCun 团队开发了如 VICReg 等方法,通过正则化手段确保表示空间具有足够的方差和信息量。实验证明,这类方法在图像、视频等复杂模态的自监督学习上,效果远超基于重建的生成模型。
结论:通往人类水平 AI 的挑战与必然
Yann LeCun(杨立昆)总结道,要实现人类乃至动物水平的 AI,必须解决三大挑战:1. 学习世界的表征和预测模型;2. 学习推理;3. 学习规划复杂动作序列以满足多个目标。他构想的「目标驱动 AI」架构结合了分层规划、基于世界模型的推理和能量最小化优化,是应对这些挑战的一个可能方向。
他大胆预测,当前形式的自回归大语言模型将在 3 到 5 年内消失,取而代之的是能够内部规划答案、基于世界模型推理、并由目标驱动的系统。这样的系统将能同时保证事实准确性、流畅性和安全性。
最后,LeCun 谈到了对超级智能的看法。他认为不存在所谓的「通用人工智能」,因为即使人类智能也是高度特化的。他确信,未来机器将在所有人类智能领域超越人类,但这并不可怕。人类将始终掌控这些更聪明的机器,正如我们的大脑皮层并未脱离我们控制一样。未来的图景是,每个人都将被比自己更聪明的 AI 系统所辅助,共同推动知识与文明的进步。而实现这一未来的基石,将是开放、合作与持续的基础研究。
Meta 首席 AI 科学家 Yann LeCun(杨立昆):放弃生成模型,走向 JEPA 与世界模型撰文:Techub News 整理
导语
2025 年 9 月,图灵奖得主、Meta 首席人工智能科学家 Yann LeCun(杨立昆)受邀在哈佛大学数学与科学应用中心(CMSA)发表演讲。在这场面向更广泛听众的讲座中,LeCun 没有重复当下关于大语言模型(LLM)能力的乐观叙事,而是尖锐地指出了当前 AI 架构的根本缺陷,并勾勒了他心目中通向更通用、更接近人类或动物智能的 AI 发展蓝图。作为深度学习先驱和卷积神经网络之父,LeCun 对 AI 未来路径的思考,在业界具有重要的风向标意义。
摘要
当前 AI(尤其是大语言模型)在学习和推理能力上远未达到人类或动物水平,其架构存在根本性限制。
仅靠文本训练永远无法实现人类水平的 AI,因为文本数据缺乏视觉等模态的丰富性和冗余性。
未来的突破在于构建能理解物理世界的「世界模型」,使机器能像婴儿一样通过观察学习常识和直观物理。
主流的自回归生成模型会导致「幻觉」且无法进行复杂规划,应转向「联合嵌入预测架构」(JEPA),在抽象表示空间进行预测。
实现智能体的关键模块包括:感知、世界模型、记忆、成本函数(目标与护栏),并通过优化进行规划。
当前 AI 的局限:我们离猫的智能还有多远?
Yann LeCun(杨立昆)开篇便抛出一个清醒的论断:我们目前的人工智能技术,距离匹配人类甚至动物的智能还非常遥远。尽管 AI 系统可以通过律师考试、解决数学难题,完成许多对人类而言颇具智力挑战的任务,但它们却无法完成一个十岁孩子第一次被要求「收拾餐桌并启动洗碗机」就能做到的事。一个青少年能在十到二十小时的练习后学会开车且基本不出事故,而我们拥有数百万小时的训练数据,却仍无法实现完全自主(L5级)的自动驾驶汽车,仍需依赖激光雷达和高精地图等辅助。
LeCun 将此现象称为「莫拉维克悖论」的另一个例证:许多对人类来说需要「思考」的任务(如下棋、解积分),对机器而言算法上相对简单;而人类和动物凭借直觉就能完成的感知和行动任务(如抓取、导航),对机器却异常困难。他认为,这揭示了当前 AI 架构和机器学习技术的根本不足。
他进一步用一个简单的估算来强化观点:一个典型的大型语言模型(如 Llama 3)使用约 30 万亿 token(约 10^14 字节)的文本进行训练。一个人需要 40 万年才能读完这些数据。然而,一个四岁孩子在四年清醒时间内通过视觉皮层接收的信息量,大约也是 10^14 字节。虽然视觉信息冗余度更高,但这恰恰是学习世界结构和依赖关系所需要的。「冗余」是学习的前提,从完全随机的比特串中什么也学不到。
这个比较说明了两点:第一,仅通过文本训练永远无法达到人类水平的 AI;第二,如果我们想要制造出真正有用的机器人,还需要取得重大进展。 LeCun 指出,目前许多人形机器人公司展示的炫酷视频背后,一个不为人知的秘密是:他们并不知道如何让这些机器人变得足够智能以应对广泛任务,只能在非常狭窄、经过精心训练的任务中表现良好。
推理与规划:为何自回归模型注定「幻觉」?
LeCun 深入分析了当前主流 AI,特别是大语言模型在推理机制上的局限性。他认为,现有的推理主要依赖于固定层数的前向神经网络传播,这种计算方式能力有限。许多任务需要更复杂的计算,而一种更强大的推理方式是通过「优化」进行。
他描述了一种理想架构:系统有一个「能量函数」,用于衡量输入与一个假设输出之间的「不兼容」程度。推理过程就是搜索能使这个能量值最小化的输出。这种基于优化的推理可以实现「零样本学习」,即无需针对特定问题进行训练,就能产生新的解决方案。这或许更接近人类「系统二」的思维模式——通过思考,运用对世界的心理模型来预测行动后果,从而做出审慎决策。
相比之下,大语言模型采用「自回归预测」:给定一个符号序列窗口,预测下一个符号,然后将预测出的符号移入输入,再预测下一个,如此循环。这种方式存在两个核心问题:
首先,它为生成每个 token 分配了固定量的计算。如果想让它对复杂问题投入更多资源,唯一的办法是「欺骗」它生成更多 token(例如使用「思维链」技巧),但这只是一种变通方案。
其次,也是更严重的问题,自回归生成是一个发散过程。模型在每一步都输出一个可能 token 的概率分布。由于每次选择都可能偏离正确答案的路径,并且一旦偏离就无法回头(因为序列生成是树状结构),导致生成完全错误答案的概率随着序列长度呈指数级增长。这就是 LLM「幻觉」的一个根本原因。 LeCun 强调,人类回答问题并非一个词接一个词地「脱口而出」,而是先形成一个抽象的答案思想,再将其转化为文本。
尽管 LLM 存在这些局限,但其训练简单且扩展性良好的特点使其目前占据主导。然而,LeCun 认为,要实现更通用的智能,我们必须转向能模拟人类和动物「世界模型」能力的架构。
世界模型:智能的基石与 JEPA 的提出
什么是世界模型?LeCun 解释道,它是一个允许系统预测未来、特别是自身行动后果的心理模型。这正是规划和智能行为的基础。婴儿在生命最初几个月就能学习关于世界的基本概念(如物体恒存性、类别)和直观物理(如重力),而我们尚未让机器以类似的方式学习。
一个自然的想法是模仿 LLM,训练一个生成模型来预测视频的下一帧。但 LeCun 指出,这在像素级别上是一个「不可能完成的任务」。因为世界是非确定性的,未来有多种合理可能。如果训练神经网络做出单一预测,最好的结果只能是预测所有可能未来的某种「平均」,导致预测画面模糊不清。虽然可以通过引入潜在变量来参数化不同的可能未来,但这对于自然视频仍然无效,因为无法预测所有细节(如房间纹理、每个人的样貌)。
于是,LeCun 提出了他的解决方案:不要在像素层面预测,而是在「表示层面」预测。 他称之为「联合嵌入预测架构」(Joint-Embedding Predictive Architecture, JEPA)。其核心思想是,通过编码器将输入(如视频)转换为抽象表示,然后训练一个预测器在表示空间中进行预测,从而忽略那些不可预测的细节,使预测任务变得可行。
「这恰恰是我们理解世界的方式,」LeCun 说,「我们寻找那些允许我们进行预测的表示,这些表示会忽略细节。科学的全部目的就是找到这样的表示。」他以行星运行为例:要预测木星一百年后的位置,你不需要知道关于木星的所有细节,只需要六个数字(位置和速度)。找到能消除细节、从而允许预测的适当抽象表示,对科学和智能都至关重要。
他进一步阐述了世界的层次化表示:从量子场、粒子、原子、分子,到蛋白质、细胞、有机体、社会、生态系统。每一层都允许我们做出更宏大、更长远的预测,同时忽略下一层的细节。物理学中的「重正化群」和「熵」的概念正是处理这种抽象的工具。「或许,一个科学领域(至少自然科学)正是由我们选择进行预测的抽象层次所定义的。」 LeCun 总结道。
通往自主智能体的认知架构
拥有世界模型后,如何构建一个完整的智能体?LeCun 展示了他三年前提出并至今坚持的蓝图。一个智能 AI 智能体应包含以下模块:
感知模块: 观察世界,估计当前可感知的世界状态。
记忆模块: 存储关于世界(如家的状态)的当前不可感知的信息。
世界模型: 接收当前状态(感知+记忆)和一个假设的行动序列,预测由此产生的未来状态序列。
成本函数: 包括「任务目标」(衡量任务完成度)和「护栏目标」(确保安全、符合约束)。
智能体的运作方式是基于优化的规划:它搜索一个行动序列,使得根据其内部世界模型预测的结果,能够同时最小化任务目标成本并满足护栏目标(即成本保持为零或很低)。「如果你设置了护栏,它别无选择,只能满足它。这是由构造决定的。」 LeCun 强调,这为实现可控、安全的 AI 提供了途径。
然而,现实世界的复杂性和非确定性带来了巨大挑战。世界模型可能是一个从海量数据中学习到的大型神经网络,其输入可能是视频,行动可能是复杂的,成本函数在行动空间可能极其不规则,甚至不连续。此外,世界是非确定性的,需要通过潜在变量来处理多重可能未来,这使得在不确定性下的规划更加复杂。
LeCun 特别指出了「分层规划」的必要性。人类从纽约去巴黎,不会规划每一毫秒的肌肉控制,而是先规划高层动作(去机场、乘飞机),再逐层细化到低层动作(下楼、打车)。这需要一套能在不同时间尺度和抽象层次上工作的分层世界模型。「如何训练一个系统学习适当的抽象层次?然后,一旦拥有它,如何用它进行分层规划?……这完全未解决,是一个开放性问题。」 他鼓励研究者投身于此。
自监督学习与 JEPA 的实践进展
如何通过自监督学习训练世界模型?LeCun 回顾了联合嵌入架构的历史(可追溯到 90 年代的「连体网络」),并重点介绍了近期成功的「蒸馏」方法,如 DINO。这类方法属于「正则化」方法,通过一个巧妙的技巧(让目标编码器的权重是主编码器权重的指数移动平均)来防止模型崩溃,尽管其理论原因尚未完全明晰。
重要的是,当规模扩大时,这类自监督学习方法在图像理解任务上的性能已经匹配甚至超越了需要大量标注数据的纯监督学习方法。「如果你有钱要花,最好把钱花在科学家身上,去微调自监督学习方法并收集无标签数据,而不是花在给人标注数据上。」 LeCun 指出,这是直到2025 年 9 月几个月才明确的结论。
更关键的是,这些学习到的表示可以用于构建世界模型并进行规划。LeCun 展示了其团队在 NYU 和 Meta 的研究成果:
使用 DINO 编码器提取图像表示,训练动作条件预测器,成功用于机器人操作任务的零样本规划(如将蓝色筹码推到目标位置)。
在机器人导航任务中,训练模型根据当前视图和机器人位移预测下一视图的表示,并能成功规划路径到达指定目标(如蓝色垃圾桶)。
最新的 V-JEPA(视频 JEPA)模型,通过掩码视频进行训练,不仅能学习视频的有效表示,还展现出一定的「常识」——当视频中出现违反物理规律的事件(如球突然消失)时,其预测误差会急剧上升。
这些实验证明,基于 JEPA 的世界模型能够使智能体通过规划来完成新任务,无需针对该任务进行强化学习或策略训练。
未来方向与大胆建议
在演讲尾声,LeCun 给出了他对于 AI 未来研究的明确建议,其中不少观点与当前主流背道而驰:
放弃生成模型,转向联合嵌入预测架构(JEPA): 生成模型(预测原始输入)仅适用于离散符号(如文本),对于物理世界的连续信号,应在表示空间进行预测。
采用基于能量的框架来理解模型: 概率建模(如归一化能量函数)通常导致难以处理的计算,且非必需。
放弃对比方法,偏爱正则化方法: 对比方法在高维空间中难以扩展。
尽量减少强化学习的使用: 强化学习效率极低,需要大量试错,应作为最后手段。
「当我说出所有这些,这些都是目前机器学习中最流行的概念支柱。这让我不太受欢迎,特别是第一条,在硅谷我得带着保镖出门了——开玩笑的。」LeCun 幽默地说道。他最后总结并呼吁:「如果你有兴趣将 AI 提升到下一个水平,达到人类水平,或者哪怕是猫的水平,不要研究 LLM,去研究 JEPA。」
AMD CEO Lisa Su(苏姿丰):生成式 AI 市场远超 5000 亿美元,发布 MI350 系列与 MI400 路线图撰文:Techub News 整理
导语
6 月 20 日,AMD 举办了年度 AI 盛会 Advancing AI 2025 主题演讲。公司董事会主席兼首席执行官 Lisa Su(苏姿丰)作为主讲人,在近三小时的活动中,系统性地阐述了 AMD 在 AI 计算时代的战略布局、产品进展与生态成果。本次活动正值 AMD 全新一代 AI 加速器 MI350 系列正式亮相之际,也是对其去年提出的宏大市场预测的一次重要回应与更新。Lisa Su(苏姿丰)携多位来自 Meta、Oracle、xAI 和 OpenAI 的重量级合作伙伴登台,共同描绘了 AI 基础设施未来的爆炸性需求与开放生态愿景。
摘要
市场预测大幅上调:Lisa Su(苏姿丰)确认,数据中心 AI 加速器市场规模将远超其去年预测的 5000 亿美元(2027年),并预计推理(Inference)需求正以每年超过 80%的速度增长,成为未来几年 AI 算力的主要驱动力。
重磅新品 MI350 系列发布:正式推出 Instinct MI350 系列加速器(含 MI355 旗舰型号),采用第四代 CDNA 架构,宣称相比前代 MI300 在 AI 计算性能上实现高达 4 倍的代际飞跃,并支持新型数据格式 FP4/FP6。
合作伙伴集体站台,生态扩张:Meta、Oracle 确认将大规模部署 MI350 用于扩展的 AI 工作负载;xAI 分享了使用 MI300X 的“ effortless”开发体验;OpenAI 联合创始人 Sam Altman(萨姆·奥尔特曼)意外现身,讨论 AI 算力需求与未来合作。
未来路线图首次曝光:预览了专为机架级解决方案设计的下一代 MI400 系列(2026年),并透露已在开发 MI500(2027年)。MI400 旨在实现相比 MI350 高达 10 倍的性能提升。
强调“开放”战略与全栈方案:AMD 将开放硬件、软件和解决方案作为核心战略,通过增强 ROCm 软件栈、收购(如 Nod.AI)以及与开源社区(如 PyTorch、vLLM)深度合作,构建与 Nvidia CUDA 生态差异化的开发者体验。
开场:AI 浪潮与 AMD 的定位
Lisa Su(苏姿丰)在开场时回顾了自 ChatGPT 问世以来 AI 创新的惊人速度。她指出,2025 年 AI 发展进一步加速,表现为更强大的推理模型、智能体(Agent)的兴起,以及真实用例开始大规模部署。她特别强调了智能体 AI(Agentic AI)将带来“数以亿计的新虚拟用户”,持续不断地消耗 CPU 和 GPU 算力。
基于对行业趋势的洞察,Lisa Su(苏姿丰)更新了 AMD 的市场预测。她重申,数据中心 AI 加速器的市场规模(TAM)将“远超”去年预测的到 2027 年达到 5000 亿美元的水平。更重要的是,推理(Inference)需求已经出现拐点,预计将以每年超过 80%的速度增长,成为 AI 计算的最大驱动力。她认为,高性能 GPU 因其灵活性和可编程性,将占据该市场的大部分份额。
面对多样化的需求,AMD 的策略聚焦于三点:1) 提供广泛的 CPU、GPU、DPU、FPGA 等计算引擎组合,让客户能为特定模型和用例匹配最佳算力;2) 大力投资于开放的、开发者优先的生态系统;3) 提供从芯片到机架的全栈解决方案。她强调,“开放”对 AMD 而言不是口号,而是加速 AI 规模化应用的关键,并以 Linux 和 Android 的成功历史佐证开放生态带来的竞争与创新红利。
新品核心:Instinct MI350 系列的性能与竞争力
本次活动的重头戏是全新 Instinct MI350 系列的发布。Lisa Su(苏姿丰)手持 MI355 实物登上讲台,宣布该系列实现了“Instinct 历史上最大的代际性能飞跃”。MI355 作为旗舰型号,采用第四代 CDNA 架构、支持 FP4 等新数据格式、搭载 HBM3e 内存,并在台积电先进封装下集成了 1850 亿个晶体管。
具体性能指标方面,MI350 系列宣称带来高达 4 倍的 AI 计算性能代际提升。其单个 GPU 支持高达 288 GB 的 HBM3e 内存,可运行参数量高达 5200 亿的模型。在与竞争对手 Nvidia B200 和 GB200 的对比中,AMD 展示了 MI355 在运行 DeepSeek-R1 或 Llama 3.1 等模型时,使用 vLLM 等开源框架可生成高出 B200 30% 的每秒令牌数(Tokens/Second),甚至能与更复杂昂贵的 GB200 系统性能匹敌。在经济效益上,AMD 声称 MI355 可提供比竞品高出 40% 的“每美元令牌数”(Tokens per dollar),为云服务商和企业带来更优的总体拥有成本(TCO)。
除了推理,MI350 在训练性能上也取得了显著进展。Lisa Su(苏姿丰)展示的数据显示,MI355 在预训练(Pre-training)任务中相比 MI300 有高达 3.5 倍的吞吐量提升;在微调(Fine-tuning)任务中也有最高 2.9 倍的性能提升。在行业权威的 MLPerf 训练基准测试中,MI355X 系统在特定任务上比 Nvidia 最新的 B200 和 GB200 系统快了多达 13%。
为简化部署,AMD 联合 OEM/ODM 合作伙伴推出了基于 MI350 系列、集成 Epic CPU 和 Pensando DPU 的完整机架解决方案。这些设计遵循 OCP(开放计算项目)标准,可快速融入现有数据中心基础设施。既有支持 128 个 GPU、提供 2.6 Exaflops(FP4)算力的液冷高密度配置,也有适用于企业的 64 GPU 风冷配置。
生态验证:一线客户与合作伙伴的实践分享
Lisa Su(苏姿丰)邀请多位合作伙伴上台,为 MI 系列产品的市场表现和未来潜力提供了有力背书。
Meta:工程副总裁 Yunsong 分享道,MI300X 已是其基础设施的关键部分,广泛用于 Llama 3 和 Llama 4 的推理。他特别提到,Meta 正在将 AMD GPU 的应用从 Llama 模型推理扩展到推荐系统、排名等核心业务的训练和推理工作负载。对于 MI350,Yunsong 赞赏其显著提升的算力、新一代内存支持和 FP4/FP6 数据格式,同时保持了与 MI300 相同的形态,便于快速部署。他强调,AI 需求的激增正在以前所未有的速度推动数据中心建设,而 Meta 与 AMD 将在未来加速器和网络路线图上进行更紧密的协同设计。
Oracle:OCI 执行副总裁 Mahesh Thiagarajan 阐述了与 AMD 的全栈深度集成。他强调,要释放 AI 基础设施的极致性能,需要从供电、计算、网络到存储的全面整合。他特别赞扬了 AMD Infinity Fabric 技术在 CPU 与 GPU 内存间高效移动数据的能力,以及 Pensando DPU 对 AI 工作负载安全和性能的保障。Thiagarajan 透露,OCI 正在部署高达千兆瓦(Gigawatt)级别的 AI 超级集群,这些集群将作为单一巨型超级计算机运行。
xAI:联合创始人 Shiao 分享了使用 AMD MI300X 加速其 Grok 系列模型推理的体验。他形容这个过程是“ effortless”(毫不费力),特别赞赏 AMD 工程团队与 xAI 小团队的紧密协作和快速响应,使得产品得以在数月内上线。Shiao 还从第一性原理出发,畅想了从硅基芯片到数据压缩的未来计算演进,并呼吁全球人才加入这场“人类历史上最大规模的软硬件协同设计”。
OpenAI:联合创始人兼 CEO Sam Altman(萨姆·奥尔特曼)的压轴出场成为全场高潮。他谈到,AI 模型能力的提升,尤其是多模态和智能体功能的发展,对计算能力提出了指数级增长的需求。他强调,为了持续攀登这条 scaling curve(规模扩展曲线),整个行业必须在研究、工程、硬件和系统交付上进行前所未有的深度协作。他对与 AMD 的未来合作表示期待。Lisa Su(苏姿丰)则回应,下一代的 MI400 将专门为 OpenAI 等前沿模型构建者面临的巨大挑战而设计。
未来展望:MI400 路线图与持续增长信心
在发布 MI350 的同时,Lisa Su(苏姿丰)首次预览了下一代 Instinct MI400 系列。她透露,MI400 目前已在深度开发中,计划于 2026 年推出,其设计理念是一个“从头打造的机架级解决方案”,旨在实现比 MI350 高达 10 倍的性能提升。她进一步透露,AMD 已在规划 2027 年的产品,将采用下一代“Venoro”CPU 和 MI500 GPU,继续在性能、效率和可扩展性上突破极限。
演讲最后,Lisa Su(苏姿丰)总结道,过去一年重新定义了 AI 进步的节奏,其速度在现代计算史上前所未有。她坚信,AI 的未来不会由任何单一公司或在封闭生态中构建,必将由全行业的开放协作与共同创新所塑造。AMD 致力于通过开放的技术、人才与合作伙伴网络,让 AI 变得更强大、更易得、对每个人都更有用。
市场反应与分析师观察
演讲结束后,市场对 AMD 股价的反应相对平静,盘中波动幅度有限。一些市场评论员指出,本次活动基本符合预期:MI350 系列性能参数亮眼、重要客户关系稳固、未来路线图清晰。尽管未能宣布全新的超大规模云服务商(hyperscaler)客户略显遗憾,但现有顶级客户(Meta、Microsoft、Oracle)的用例扩展和新锐 AI 公司(xAI)的加入,仍有力地证明了 AMD 在 AI 加速器市场的竞争力和增长潜力。
分析师普遍认为,AMD 正系统地执行其 AI 战略。一方面通过每年迭代的硬件产品(MI300 - MI350 - MI400)快速追赶;另一方面通过强化 ROCm 软件栈、拥抱开源框架、收购软件公司(如 Nod.AI)和提供全栈解决方案,积极构建更友好、更开放的开发者生态,以挑战 Nvidia CUDA 的统治地位。AI 算力市场的“饼”足够大,足以容纳多个赢家,AMD 凭借其全面的产品组合和清晰的执行路径,有望在未来几年内实现营收和市场份额的显著增长。
AMD CEO Lisa Su(苏姿丰):AI 仍在早期,异构计算与开放生态是未来撰文:Techub News 整理
导语
2026 年 3 月,AMD 董事长兼首席执行官 Lisa Su(苏姿丰)博士受邀出席美国普渡大学(Purdue University)的“校长讲座系列”(Presidential Lecture Series),与普渡大学校长蒋濛(Mung Chiang)进行了一场深度对话。这场讲座吸引了大量学生和教职工,现场一票难求。作为将 AMD 从市值 20 多亿美元带向超过 2000 亿美元的传奇领导者,苏姿丰在讲座中回顾了其个人职业选择、AMD 转型的关键时刻,并分享了对于人工智能、半导体技术未来、能源挑战以及跨学科合作的前沿思考。本次对话正值 AMD 在 AI 芯片领域与 Meta、OpenAI 等巨头达成重要合作之际,其观点对于理解当前计算产业的竞争格局与未来方向具有重要价值。
摘要
AI 仍处于非常早期的创新周期,当前的应用方式并非终极形态,未来 5-10 年将经历快速演变。
计算等于智能(Compute equals intelligence),但能源与功率已成为限制算力增长的主要物理瓶颈之一。
AMD 的核心战略是专注于高性能计算(HPC),坚信异构计算(CPU、GPU、FPGA、ASIC)和开放生态系统(如 ROCm)是未来的关键。
半导体行业的创新正在加速,通过芯粒(Chiplet)、2.5D/3D 集成等系统级方法,摩尔定律得以以新的形式延续。
解决复杂问题(如医疗健康)的最大机会在于跨学科合作,让不同领域的专家携手实现“1+13”甚至“1+1+110”的效应。
从工程师到 CEO:专注于解决实际问题
讲座伊始,蒋濛校长问及苏姿丰当年在获得麻省理工学院(MIT)博士学位后,为何选择进入工业界而非学术界。苏姿丰坦言,虽然当时也获得了顶尖研究型大学的教职机会,但她认为自己更享受解决实际问题、构建产品以及团队协作的过程。“我仍然认为自己是一名工程师,我最喜欢做的事情就是打造产品。”她表示,从领导小团队到如今管理规模庞大的团队开发产品,这一直是她职业生涯中最大的乐趣所在。
苏姿丰回顾了自己的成长背景:出生于中国台湾,幼年随父亲移民美国,在纽约长大。她笑称自己从小就是个“书呆子”(nerd)。即便在获得硕士学位后急于投入工作,但在典型的亚裔父母坚持下,她继续攻读了博士学位。这段经历培养了她解决前所未有之复杂问题的分析能力和信心,这份能力贯穿了她之后的整个职业生涯。
引领 AMD 转型:押注高性能计算与芯粒技术
当蒋濛校长提到 AMD 市值在过去 12 年间增长约百倍时,苏姿丰幽默地回应“还算不错”。她将 AMD 的成功归因于一系列关键的战略转型和技术押注。
苏姿丰指出,在 2014-2015 年左右,AMD 做出了一个“赌上公司命运”的决定:全力投入芯粒(Chiplet)技术,并将其作为未来高性能计算的基石。当时,摩尔定律放缓的趋势已现,传统的单一芯片 scaling 路径面临挑战。AMD 判断,通过先进的封装技术将多个较小、专用的芯片模块集成在一起,是延续性能增长的新路径。尽管当时这一方向并不明确,但 AMD 的工程团队坚信其潜力。随后,AMD 又将 3D 封装等技术引入产品线。这些前瞻性的技术赌注,最终使 AMD 在服务器、PC 等领域重新获得了强大的竞争力。
“科技公司的美妙之处在于,你可以从一个想法开始,规划路线图并坚持走下去。”苏姿丰说。她和首席技术官 Mark Papermaster 都坚信世界将需要更多高性能计算,并决心让 AMD 在此领域做到最好。如今,AI 浪潮席卷全球,高性能计算成为核心,印证了她们当年的判断。
AI 的现在与未来:早期阶段、能源挑战与异构计算
谈到当前火热的 AI,苏姿丰强调,我们仍处于这项技术的“早期局”(early innings)。无论是 ChatGPT、Gemini 还是其他大模型,都只是开始。未来 5 到 10 年,AI 的应用方式将发生巨大变化,创新周期远未结束。
她提出了一个核心观点:计算等于智能(Compute equals intelligence)。因此,解锁更多智能的关键在于部署更多的算力。然而,这遇到了物理极限的挑战——能源与功率。苏姿丰指出,大约七八年前,团队就已清晰认识到,功率将成为长期计算能力的限制因素。如今,建设 AI 超级工厂(如 Meta 的数据中心)需要规划吉瓦(GW)级别的电力供应。因此,芯片的能效比(每瓦性能)与绝对性能同等重要。任何能够更清洁、快速、经济地产生电力的技术,都将有助于释放更多的智能潜力。
在计算架构上,苏姿丰是异构计算的坚定拥护者。她认为,没有“一刀切”的芯片或模型。未来的计算栈将包含 CPU、GPU、FPGA、ASIC 等多种计算单元,并根据云端、边缘、客户端等不同场景进行优化。她特别提到,AI PC 已经能够本地运行百亿参数级别的模型,这展示了 AI 向更广泛设备普及的趋势。
与此相关的是对开放生态系统的信念。苏姿丰表示,AMD 的 ROCm 软件平台旨在成为一个开放的生态系统,与 Nvidia 的 CUDA 形成差异化竞争。“我认为行业应该有选择。”她希望看到更多的计算选择,包括在像普渡大学这样的学术机构中。
深化产业合作:与 Meta、礼来的“1+13”
苏姿丰以2026 年 3 月宣布的与 Meta 的重大合作为例,阐述了 AMD 的深度合作伙伴战略。她表示,这项合作旨在帮助 Meta 实现其“个人超级智能”的愿景,为更深度个性化的 AI 体验提供计算基础。这类合作需要提前多年规划,涉及吉瓦级数据中心的建设。
同样,她当天早些时候参观了制药巨头礼来公司(Eli Lilly),并与 CEO Dave Ricks 进行了交流。苏姿丰认为,技术发挥最大效用的方式是将不同学科和专业的人聚集在一起,实现“1+13”。AMD 擅长计算,礼来擅长生命科学和药物研发,双方的合作可以探索如何利用下一代制造技术或更有效地在研发过程中使用 AI 计算,从而加速药物发现进程。
她强调,医疗健康是她个人非常看好的 AI 颠覆性领域。AI 不仅可以加速长达十多年的药物研发管线,还能通过整合各科专家经验,帮助提升医疗服务的可及性和质量。
半导体创新不息:连接各点的艺术
作为半导体器件物理博士,苏姿丰对技术演进有着深刻见解。她回顾说,多年前像 2.5D/3D 集成这样的技术看起来几乎不可能实现大规模制造,但工程师们总能找到方法解决难题。
她驳斥了“半导体是成熟领域、创新枯竭”的说法,相反,她认为近年来半导体行业的创新在加速。随着纯工艺微缩(Scaling)放缓,系统级架构、芯粒、先进封装、专用加速器等领域涌现出更多创新机会。
苏姿丰分享了她职业生涯中最有价值的资产之一:成为某个领域的专家(如器件物理),同时培养出将不同非专业领域知识“连接起来”的能力。“我们都在解决极其困难的问题,这需要多个学科共同协作才能实现下一次重大飞跃。能够‘连接各点’(connect the dots)是最有趣的部分。”
在回答学生关于如何在高不确定性下做出长期战略决策时,苏姿丰表示,这需要基于对行业未来关键瓶颈的判断来“下大赌注”,并且这些赌注通常需要 3-5 年才能见效。决策原则是围绕这些瓶颈进行设计,并且要相信自己的工程团队能够实现目标。“如果你总是对的,那可能说明你太保守了。”
AI 重塑工程与人才培养
对于 AI 工具如何改变半导体工程流程,苏姿丰表示,虽然“一键生成芯片”还遥不可及,但 AI 已广泛应用于设计验证、布局优化、测试用例生成、良率提升等环节,显著加速了开发流程,并提高了芯片的功率、性能、面积(PPA)权衡。
她明确否定了“AI 将取代所有工程师”的说法,强调 AMD 仍在大量招聘工程师。公司看重的是具备扎实学科基础(如芯片设计、制造工艺、软硬件交互知识)同时具备 AI 能力(AI-capable)的人才。因为 AI 工具并非永远正确,需要工程师来引导、判断并做出最终的关键决策。
对于学生的职业建议,苏姿丰认为,攻读博士学位的最大价值不在于具体课题,而在于获得解决前所未有的复杂问题的分析能力、批判性思维和信心,这种能力将使人终身受益。
最紧张的时刻与团队的力量
在讲座尾声,被问及职业生涯中最紧张的时刻时,苏姿丰分享了一个早年故事。当时她在 IBM 负责将铜互连技术首次引入 CMOS 器件,在公司对外宣布后,项目却遭遇了严重的良率问题,几乎无法工作。
这段压力巨大的经历让她深刻理解了跨学科团队协作的力量。她组织了一个由器件物理、材料、设计、可靠性等不同领域专家组成的“特别工作组”,全力攻关。九个月后,团队成功解决问题并交付了产品。当她后来在百思买看到采用该技术的苹果 Mac 产品时,感到无比自豪。
“在那之后,作为一名年轻人,你会觉得……其他事情都没什么大不了,总会解决的。”苏姿丰总结道,“将极其聪明、有能力的人聚集在一起,实现‘1+1+110’,这才是作为一名工程师最令人兴奋的地方。”Francesco Andreoli|MetaMask 开发者关系负责人 (Head of Developer Relations) 确认出席「GWDC 2026 KOREA」Techub News 消息,GWDC 2026 KOREA SPEAKER 重磅宣布 Francesco Andreoli|MetaMask 开发者关系负责人 (Head of Developer Relations) 确认出席「GWDC 2026 KOREA」。
Francesco Andreoli 现任 MetaMask(Consensys 旗下)开发者关系负责人,致力于构建全球去中心化应用的极客开发者生态系统。作为连接以太坊生态底层与前沿 DApp 构建者的核心桥梁,Francesco 专注于推进 MetaMask Snaps 扩展生态、链上身份认证、用户体验极简门槛化及开发者工具包(SDK)的落地应用,持续赋能全球 Web3 与 AI 构建者打造下一代去中心化体验。
9月29-30日|首尔 aT Center,Francesco Andreoli 将与政商领袖、行业从业者与开发者齐聚大会分享前沿洞察,共塑 Web3 与 AI 的未来范式。
GWDC 2026 Korea 将于 2026 年 9 月 29 日至 30 日在韩国首尔 aT Center 举办。大会由 Web3Labs 主办,Techub News、HypaiLabs 与 TokenPost 联合主办,并获得香港-韩国Web3政策推动联盟支持。
本届大会以“For Builders, By Builders”为核心理念,聚焦 Web3、AI、链上基础设施与数字资产生态的技术创新和产业应用。大会将通过主题演讲、技术论坛、项目展示、商务对接及黑客松等活动,推动开发者交流、技术协作、资本连接与创新项目落地。
大会已同步开放参会报名与黑客松报名。黑客松预计吸引500+全球开发者参与,围绕真实链上任务展开,配备行业导师辅导及机构 VC 评审,并计划产出 100+创新项目;大会还将设置创新项目展示与 VC 对接,推动优质项目的全球化发布、流动性增长与生态建设。
门票申请:https://luma.com/cp87au4f
大会官网:https://www.gwdc.net
活动赞助:https://gwdcseoul.carrd.co/Metaplanet CEO 在 X 平台发文,说明对 MMXX 的投资关系Techub News 消息,以比特币为战略资产的日本上市公司 Metaplanet 的 CEO Simon Gerovich 于 9 月 6 日在 X 平台发文,向股东和投资者发表声明。他明确表示,自己并非 MMXX 母公司(指 Metaplanet)的非控股股东,也未在 MMXX 公司担任董事职务。
声明还提及,与 MMXX 投资相关的第 10 批新股认购权已于 8 月 18 日完成调整条款的撤销等事项。此举旨在回应市场关切,增强公司透明度。 (CoinPost)Meta FAIR 发布 AI 研究偏好模型,可提前筛选实验方案节省 GPU 时间Techub News 消息,Meta FAIR 联合牛津大学、伦敦大学学院的研究团队发布 AI 研究偏好模型(RPM),旨在让 AI 研究智能体在执行耗时的 GPU 实验前,对候选实验方案进行排序,仅运行最有潜力的方案。该模型包含仅推理和智能体驱动两种变体,使用冻结的预训练大模型(Qwen3.6-27B),相关框架 AIRA-dojo 和基准 AIRS-Bench 已开源。
在 AIRS-Bench 的测试中,使用 RPM 后,平均归一化得分从随机选择的 0.684 提升至 0.711(仅推理)和 0.729(智能体驱动)。效率方面,两种 RPM 均能在约 15 小时内达到基线模型 24 小时的性能水平,实现约 1.5-1.6 倍的加速。此外,研究在 WinoGrande 和 SVAMP 基准上取得了新的最高性能记录。(MarkTechPost)Meta AIRA₂ 在机器学习基准测试中表现优于前代代理Techub News 消息,由 Meta FAIR 实验室、伦敦大学学院和牛津大学联合开发的 AI 研究代理 AIRA₂ 在 MLE-bench-30 基准测试中取得突破,在 24 小时计算后平均百分位排名达 81.5%,72 小时后提升至 83.1%,较前代最佳基线提升约 9 个百分点。
该代理采用异步多 GPU 执行策略和「隐藏一致性评估」协议,在 4000 个团队的 Kaggle 竞赛中获得第 8 名并赢得金牌,在 20 项 AIRS-Bench 评估任务中的 6 项超越人类最优表现。研究团队通过 arXiv 预印本发布成果。(CryptoBriefing)Meta CEO 扎克伯格向特朗普表示国家 AI 监管机构构想存在缺陷Techub News 消息,Meta CEO 马克·扎克伯格向美国前总统唐纳德·特朗普表示,设立国家 AI 监管机构是一个有缺陷的想法。此举突显了技术创新与政府监管之间的张力,可能影响全球 AI 政策的协调。(Crypto Briefing)ElevenLabs 企业收入占比超 55%,ARR 接近 6 亿美元Techub News 消息,AI 语音平台 ElevenLabs 企业客户收入已占总收入的 55%,较 2025 年底的约 50% 有所增长。该公司年度经常性收入(ARR)已从 2025 年底的约 3.3 亿美元增长至 2026 年 5 月的超 5 亿美元,7 月已接近 6 亿美元。
目前 41% 的财富 500 强企业已成为其客户,包括 Meta、Stripe 和德国电信等。企业客户每周通过该平台处理数百万次对话。该公司还聘请了来自 OpenAI 的 Ashley Kramer 担任首席营收官,目标是在 2026 年底前将企业收入占比提升至 60%。(CryptoBriefing)Term Labs 已恢复受 850 万美元治理攻击影响的固定利率贷款头寸Techub News 消息,Term Labs 已恢复其 8 月治理攻击事件中受影响金库持有的所有固定利率贷款头寸,最后一笔头寸已于 8 月 25 日转移。Meta Vaults 及相关受影响策略目前仍处于关闭状态。Term Labs 表示,所有受影响的用户资金已通过其恢复计划得到保障。
此次攻击事件共造成约 850 万美元损失,Term Labs 此前通过社区投票批准了恢复计划,并承诺将全额补偿受影响的用户。(Crypto.news)Pyth Network 扩展 24/7 指数,新增亚马逊 Meta 三星等Techub News 消息,Pyth Network 宣布扩展其 24/7 指数产品,本周新增 12 个指数,包括亚马逊、Meta、Coinbase、Palantir 等美股,以及首只韩国上市股票三星和三只 ETF 指数,实现全天候连续定价。
该扩展使 Pyth 指数从单一原油指数扩展至涵盖原油、金属、个股、主题篮子及国际上市股票和 ETF 的产品线。Coinbase、Kraken、OKX 等平台正基于这些指数构建市场,利用连续定价支持传统基础设施无法实现的交易场景。Meta 发布 Muse Spark 1.3 版本,升级编程能力Techub News 消息,Meta 发布了其 AI 编程工具 Muse Spark 的 1.3 版本,该版本包含多项编程功能升级。此举正值 Meta 增加对 AI 基础设施和人才招聘的投入,以强化其相对于 OpenAI 和 Anthropic 的竞争地位。 (Tech in Asia)英伟达、微软、Meta 等 25 家公司联盟反对美国限制开源 AI 模型Techub News 消息,由英伟达、微软和 Meta 等 25 家公司组成的联盟公开反对美国对开源 AI 模型的限制。该联盟认为,当前推动限制的举措主要有利于闭源模型,并对此提出批评。
(Crypto Briefing)