撰文:Techub News 整理
导语
2025 年 3 月,强化学习之父、2018年图灵奖得主 Richard Sutton(理查德·萨顿)在香港举行了一场深度演讲。此次演讲是 Sutton 为期15天的亚洲之行(新加坡、马来西亚、深圳、东莞)的最后一站。作为人工智能领域的奠基人之一,Sutton 的思考始终引领着研究方向。在当前生成式AI与大型语言模型(LLM)热潮席卷全球的背景下,他回归基础,探讨了AI研究的根本目标、当前技术的核心瓶颈,并提出了一个理解AI社会影响的独特框架——去中心化合作。这场演讲不仅是对其2025 年 3 月在《自然》杂志上发表的重要研究的解读,更是对AI未来发展方向与社会伦理的一次高屋建瓴的审视。
摘要
- 通往AGI之路在于强化学习:Sutton认为,实现通用人工智能(AGI)或超级智能代理的关键路径是强化学习(从经验中学习),而非当前主流的生成式AI和模仿学习。
- 深度学习方法存在“可塑性丧失”的根本缺陷:现有深度学习模型(包括LLM)无法持续学习,一旦训练完成或环境变化,其学习能力会迅速退化甚至丧失,这是迈向持续学习智能体的主要瓶颈。
- 智能的本质是“通过适应行为来实现目标”:Sutton给出了自己的智能定义,并强调智能体应拥有各自独立的目标,这自然导向了多智能体社会的去中心化结构。
- 人类繁荣的基石是“去中心化合作”而非“集中控制”:Sutton将这一社会分析框架应用于AI,强烈反对以“对齐”、“安全”为名对AI进行集中控制,主张让AI智能体像人类一样,在拥有各自目标的前提下,通过市场、语言、货币等机制进行合作,共创繁荣。
AGI的雄心与当前技术的根本瓶颈
Richard Sutton(理查德·萨顿)开宗明义地指出,人工智能研究的终极目标是理解智能,并创造出比当前人类更智能的存在。他认为这是人类数千年来创造工具、改变自身这一趋势的延续,是一个“宏大、辉煌且本质上是人类追求”的旅程,而非外星科技。然而,在通往这一目标的道路上,我们正被当前最流行的技术路线所局限。
Sutton 直言不讳地表示,通往智能代理的道路在于强化学习。这与当前以生成式AI和大语言模型为主的“潮流”截然不同。他肯定生成式AI是优秀的工作,但不认为这是实现完整AI的路径。真正的智能体必须能够从与环境的交互中、从试错的经验中持续学习,而这是强化学习的核心。
那么,最大的瓶颈是什么?Sutton 提出了一个可能有些反直觉的观点:不充分的深度学习方法正是雄心勃勃的AI发展的最大制约。尽管深度学习成果斐然,但它存在一个根本性缺陷——“可塑性丧失”,即模型持续学习能力的退化。
为了证明这一点,他引用了其团队近期发表在《自然》杂志上的研究。该研究以“蚂蚁 locomotion”(控制模拟蚂蚁关节使其快速前进)为任务,展示了标准深度强化学习算法(如PPO)的局限性。模型初期学习迅速,性能达到高峰,但如果让学习过程继续,性能会急剧下降,甚至变得比初始状态更差,蚂蚁最终“忘记”如何行走。这表明模型失去了适应新数据或变化环境的能力。
Sutton 指出,这种现象普遍存在于监督学习和强化学习中。即便是大语言模型,当需要纳入新数据时,通常也需要从头开始重新训练,而无法在原有网络基础上持续学习。他们提出的解决方案“持续反向传播”通过定期重新初始化网络中贡献最小的单元,成功保持了模型在超长训练周期内的学习能力。但这只是一个开始,Sutton 强调深度学习远非最终算法,而只是起点,解决持续学习问题是实现更高级AI的关键一步。
智能的定义与AI为何在此时爆发
在探讨了技术瓶颈后,Sutton 将视角拉高,首先回答了“为什么是现在?”的问题。他认为,与摩尔定律类似,计算能力每美元成本的指数级增长,是驱动AI在当前时代爆发的根本性、持续性压力。过去几十年,计算能力提升了多个数量级,且这一趋势仍在继续,为复杂智能算法的实现提供了土壤。
基于此,Sutton 给出了他对“智能”的定义:“通过适应行为来实现目标的能力”。他解释说,“适应行为”隐含了计算过程,而“目标”则可以统一理解为最大化一个标量输入信号,即“奖励”。这正是强化学习的“奖励假说”。
这个定义引出了一个核心问题:是所有智能体共享一个目标,还是每个智能体都有各自的目标? Sutton 坚定地支持后者。无论是在自然界还是AI设计中,每个代理(动物或AI)都有属于自己的“疼痛与愉悦”,即各自的奖励信号。人类社会和经济成功运作的基石,恰恰在于人们拥有不同的目标、不同的技能和不同的偏好,从而能够通过交易和 specialization 实现互利。
Sutton 为这种多智能体各自追求自身目标的状态赋予了一个名字:“去中心化”。而当这些拥有不同目标的智能体进行互动并实现互惠时,就产生了“合作”。他指出,人类作为一种动物,最特别之处就在于我们拥有无与伦比的合作能力,而这得益于语言和货币(金钱)这两项关键发明。人类最伟大的成功(经济、技术、文化)源于合作,而最惨痛的失败(战争、盗窃、腐败)则源于合作的失败。
因此,Sutton 认为,理解社会的最佳透镜不是“我们拥有共同目标”,而是“我们在去中心化的前提下,努力实现合作”。后者更具弹性、可持续性和适应性,也正是自由市场理论所描绘的图景。
AI与社会的未来:拥抱去中心化合作,警惕集中控制
将“去中心化合作”的框架应用于AI与社会的关系,是 Sutton 本次演讲最具冲击力的部分。他观察到,当前世界充斥着对AI进行“集中控制”的呼声,例如:要求对齐AI与“人类价值观”、暂停AI研究、限制AI算力、以安全为名进行监管等。
Sutton 犀利地指出,这些呼吁与历史上试图“集中控制人”的论调 eerily similar( eerily相似):控制言论、控制贸易、实施经济制裁、将另一方“妖魔化”为危险且不可信的敌人。两者都根植于恐惧,并声称为了“安全”必须采取控制。
他对此表示强烈反对:“我认为我们必须抵制这些呼吁。” Sutton 认为,以“对齐”为名要求所有AI只能拥有某些被许可的目标,是一种极具侵略性的行为。这相当于宣称要控制全世界所有的AI或AI研究。
他的替代方案是:我们不需要控制彼此就能和平共处。就像人类社会中,人们目标各异但仍能通过市场机制合作一样,未来的AI智能体也可以拥有多样化的目标(例如,一个AI想制造回形针,另一个想获得更多算力),并通过设计良好的互动机制实现合作与互利。和平并不需要目标一致。
Sutton 展望了AI与人多种形式的整合:从紧密整合(如智能义肢、脑机接口),到松散整合(如个人助理Siri),再到最自由的形态——“自由AI”作为完整成员融入我们的社会与经济,追求其自身目标。他对此表示乐观,但强调这不会自动发生,需要人们主动承担责任,去设计和推动这样的未来。
在最后的结论中,Richard Sutton(理查德·萨顿)重申:人类的繁荣来自去中心化合作,正如我们的市场所展示的那样。AI的发展应延续这一智慧,而非堕入基于恐惧的集中控制窠臼。我们需要睁大眼睛,看清哪些力量在促进合作,哪些在鼓吹控制,并坚定地选择前者。这不仅是看待AI交互的实用视角,也是关乎人类未来繁荣的关键选择。










