撰文:Techub News 整理
导语
在大型语言模型和多模态模型席卷全球的当下,AI 的发展似乎被锚定在「人类数据」的范式之中。然而,Google DeepMind 研究负责人、AlphaGo 与 AlphaZero 核心缔造者之一 David Silver(大卫·席尔瓦)提出了一个大胆的转向:AI 的下一个时代应是「经验时代」。在最新一期《Google DeepMind:The Podcast》中,David Silver 与主持人 Hannah Fry 深入探讨了这一观点,解释了为何依赖人类数据会限制 AI 的潜力,以及通过强化学习让 AI 从自主经验中学习,如何能开启超越人类智能的新篇章。这场对话不仅回顾了 AlphaGo 里程碑式胜利背后的哲学,更展望了 AI 在数学、科学等复杂领域实现根本性突破的路径。
摘要
- 当前 AI 处于「人类数据时代」,其能力上限受限于人类已有的知识与数据。
- 「经验时代」的核心是 AI 通过自主与环境交互(如自我对弈、实验),从自身生成的「经验」中学习,从而发现人类未知的知识。
- AlphaGo/AlphaZero 的成功证明了「抛弃人类数据」的强化学习方法能产生超越人类直觉的创造性策略(如著名的「第 37 手」)。
- 新系统 AlphaProof 已将类似方法应用于数学证明领域,在国际数学奥林匹克竞赛中达到银牌水平,展示了「经验驱动」AI 解决复杂抽象问题的潜力。
- 迈向「经验时代」需解决奖励设定、安全性、对齐等挑战,但这可能是实现超人类智能和可持续 AI 进步的必由之路。
从人类数据到自主经验:AI 范式的根本转变
David Silver(大卫·席尔瓦)开宗明义地指出,过去几年的 AI 发展可以概括为「人类数据时代」。无论是大型语言模型还是多模态模型,其核心逻辑都是汲取人类积累的所有知识,并将其灌输给机器。这种方法固然强大,让 AI 掌握了人类用语言记录的一切。然而,Silver 认为,如果我们希望 AI 能够超越人类已知的范畴,去发现人类尚未知晓的事物,就必须转向一种不同的方法。
这就是他提出的「经验时代」。在这个新时代,AI 将不再仅仅被动接受人类数据,而是主动与环境互动,生成属于自己的「经验」。它通过试错,在环境中尝试各种行动,并根据结果(奖励或惩罚)不断学习和进化。如果把数据比作燃料,那么「人类数据」是一种储量有限且带有先天局限的化石燃料,而「自我生成的经验」则是一种可持续、可无限再生且能推动 AI 不断突破极限的新能源。
Silver 强调,这并不是要否定当前基于人类数据的 AI 取得的惊人成就,而是指出其内在的天花板。人类数据承载的是人类经验的结晶,但也固化了人类的认知边界。AI 若想实现「超人类」的智能,就必须拥有突破这层边界的能力。
AlphaZero 的启示:抛弃人类知识后的飞跃
为了具体说明「经验时代」的可行性,Silver 回顾了 DeepMind 的标志性成就:AlphaGo 和更进一步的 AlphaZero。最初的 AlphaGo 在 2016 年击败李世石时,其训练过程还使用了人类棋谱数据库作为起点。然而,一年后问世的 AlphaZero 实现了更激进的一步:「Zero」意味着零人类数据输入。系统完全从随机走子开始,通过数以百万计的自我对弈,仅凭「赢」或「输」的最终信号进行学习。
令人惊讶的是,抛弃了人类经验的 AlphaZero,不仅恢复了 AlphaGo 的水平,反而学得更快,达到了更高的棋力巅峰。Silver 将此称为 AI 领域的「苦涩教训」:我们人类总倾向于相信自己积累的知识无比重要,并急于将其编码进 AI 系统。但这样做往往会让算法设计迎合人类数据,反而削弱了系统自我学习、自我发现的能力。
「人类数据确实能帮助你起步,但它在人类所做的一切事情上都设置了一个天花板,」Silver 解释道。在围棋领域,人类棋手存在一个可观测的性能上限。AlphaZero 通过纯粹的自我对弈学习,不断强化,最终冲破了这个天花板,达到了人类从未企及的高度。这完美诠释了「经验时代」的核心愿景:找到方法,在一切我们构建 AI 系统的领域,打破人类能力的天花板。
强化学习与「第 37 手」:创造性突破的诞生
AlphaZero 背后的核心技术是强化学习。其原理简洁而有力:为最终结果赋予一个数值奖励(例如,赢棋得+1,输棋得-1),系统通过调整自身行为(如神经网络权重)来最大化累积奖励。在围棋这类长序列决策中,关键挑战在于「信用分配」——如何将最终的一个胜负信号,回溯分配到数百步棋中的每一步上。
AlphaGo 与李世石对决中著名的「第 37 手」,正是这种学习范式催生创造性突破的绝佳例证。这步棋落在人类棋手通常认为不合逻辑的五路线上,却巧妙地连接了全局,被职业棋手评估为人类只有万分之一概率会想到的招法。这步「外星」棋手帮助 AlphaGo 赢得了比赛,也震撼了整个围棋界。
Silver 指出,「第 37 手」之所以特别,不仅在于其创造性,更在于它代表了无限系列发现中的一个点。一旦系统掌握了从自身经验中学习的能力,它就能持续产生这类超越人类直觉的洞见。相比之下,当前锚定在人类数据上的大型语言模型,由于其训练目标是复现和贴合人类反馈,本质上难以产生真正超越人类认知范畴的「第 37 手」时刻。Silver 认为,在现实世界中,等效的重大突破(如 MIT 科学家利用 AI 发现全新抗生素)已经出现,但只有当 AI 系统普遍采用从经验中自主学习的方式时,这类突破才会成为常态。
AlphaProof:将「经验」燃料注入数学证明
为了展示「经验驱动」范式的普适性,Silver 介绍了 DeepMind 的新系统AlphaProof。该系统将 AlphaZero 的强化学习框架应用到了形式数学证明领域。与大型语言模型通常输出非正式、可能「幻觉」的数学推理不同,AlphaProof 的目标是生成可被严格验证的完整形式化证明。
其训练方式与 AlphaZero 异曲同工:系统被给予数百万个已知的数学定理(仅命题,不包含人类证明过程),目标是通过在形式语言(如 Lean)中进行推导,最终得到「证明完成」的信号(奖励+1)或失败(奖励-1)。系统从几乎无法证明任何定理开始,通过不断尝试和强化学习,逐渐提升证明能力。
AlphaProof 在 2024 年国际数学奥林匹克竞赛级别的问题上取得了突破性进展,达到了银牌级别的性能,意味着其能力超过了约 90% 的全球顶尖年轻数学选手。尤其值得一提的是,它完美解决了一道仅有不到 1% 参赛者能解出的难题。Silver 坦言,这些证明对人类而言往往难以直接理解,但可以通过其他工具「非形式化」回人类可读的表述。他坚信,沿着这条「经验驱动」的道路,AI 最终将能解决如黎曼猜想那样的重大数学难题,尽管这仍需时日。
挑战与风险:定义奖励、安全与对齐
从清晰的游戏胜负和数学证明正确性,转向现实世界中「更混乱」的问题,是「经验时代」面临的核心挑战。在现实世界中,什么是合适的「奖励」信号?如何避免优化单一指标带来的意外后果(如著名的「回形针最大化」风险)?
Silver 承认这是目前强化学习方法尚未主宰所有 AI 领域的主要原因,但也提出了可能的路径。他认为,现实世界本身就充满了各种可量化的信号(如点赞、利润、产量、健康指标等)。未来的系统或许可以这样工作:人类提供一个高层级、模糊的目标(如「让我更健康」),AI 系统则自主探索并组合出一系列底层可量化的指标(如心率、焦虑水平等),将其作为强化学习的奖励函数,并在与人类的持续互动中动态调整这些指标的组合。
这种具备长期生命、能持续适应和学习的 AI 系统,反而可能比当前静态、目标固定的系统更安全。因为它能根据真实的人类反馈(如幸福或痛苦信号)及时调整优化方向,避免走上危害人类的极端路径。当然,Silver 强调这需要极其谨慎的研究和设计,这也正是他撰写「经验时代」立场论文的原因——他希望唤起业界对这一必然转变及其深远影响的重视,提前思考其中的风险与伦理问题。
「可持续燃料」:强化学习是通往 AGI 的引擎
回顾自己此前提出的「奖励即足够」论点,Silver 用了一个生动的比喻:人类数据就像化石燃料,储量丰富,能让我们快速启动并达到一定的高度,但终将耗尽且带有污染(局限)。而强化学习驱动的「经验生成与学习」则是可持续的清洁能源,它可以持续产生新的「燃料」,驱动 AI 不断学习、无限进步。
在播客的最后,David Silver(大卫·席尔瓦)与首位与 AlphaGo 对弈的职业棋手樊麾进行了一场温馨的对谈。樊麾回忆了当年输给 AlphaGo 时的震撼与恐惧,但也坦言正是 AlphaGo「打开了他的思维」,让他意识到一切皆有可能。这或许正是「经验时代」AI 将带给人类的更深层影响:不仅仅是工具效能的提升,更是对人类认知边界和可能性的重新定义。
正如主持人 Hannah Fry 在总结中所说,当前 AI 的成功可能让人们忽视了其他路径的重要性。David Silver(大卫·席尔瓦)的论述有力地提醒我们,如果追求的是真正的超人类智能,那么也许是时候让 AI 逐渐脱离人类的「襁褓」,走向自主探索与发现的「经验时代」了。










