撰文:Techub News 整理
导语
在2025 年 5 月一场备受瞩目的公开对话中,谷歌旗下前沿人工智能实验室 DeepMind 的 CEO 德米斯·哈萨比斯(Demis Hassabis)与谷歌联合创始人谢尔盖·布林(Sergey Brin)一同亮相,就人工智能发展的最前沿问题进行了深入探讨。这场对话发生在谷歌I/O开发者大会期间,由知名科技播客主持人亚历克斯·坎特罗维茨(Alex Kantrowitz)主持。哈萨比斯作为 DeepMind 的灵魂人物,以及布林以技术领袖和谷歌联合创始人的身份回归 AI 研发一线,使得这场对话成为观察谷歌乃至整个行业在 AGI(通用人工智能)竞赛中战略思考与自我认知的绝佳窗口。
摘要
- AGI 仍需关键突破:哈萨比斯认为,基于当前技术,要实现 AGI 可能还需要“一到两个关键性突破”,并将 AGI 定义为能达到爱因斯坦、莫扎特等人类顶尖智慧成就的系统。
- “深度思考”范式至关重要:谷歌 DeepMind 正大力押注以“深度思考”(Deep Think)为代表的推理增强范式,认为这能为模型能力带来巨大提升,是通往更通用智能的关键路径。
- 多模态是 AGI 的必然要求:哈萨比斯强调,真正的 AGI 必须理解和互动物理世界,因此从 Gemini 项目伊始,DeepMind 就坚持构建原生多模态模型,尽管初期更困难,但长期看是正确的选择。
- 算法与算力需双轮驱动:哈萨比斯与布林均认为,未来的进步需要算法创新与算力扩展的双重驱动,布林更倾向于认为算法的进步可能比纯粹的计算力提升更为重要。
AGI 的愿景与定义:远非“普通人水平”
对话的核心议题围绕 AGI 展开。德米斯·哈萨比斯(Demis Hassabis)首先澄清了他对 AGI 的定义。他认为,目前行业对 AGI 的讨论存在两个层面的混淆:一是达到“普通人类水平”的能力,这无疑具有巨大的经济与产品意义;二是他个人所关注的、更具理论意义的 AGI——即一个系统能够实现人类大脑架构所能实现的所有成就,包括爱因斯坦的理论物理、莫扎特的音乐创作等历史上的顶尖智慧成果。他强调,目前没有任何系统具备这种广度和深度的能力。
哈萨比斯进一步指出,当前系统距离真正的 AGI 还有一大差距:一致性(Consistency)不足。今天的模型虽然能做上千件事,展示了许多令人印象深刻的能力,但用户很容易在几分钟内发现其明显的缺陷,比如在某些高中数学问题或基础游戏上犯错。在他看来,一个能被称之为 AGI 的系统,其漏洞应该需要专家团队花费数月才能发现,而不仅仅是普通用户几分钟的测试。
当被问及 AGI 是否会被某一家公司“一劳永逸”地实现时,谢尔盖·布林(Sergey Brin)认为,很可能会有某个实体率先达到,但由于 AGI 本身是一个光谱而非精确点,不排除多家机构几乎同时抵达相近水平。他预测,AI 领域将延续“蛙跳式”的竞争与相互启发模式,不断推动阈值被跨越。
哈萨比斯则补充,重要的是业界需要对 AGI 形成一个共识定义。他承认可能会有组织率先抵达,而确保首批 AGI 系统以可靠和安全的方式构建至关重要。在此之后,才有可能设想基于这些安全架构衍生出更多的系统,例如个人 AGI。
技术路径:推理、自我改进与多模态整合
谈及具体技术,哈萨比斯详细阐释了 DeepMind 长期看重的“思考”或“推理”范式。他回顾了从 AlphaGo、AlphaZero 开始的工作,在这些游戏中,开启“思考”(即蒙特卡洛树搜索等规划算法)的系统,其能力比仅输出第一反应的系统高出超过 600 ELO 等级分。这种范式在更为复杂的现实世界中,潜力可能更大。
谷歌最新推出的“深度思考”(Deep Think)技术,被哈萨比斯描述为“类固醇加强版的推理”,即多个并行推理过程相互协作与校验。他认为,这种增强推理能力的机制,可能是通往 AGI 所需的关键进展之一。此外,真正的发明创造——例如提出全新的物理学理论,而非仅仅解决现有猜想——是目前系统尚未具备的能力,但以“思考”为代表的范式可能有助于实现这一目标。
对于2025 年 5 月 DeepMind 发布的“Alpha Evolve”(一种能帮助设计更好算法甚至改进大语言模型训练方式的 AI),主持人调侃这是否意在引发“智能爆炸”。哈萨比斯否认了“不受控制”的爆炸,但承认这是一个有趣的初步实验。他表示,将进化编程等技术与强大的基础模型结合,探索各种组合系统是 DeepMind 探索性工作的重点。若能发现一种自我改进的循环,确实可能进一步加速进展。AlphaZero 在游戏领域已证明自我改进的可能性,但将之应用于更混乱、复杂的现实世界仍有待观察。
哈萨比斯强调,DeepMind 自始至终的目标是构建 AGI,这决定了其技术路线选择。因此,从 Gemini 项目一开始,他们就决定构建原生多模态模型,即使这比只做纯文本模型起步更艰难。他坚信,真正的通用智能必须理解物理环境,而两大关键应用场景——能伴随日常生活的真正有用的助手,以及实用的机器人——都依赖于这种对世界的视觉和物理理解。这也是谷歌在智能眼镜和具身智能(如 Astra 项目)上持续投入的原因。
算力、算法与行业未来
关于推动进步的主要驱动力,哈萨比斯和布林都认为需要算法创新与计算规模双管齐下。哈萨比斯表示,一方面需要将现有已知技术(无论是数据还是算力)的规模扩展到极限,另一方面必须投入大量精力进行前瞻性创新,以带来下一个数量级的飞跃。
谢尔盖·布林(Sergey Brin)从历史角度分析,在诸如 N 体问题模拟等领域,算法的进步甚至超越了遵循摩尔定律的计算力进步。他个人猜测,未来算法的进展可能比纯粹的计算力进步更为显著。不过,目前二者都在快速推进,行业正同时受益于两者。
对于主持人“世界是否会铺满数据中心”的提问,哈萨比斯指出,未来确实需要更多的数据中心,但这不仅仅是为了模型训练。随着 Gemini 等模型展示出强大性能且成本可控,全球对其使用需求激增,推理阶段的计算消耗将变得极其庞大。此外,“深度思考”等范式允许模型通过更长的“思考”时间来解决高价值难题,这也将消耗大量运行时算力。
产品哲学与行业挑战
谈及谷歌的产品方向,哈萨比斯解释了为何谷歌的智能体演示往往强调视觉和与现实世界的交互。他认为,一个真正有用的助手不应局限于电脑或单一设备,而应能理解并融入用户的物理环境。同时,机器人发展的瓶颈长期以来在于软件智能而非硬件,而如今 Gemini 等模型结合 Veo 等视频生成技术,为机器人带来了突破的曙光。
谢尔盖·布林(Sergey Brin)也反思了早年谷歌眼镜(Google Glass)项目的教训,承认在消费电子供应链、制造成本控制等方面曾面临挑战。但他仍然坚信眼镜这一形态的潜力,并认为如今 AI 能力的飞跃使得眼镜能在不打扰用户的情况下提供真正有用的帮助。哈萨比斯更是直言,“通用助手”将是智能眼镜的杀手级应用。
针对 AI 生成内容(特别是视频)泛滥可能污染后续模型训练数据(即“模型崩溃”问题)的担忧,哈萨比斯分享了 DeepMind 的应对策略。他们为所有生成式模型的内容附加了名为“SynthID”的隐形水印,该技术已稳定运行一年多,既能用于识别深度伪造和虚假信息,也可用于在需要时从训练数据中过滤掉 AI 生成内容。此外,在蛋白质结构预测模型 AlphaFold 的开发中,他们已有谨慎使用合成数据的经验,但这需要确保数据分布和质量得到严格控制。
快速问答:AGI 时间表、模拟假说与未来展望
在对话最后的快速问答环节,两位嘉宾被问及 AGI 的时间预测。哈萨比斯给出了“2030年之后不久”的答案,而布林则更为乐观地选择了“2030年之前”。哈萨比斯笑称这个答案让他倍感压力,需要回去更努力地工作。
关于哈萨比斯此前一条引发热议的推特(内容关于“自然到模拟一键生成”),主持人直接询问他是否认为我们生活在模拟之中。哈萨比斯否认了类似电影《黑客帝国》的那种模拟,但他认为底层物理本质上是基于信息论的,我们可能身处一个“计算宇宙”中。AI 系统能够模拟自然界的真实结构,这一事实发人深省,他未来可能就此撰写科学论文。布林则从递归逻辑的角度调侃了“模拟假说”,认为若我们是模拟产物,那么模拟我们的存在本身也可能处于模拟之中,如此无限循环。
对于十年后互联网的形态,布林认为,鉴于 AI 惊人的发展速度,我们甚至无法预见十年后的世界面貌。哈萨比斯则从更近期的角度预测,在“智能体优先”的网络中,为了人类视觉呈现而设计的渲染可能不再必要,互联网将在几年内发生巨大变化。
整场对话揭示了 DeepMind 领导层对 AGI 既雄心勃勃又审慎务实的态度。他们清晰地规划了以推理增强和多模态理解为支柱的技术路线,同时清醒地认识到当前系统与真正 AGI 之间的差距。这场对话不仅是对谷歌AI野心的展示,也为理解全球AGI竞赛的当前格局提供了宝贵的一手视角。










