撰文:Techub News 整理
导语
2025 年 5 月,在红杉资本(Sequoia Capital)组织的一场内部对话中,Google 首席科学家、AI 领域的传奇人物 Jeff Dean(杰夫·迪恩)与红杉合伙人、前 Google 工程高管 Bill Coughran 进行了一场深入对谈。作为主导 Google Brain 创立、Transformer 架构早期推动者以及 TPU(张量处理单元)项目发起人的关键人物,Jeff Dean 的视野横跨了 AI 研究、基础设施与产品化。本次对话发生在 AI 技术狂飙突进、行业竞争白热化的当下,他的思考不仅揭示了 Google 的战略方向,也为整个行业的技术演进提供了高屋建瓴的视角。
摘要
- AI 智能体(Agents)的实现路径清晰,将从虚拟环境逐步扩展到物理机器人,其能力将通过强化学习和经验积累快速增长。
- 顶尖大模型的竞争将仅限于少数玩家,但通过模型蒸馏等技术,轻量化、专业化的小模型将百花齐放。
- 专用 AI 硬件(如 TPU)对于实现高效能、低功耗的计算至关重要,未来推理硬件有望实现数万倍的能效提升。
- AI 正在彻底改变科学研究范式,例如用神经网络替代传统模拟器,使发现速度提升数十万倍。
- Jeff Dean 预测,具备初级工程师水平的 AI 代理可能在“一年左右”的时间内出现,这需要其在代码生成之外,掌握测试、调试、使用工具等综合能力。
从 Transformer 到 Gemini:AI 的规模化之路
Jeff Dean(杰夫·迪恩)开篇便回顾了 AI 浪潮的长期积累。他指出,虽然 AI 近三四年才进入大众视野,但其基础早在 2012-2013 年就已奠定。当时,人们开始利用“大型”神经网络解决视觉、语音和语言问题,这种统一的方法论取代了传统的手工定制方案,证明了机器学习的巨大潜力。
Dean 特别提到了 Google 在 2012 年的一项关键工作:他们训练了一个比当时任何模型都大 60 倍的神经网络,使用了 16,000 个 CPU 核心,并取得了卓越的结果。这次实验“巩固了我们心中的信念:规模化这些方法是可行的。” 自此,“更大的模型、更多的数据、更好的结果”成为过去十多年来 AI 发展的核心驱动力。
如今,模型能力已今非昔比。Dean 认为,当前的模型虽然无法解决所有问题,但每年都能解决更多的问题。这得益于算法改进(如以相同算力训练更大模型)、硬件扩展(更多计算单元、更高互联带宽)以及后训练技术(如强化学习)的综合进步。多模态能力——能处理并生成音频、视频、图像、文本和代码——也正变得极为实用。
智能体:从“有点虚”到现实路径
当被问及目前行业热捧的“智能体”(Agents)时,Dean 坦言部分概念确有“泡沫”之嫌,但他看到了清晰的实现路径。他认为,通过合适的训练过程,智能体最终能够在虚拟计算机环境中完成许多人类今日可做的事情。目前它们能做一部分,但还不是大部分。能力提升的路径是明确的:更多的强化学习、更多的智能体经验学习,以及虽不完美但已极具实用性的早期产品。
Dean 将这一逻辑延伸到物理世界。物理机器人智能体的发展将遵循类似的轨迹:先从能在混乱环境中完成少数任务(比如整理房间)的昂贵机器人开始;通过经验学习,降低成本,进而发展出能做上千种任务、成本仅十分之一的下一代产品。这种成本与能力的正向循环将推动智能体技术快速成熟。
模型格局:少数巨头与百花齐放
对于大语言模型的竞争格局,Dean 的看法直接而深刻:打造最顶尖的模型需要巨额投资,因此最终玩家不会超过 50 个,可能只有少数几个。这指的是处于绝对前沿的“基础模型”。
然而,这不意味着市场会固化。一旦有了这些强大的基础模型,利用诸如模型蒸馏(Dean 本人是该技术的早期共同作者之一)等技术,可以创造出大量轻量级的模型,适用于更多场景。他举例说,这项技术可能帮助了像 DeepSeek 这样的模型。因此,未来将会出现众多不同形态、专注于不同领域的模型,但少数几个能力强大的通用模型仍将占据重要地位。
硬件之争:超越英伟达,拥抱专用化
谈及硬件,Dean 的立场非常明确。作为 Google TPU 项目的奠基人,他坚信专用于机器学习的硬件,特别是专注于“降低精度线性代数”的加速器,是未来的关键。这些硬件需要代际性能提升,并通过超高速网络大规模互联,以便将模型计算扩展到尽可能多的计算设备上。
他回顾了 TPU 的诞生:2013 年,他们预见到推理将需要巨大算力,因此启动了第一代 TPU;第二代(TPUv2)则同时聚焦推理和训练。对于当前云 TPU 开发者体验的批评,Dean 承认有改进空间,并重点介绍了 Google 内部的解决方案Pathways。该系统提供了强大的抽象层,让研究人员只需一个 Python 进程就能驱动成千上万个芯片进行训练,极大简化了大规模模型训练的复杂度。他宣布,Pathways 现已向 Google Cloud 客户开放。
展望未来,Dean 认为推理硬件的能效有巨大提升空间。“我们如何制造出比如今能效高 1万、2万、5万倍的推理硬件?这似乎是完全可能的。” 他提到模拟计算作为一种可能路径,其优势在于极高的能效,但数字专用硬件也大有可为。他本人目前也在此领域投入时间研究。
AI 驱动的科学革命与未来计算
Dean 以今年诺贝尔物理学奖和化学奖(其同事 Demis Hassabis 和 John Jumper 因 AlphaFold 获奖)为例,指出 AI 正在深刻影响众多科学领域。核心在于,AI 能从数据中学习,而许多科学发现正是关于建立事物间的联系。
他描述了一个变革性场景:许多学科拥有极其昂贵的计算模拟器(如天气预测、流体动力学、量子化学)。可以利用这些模拟器作为训练数据,训练一个神经网络来近似模拟器,其速度可能比原模拟器快 30 万倍。这将彻底改变科研方式——科学家可以在午餐时间筛选一千万个分子,而以前这需要耗费一年且无法承担的计算资源。这种“速度革命”将极大地加速科学发现。
对于计算基础设施的未来,Dean 描绘了一幅异构、专用化的图景。计算需求在过去五到十年发生了根本性转变:我们需要以极高性能、极低功耗运行超大型神经网络。训练和推理是两种不同的负载,可能需要不同的解决方案。未来,从手机、机器人、自动驾驶汽车到数据中心,都将出现为高效运行强大模型而专门优化的硬件平台。此外,“计算量”成为一个新的、强大的调节旋钮——对某些问题投入一万倍的计算,可以获得质的飞跃,但显然不能对所有问题都如此挥霍。这需要硬件、系统软件、模型和算法(如蒸馏)的协同创新。
展望:虚拟工程师与有机学习系统
在问答环节,一个尖锐的问题被抛出:我们距离拥有一个能 7x24 小时工作、水平相当于初级工程师的 AI 还有多远?Dean 的回答令人惊讶:“不太远……我断言这可能在未来一年左右实现。” 他强调,这需要的不仅仅是更好的代码生成,还包括工具使用、自主规划、运行测试、调试性能问题等一系列综合能力。虚拟工程师可以通过阅读文档、在虚拟环境中试错来积累“经验”,这为能力的快速提升提供了路径。
最后,Dean 分享了他对模型架构未来的憧憬。他一直是稀疏化、混合专家(MoE)模型的倡导者,认为这更接近生物大脑高效利用能量的方式(不同区域针对不同任务激活)。当前 MoE 的实现还太规整,未来模型应有计算代价相差千倍的不同路径,并能够动态扩展、压缩和重组参数,形成一个更有机、持续学习的系统。虽然当前范式非常有效,难以立刻转向,但他相信这种方向蕴藏着巨大的潜力。










