撰文:Techub News 整理
导语
在2025 年 5 月举行的 Google I/O 2025 开发者大会主题演讲中,Google DeepMind 联合创始人兼首席执行官 Demis Hassabis(德米斯·哈萨比斯)携团队核心成员登台,向全球开发者与 AI 社区展示了其旗舰模型 Gemini 在过去一年取得的“ relentless progress”(不懈进步)。此次演讲不仅是对 Gemini 2.5 Pro 和 Flash 模型性能升级的汇报,更是一次关于 Google AI 未来战略的深度阐述。哈萨比斯明确提出了将 Gemini 进化为“世界模型”的愿景,并展示了 Project Astra 如何向“通用 AI 助手”演进,清晰地勾勒出 Google 通往 AGI(通用人工智能)的路线图。
摘要
- Gemini 2.5 Pro 被定位为“最智能的模型”,新增“深度思考”模式,在数学、编程等硬核基准测试中达到前沿水平。
- Gemini 2.5 Flash 迎来重大更新,效率提升 22%,并引入“思维预算”功能,让开发者在成本、延迟与质量间取得平衡。
- 发布多项面向开发者的新能力:原生多说话人音频、思维摘要、代码助手 Jules 公测,以及实验性的 Gemini Diffusion 文本扩散模型。
- 首次系统阐述“世界模型”愿景,旨在让 AI 能像人脑一样模拟世界进行规划和想象,这是实现通用 AI 助手和 AGI 的关键一步。
- Project Astra 原型展示了未来 AI 助手如何通过理解屏幕内容、控制电脑、处理多任务来协助完成现实世界中的复杂任务(如维修自行车)。
Gemini 2.5:性能、效率与开发者工具的全面进化
Demis Hassabis(德米斯·哈萨比斯)在开场即定调:我们正处在 AI 创造惊人未来的历史性时刻。他回顾了 Gemini 2.5 发布一年来的成就,用户利用其强大的多模态和推理能力,完成了从解构科学论文、理解 YouTube 视频到一次性构建游戏和应用(vibecode)等各种任务。他重申,Gemini 2.5 Pro 是 Google 有史以来最智能的模型,也是世界上最好的基础模型。就在大会两周前,Google 发布了更新版 2.5 Pro 的预览,其已在 Web Dev Arena 等热门编程排行榜上位居榜首,并且由于整合了专为教育构建的 LearnLM 系列模型,它也成为学习领域的领先模型。
另一方面,主打高效能的 Gemini 2.5 Flash 也迎来了近乎全方位的升级。新版 Flash 在推理、代码和长上下文等关键基准上均有提升,在 LMArena 排行榜上仅次于 2.5 Pro。哈萨比斯宣布,更新后的 2.5 Flash 将于 6 月初全面上市,2.5 Pro 随后推出。开发者现已可在 AI Studio、Vertex AI 和 Gemini 应用中体验预览版。
随后,产品负责人 Tulsee Doshi 登台,详细介绍了基于开发者反馈所做的四大改进:增强的能力、提升的安全性与透明度、更好的成本效益以及更多的控制权。
首先,在能力层面,除了新的 2.5 Flash,Google 推出了具有首创多说话人支持的原生文本转语音预览。该功能支持两种声音,能捕捉说话的细微差别,甚至无缝切换至耳语,并可在超过 24 种语言间轻松转换。开发者即日起可在 Gemini API 中使用此功能,Live API 也将很快提供支持原生音频对话的 2.5 Flash 预览版,用于构建更自然的对话体验。
其次,安全性得到强化。Gemini 2.5 被宣称为迄今最安全的模型,特别加强了对间接提示注入等威胁的防护。同时,为了提高模型行为的透明度,2.5 Pro 和 Flash 都通过 API 提供了“思维摘要”功能。该功能将模型的原始“思考过程”整理成带有标题、关键细节和工具调用等信息的清晰格式,便于开发者调试和理解模型在耗时任务中的决策逻辑。
第三,效率进一步提升。新的 2.5 Flash 通过减少模型达到相同性能所需的 token 数量,实现了 22% 的效率提升。
第四,开发者获得更多控制权。此前在 2.5 Flash 中广受好评的“思维预算”功能,将被引入 2.5 Pro。开发者可以控制模型在回应前使用多少 token 进行“思考”,从而在成本、延迟和质量之间进行权衡,也可以直接关闭此功能。
为了展示 Gemini 2.5 Pro 强大的编程能力,Tulsee Doshi 进行了一段现场演示。她从一个画在餐巾纸上的粗略 3D 球体草图开始,要求 Gemini 2.5 Pro 根据这张图片更新一个简单的博物馆展览网页应用代码。得益于多模态理解能力,Gemini 不仅看懂了抽象草图,还直接生成了美丽的 3D 动画代码,并应用到现有代码库中。整个过程无需开发者精通 Three.js 库或复杂的 3D 数学。随后,她进一步使用 2.5 Flash 为图片添加互动问题,并利用原生音频功能让展品“开口说话”,生动展示了如何将视觉、语音和编程能力快速整合到应用中。
在开发者工具方面,最大的亮点是异步编码智能体 Jules 进入公开测试版。Jules 可以接手复杂的任务,例如在大型代码库中更新旧版 Node.js,它能自行规划步骤、修改文件,将原本需要数小时的工作缩短至几分钟。Jules 现已集成在 Android Studio、Firebase Studio 和 Gemini Code Assist 等 Google 产品中,并可与 GitHub 协同工作。开发者现在即可前往 Jules.google 注册使用。
前沿研究:扩散模型赋能文本与“深度思考”模式
Google 的研究步伐并未停留在现有模型的优化上。Tulsee Doshi 介绍了一项突破性的研究:将已在图像和视频生成领域取得革命性成功的扩散技术应用于文本。这项研究催生了实验性的 Gemini Diffusion 文本扩散模型。与传统的自左向右生成方式不同,扩散模型通过迭代精炼来生成文本,使其在编辑、数学和代码等任务上表现出色,能够快速迭代方案并在生成过程中纠错。
这种并行生成方式带来了极低的延迟。2025 年 5 月发布的 Gemini Diffusion 版本,其生成速度比目前最快的 2.0 Flash-Lite 模型还要快五倍,同时保持了同等的编码性能。现场演示了一个简单的数学问题求解,模型几乎在瞬间给出了正确答案,其内部的迭代过程被慢放展示,令人印象深刻。该模型目前正在小范围测试,而更快的 2.5 Flash-Lite 也即将到来,预示着 Google 将在所有 Gemini 模型中持续降低延迟。
随后,Demis Hassabis(德米斯·哈萨比斯)重返舞台,带来了另一个重磅更新:为 Gemini 2.5 Pro 引入全新的 “深度思考”模式。受 AlphaGo 等模型的启发,给予模型更多“思考”时间能显著提升其回答质量。Deep Think 模式利用了 Google 在思维和推理方面的最新前沿研究,包括并行技术,将模型性能推向极限。
初步结果显示,其表现令人惊叹:在目前最难的数学基准之一 USAMO 2025 上取得了优异成绩;在竞争级编程的艰难基准 LiveCodeBench 上领先;并且,由于 Gemini 自始就是原生多模态的,它在衡量多模态理解的 MMMU 基准上也表现出色。哈萨比斯表示,正因为 2.5 Pro Deep Think 定义了新的性能前沿,Google 需要额外时间进行前沿安全评估并征求安全专家意见。因此,它将首先通过 Gemini API 向可信赖的测试者开放,收集反馈后再广泛发布。
迈向“世界模型”:通用 AI 助手与科学发现的加速器
演讲的后半部分,Demis Hassabis(德米斯·哈萨比斯)将视角从具体的模型提升到了 Google DeepMind 的终极愿景。他回顾了过去十年 Google 为现代 AI 时代奠定的基础,从发明 Transformer 架构,到 AlphaGo、AlphaZero 等智能体系统。现在,团队正致力于将 Gemini 从最好的多模态基础模型,扩展成为一个“世界模型”。
所谓“世界模型”,即能够像人脑一样,通过模拟世界的各个方面来进行规划、想象新体验的模型。哈萨比斯对此充满热情,这可以追溯到他早期开发《主题公园》等模拟游戏 AI 的经历。Google 在此方向上已迈出步伐:训练智能体掌握围棋和《星际争霸》等复杂游戏;2025 年 5 月发布的 Genie 2 模型,能够仅凭单张图片提示就生成可交互的 3D 模拟环境。这些能力已初露端倪,例如 Gemini 利用其世界知识和推理来表征自然界事物;而最先进的视频模型 Veo,则对重力、光线和材料行为等直观物理有着深刻理解,能在帧间保持惊人的准确性和一致性。
理解物理环境对于机器人技术也至关重要。AI 系统需要世界模型才能在现实世界中有效运作。Google 已微调出一个专业模型——Gemini Robotics,用于教导机器人掌握抓取、遵循指令、即时适应新任务等技能。哈萨比斯宣布,大会现场的参与者可以在“AI 沙盒”中亲自体验这些机器人。
将 Gemini 打造成一个完整的世界模型,是解锁一种新型 AI 的关键一步:一种能在日常生活中提供帮助、智能理解所处情境、并能代表用户在任何设备上规划和采取行动的 AI。这正是 Gemini 应用的终极愿景——将其转变为一个通用的 AI 助手,一个个性化、主动且强大的 AI,也是通往 AGI 道路上的关键里程碑。
这一旅程始于去年探索的 Project Astra 所展示的能力,如视频理解、屏幕共享和记忆。过去一年,这些能力已被整合到 Gemini Live 中,让更多用户体验。如今,Project Astra 的研究原型展示了更强大的未来图景:在一个演示视频中,AI 助手帮助用户维修自行车,它可以上网搜索用户手册、在 YouTube 上找维修视频、查阅电子邮件获取零件规格、甚至直接打电话给自行车店查询库存。整个过程,AI 能够理解屏幕内容、控制电脑应用、处理多线程任务,并拥有连续的对话记忆。
哈萨比斯描述,这样一个通用 AI 助手将为我们处理日常琐事,打理繁琐行政工作,推荐令人愉悦的新事物,从而提升我们的生产力,丰富我们的生活。Google 正在从可信测试者那里收集关于这些新能力的反馈,并致力于将它们引入 Gemini Live、搜索中的新体验、面向开发者的 Live API,以及 Android XR 眼镜等新形态设备中。
AI 赋能科学:从蛋白质结构到全球性疾病
作为一位科学家出身的 CEO,Demis Hassabis(德米斯·哈萨比斯)始终坚信,其职业生涯的核心在于利用 AI 推动知识进步和加速科学发现。他自豪地列举了 Google DeepMind 在过去一年在科学领域取得的一系列突破:
- 数学与发现:AlphaProof 能以银牌水平解决国际数学奥林匹克竞赛问题;Co-Scientist 能与研究人员协作,帮助提出和测试新假设;2025 年 5 月发布的 AlphaEvolve 甚至能发现新的科学知识并加速 AI 训练本身。
- 生命科学:研究系统 AMIE 可辅助临床医生进行医疗诊断;AlphaFold 3 能预测所有生命分子的结构和相互作用;基于 AlphaFold 工作的 Isomorphic Labs,正利用 AI 革命化药物发现过程,有朝一日将帮助解决许多全球性疾病。
哈萨比斯特别提到,AlphaFold 在短短几年内已对科学界产生巨大影响,成为生物学和医学研究的标准工具,全球超过 250 万研究人员在其关键工作中使用它。他坚定地表示,如果能够安全、负责任地发展,AGI 有潜力成为有史以来最有益的技术,极大地加速科学发现。
最后,演讲以一段感性的视频收尾,展示了 Google 如何与辅助视障人士的公司 Aira 合作,利用 Astra 技术构建原型,帮助视障音乐家更独立地探索世界(如识别环境、寻找物品)。这体现了 Google 将其尖端技术用于公益的承诺。哈萨比斯总结道,通过所有这些开创性工作,Google 正在构建更加个性化、主动和强大的 AI,以丰富人们的生活,推动科学进步的步伐,并引领一个充满发现与奇迹的新黄金时代。










