撰文:Techub News 整理
导语
在 OpenAI 官方播客的最新一期节目中,主持人 Andrew Maine 与两位核心研究人员——OpenAI 首席科学家 Ilya Sutskever(伊利亚·苏茨克维)和研究科学家 Simon Sidor 展开了一场深度对话。此次对话发生在 OpenAI 模型2025 年 8 月接连在多项高难度竞赛中取得突破性成绩的背景下,包括在国际数学奥林匹克竞赛(IMO)中达到金牌水平,以及在编程竞赛中与顶尖人类选手同台竞技。这些成就不仅标志着 AI 在复杂推理领域迈上了新台阶,也引发了关于如何衡量 AI 进展、AGI 定义以及未来突破方向的更深层讨论。作为 OpenAI 研究路线图的主要制定者,Ilya Sutskever(伊利亚·苏茨克维)的见解对于理解当前 AI 发展的核心动力与未来轨迹至关重要。
摘要
- AI 进展的衡量标准正在从传统的“基准测试分数”转向更实际的“世界影响力”和“真实用例价值”。
- 2025 年 8 月在 IMO 等竞赛中的突破,证明了 AI 在无需外部工具辅助下进行深度、创造性推理的能力已显著增强。
- 自动化科学发现与 AI 研究本身,被认为是 AGI 可能带来的最根本性影响,也是 OpenAI 长期追求的核心目标之一。
- 技术的进步速度远超外部感知,内部研究者常因突破的迅猛而感到“震惊”并严肃审视组织是否准备好迎接加速。
- 尽管能力飞速提升,但在模型鲁棒性、安全性与广泛信任方面,整个领域仍面临严峻挑战需要迭代解决。
从基准测试到世界影响:重新定义 AI 进展衡量
访谈伊始,话题便聚焦于一个根本性问题:如何衡量 AI 的进步?Ilya Sutskever(伊利亚·苏茨克维)指出,随着模型能力快速提升,传统的、点状的基准测试(benchmarks)正变得越来越“不够用”。一方面,许多测试已经达到或接近人类顶级水平,出现了“饱和”现象;另一方面,通过针对性训练,模型可以在特定任务(如数学)上表现超群,但这未必代表其整体智能水平。这导致单纯依赖基准分数来评估进展变得不再可靠。
Simon Sidor 补充了从内部视角看到的惊人发展轨迹。他回顾了大约十年前,深度学习在自然语言处理上还非常初级,连“这部电影不错”和“这部电影不是不好”这种句子的情感都难以正确区分。从 GPT-1、GPT-2 能生成连贯段落,到 GPT-3、GPT-4 带来惊喜,再到如今模型能在编程竞赛中与顶尖高手过招,进步的速度“绝对令人惊叹”。因此,当看到外界有报告称 AI 对经济的当前影响只有个位数百分比时,他提醒需要历史地看待:十年前这个影响可能微乎其微,而未来几年完全有可能快速增长到 10%、20% 甚至更高。
那么,什么才是更好的衡量标准?两位研究者提出了几个方向。一是真实世界的使用情况,例如 ChatGPT 被广泛用于各种场景,这避免了研究者陷入只关注自己熟悉领域(如数学、编程)的“气泡”。二是模型解决重要问题的实际效用,特别是其“发现新见解”的能力。Ilya Sutskever(伊利亚·苏茨克维)强调,未来一个关键指标将是:我们是否能够投入远超单个用户愿意支付的算力,让 AI 长时间、专注地工作,以产生对许多人都有用的技术成果(如医学发现、下一代模型研发)。这指向了 AI 作为“自动化研究者”的潜力。
竞赛突破与“推理”的涌现:AGI 路径上的里程碑
2025 年 8 月,OpenAI 模型在多项高难度竞赛中的表现成为热议焦点。IMO 金牌水平、国际信息学奥林匹克竞赛(IOI)级别的成绩,以及在日本举行的 AtCoder 马拉松式编程竞赛中获得第二名,这些成果具有标志性意义。
Ilya Sutskever(伊利亚·苏茨克维)解释了他们为何看重 IMO 这类竞赛。IMO 问题不依赖于庞大的知识库,而是在有限时间内测试对问题的深度思考和创造性解决能力,这正好挑战了早期 AI 模型“知识渊博但思考不深”的短板。因此,将其视为通往 AGI 道路上的一个里程碑是合理的。特别有趣的是,在2025 年 8 月的 IMO 中,模型能够正确识别出自己无法解决最难的“第六题”,并选择不尝试,这种对自身能力边界的认知(而非盲目“幻觉”)本身就是一个重要的进步。
Simon Sidor 分享了一个更具个人色彩的故事。在 AtCoder 竞赛中,与模型同场竞技的顶尖选手中,有一位正是他在 OpenAI 的同事 Sihao。这位同事曾开玩笑说,Sidor 擅长的短时封闭式竞赛会比他擅长的长时马拉松式竞赛更早被 AI 自动化。结果在这次直播比赛中,OpenAI 模型获得了第二名,而冠军正是 Sihao 本人。赛后精疲力尽的 Sihao 在接受采访时“吐槽”模型的顽强表现,这个小插曲生动地展现了人机竞赛的现状。
这些突破背后,一个关键技术是让模型进行更长的“思维链”或“内心独白”式推理。Sidor 强调,这听起来简单,但实现起来极其困难,团队付出了巨大努力。当第一次发现通过提供更多计算和数据进行训练,模型推理能力确实能显著提升时,整个团队都感到“震惊”,甚至开始严肃地自问:“我们作为一个组织,是否已经为这种极其快速的发展进程做好了准备?” 这种内部因技术加速而产生的紧迫感和敬畏感,是外界难以完全体会的。
自动化研究与 AGI 的未来图景
当被问及 AGI 的实用化前景时,Ilya Sutskever(伊利亚·苏茨克维)描绘了一幅以自动化研究为核心的未来图景。他认为,AI 对世界产生真正深远影响的方式,在于自动化新技术的发现和生产过程。这挑战了人们将重大科技进步仅仅归因于人类灵感的传统观念。他相信,让计算机提出能从根本上改变我们对世界认知的新想法,“距离并不遥远”。
具体而言,他设想未来会出现一个主要由 AI 驱动的、高度自动化的“研究员和工程师公司”。这个实体将以各种方式与世界交互:与人交谈、获取输入、运行实验,并最终产出新的技术、代码库和设计,从而“极大地加速技术进步的步伐”。OpenAI 的研究项目正是以创造这种“通用智能”为目标,优先推动“自动化研究者”的实现,而非仅仅专注于在特定领域取得点状进展。
在更贴近普通用户的层面,AGI 的体验也将进化。模型将变得更加持久、更具个性,能够以更多样化的形式(不限于文本)表达自己,从而使人机互动的关系更加深入。随着模型获准访问更多个人数据(如日历、邮件)以提供更贴切的服务,如何在提升实用价值与确保安全性、防止滥用之间取得平衡,将成为整个领域必须迭代解决的重大挑战。Ilya Sutskever(伊利亚·苏茨克维)坦言,目前模型在抵御恶意利用方面的鲁棒性尚未达到可以完全信赖的程度。
下一站:规模化、长时规划与给年轻一代的建议
展望下一个技术突破点,Ilya Sutskever(伊利亚·苏茨克维)认为,规模化(Scaling)的力量依然不可低估。现有的推理模型能力将与之前的预训练规模化范式产生复合效应。一个明确的方向是进一步扩展模型能够规划和推理的“时间跨度”或“问题复杂度”。当前模型为单个答案消耗的算力相比 GPT-4 时代已有数量级增长,但相比解决一个重要的医学研究或下一代模型研发问题所需的理论算力,仍微不足道。因此,提升模型长时间专注解决单一复杂问题的能力,是清晰的技术前沿。
在访谈的最后,主持人问及他们对今天的高中生有何建议。对此,Ilya Sutskever(伊利亚·苏茨克维)坚决反驳了“不要学编程”的论调。他强调,编程所培养的“将复杂问题分解成模块的结构化思维能力”,在未来依然是极其珍贵且需求旺盛的技能。这种能力不一定永远通过编程来体现,但编程是获得它的绝佳途径。理解系统如何工作,始终是驾驭强大工具的优势所在。
Simon Sidor 则从个人经历出发,鼓励年轻人突破“感知上的约束”。他分享了自己从波兰到美国求学、最终融入硅谷文化的经历,那里的人们以雄心壮志直面重大问题,并坚信自己能对世界产生有意义的积极改变,这种精神令他深受鼓舞。他提到,保罗·格雷厄姆的《黑客与画家》一书以及电影《钢铁侠》都曾以不同方式激发了他对技术未来的向往和探索。
整场对话揭示了一个核心主题:AI 的发展,尤其是通向 AGI 的道路,并非线性平滑,而是由一系列有时令人震惊的突破所推动。OpenAI 的研究者们既为已取得的成就感到兴奋,也对随之而来的技术、伦理和组织挑战保持着清醒的认识。他们正将目光投向超越测试分数、真正改变世界生产力和知识边界的新前沿。










