撰文:Techub News 整理
导语
在最新一期的 OpenAI 官方播客中,OpenAI 联合创始人兼首席科学家 Ilya Sutskever(伊利亚·苏茨克弗)与研究员 Simon Sidorenko(西蒙·西多伦科)一同亮相,与主持人 Andrew Maine(安德鲁·梅恩)展开了一场深入对话。他们追溯了共同的高中时代,探讨了当前衡量 AI 进步的挑战,分享了2025 年 8 月模型在数学奥林匹克竞赛中取得突破性成绩的内部视角,并对通往 AGI 的道路以及未来可能出现的突破进行了展望。作为 OpenAI 研究路线图的核心制定者,Ilya Sutskever(伊利亚·苏茨克弗)的思考反映了这家处于 AI 浪潮中心的公司,对技术发展现状与未来方向的深刻反思。
摘要
- 传统 AI 能力基准(如标准测试)正面临“饱和”,模型在许多领域已达到或超越人类水平,点状测量已不足够。
- 衡量 AI 进步的重点应转向其在实际世界中的影响力和效用,特别是其自动化发现和创造新技术的潜力。
- 2025 年 8 月在数学、编程竞赛中的突破性表现,证明了 AI 在深度、创造性推理方面取得了实质性进展,而不仅仅是记忆和模式匹配。
- 下一个重大突破可能在于进一步扩展模型的“持久性”和长时程推理能力,使其能像人类研究者一样,在重要问题上投入巨量计算资源进行专注探索。
从编程竞赛到 AGI 反思:两位研究者的成长轨迹
对话始于一段有趣的个人历史。Ilya Sutskever(伊利亚·苏茨克弗)和 Simon Sidorenko(西蒙·西多伦科)不仅是在 OpenAI 的同事,更是高中校友。他们都来自波兰一所专注于计算机科学竞赛的中学,受一位富有启发性的计算机老师影响,早期便深入接触了远超高中课程的编程、图论等知识。Simon Sidorenko(西蒙·西多伦科)认为,如今有了 ChatGPT 这样的工具,或许能让更多人更容易地进行类似的知识深潜,但他也强调,当年老师所提供的情绪支持和成长空间,是目前 AI 难以单独复制的。这引出了一个观点:AI 不会取代教育,而是成为教师的强大辅助工具。
这段成长经历也铺垫了他们看待 AI 里程碑的视角。无论是国际数学奥林匹克(IMO)还是国际信息学奥林匹克(IOI),这些竞赛对他们而言不仅仅是“基准”,更是个人成长中代表智力挑战顶峰的具体符号。这种情感连接使得他们在评估 AI 进展时,既能从内部技术视角出发,也能理解外部世界可能存在的认知差异。
AGI 定义的演变:从抽象概念到具体影响
当被问及如何定义 AGI(通用人工智能)时,Ilya Sutskever(伊利亚·苏茨克弗)坦言,这个概念在过去几年经历了实质性的演变。几年前,深度学习虽前景广阔,但 AGI 仍显得抽象而遥远。无论是“人类水平智能”、“自然对话”还是“解决数学问题”,这些目标似乎都处于同一个模糊的范畴。
如今,随着技术进步,这些能力被证明是相当 distinct(不同)的。AI 已经在广泛主题上进行自然对话,也能解决数学难题——例如在 IMO 中获得金牌,这曾被长期视为通往 AGI 道路上的一个里程碑。然而,Ilya Sutskever(伊利亚·苏茨克弗)指出,这种点状的里程碑测量正变得越来越不充分。他的关注点已转向 AI 对世界的实际影响,特别是其自动化新技术发现和生产的潜力。
“我们倾向于将根本性的技术进步与人类的聪明才智联系在一起,”他说,“但很难内化这一点:这个过程的大部分是可以被自动化的。”他设想,一个强大的计算机系统能够产生从根本上改变我们对世界认知的新想法,并且他认为这一天并不遥远。对他而言,AGI 的一个重要标志,是能够像一个自动化的、超级高效的研究员或工程师团队那样运作,持续产出代码、设计乃至科学发现,从而急剧加速技术进步的速度。
基准的困境:饱和、局限与寻找新指标
对话深入探讨了当前评估 AI 模型能力所面临的挑战。Ilya Sutskever(伊利亚·苏茨克弗)和 Simon Sidorenko(西蒙·西多伦科)都指出了基准“饱和”问题。随着模型在许多标准化测试(尤其是那些顶尖的高中学科竞赛)中达到或超越人类顶尖水平,很难再有更具挑战性且约束良好的测量方式。
此外,过去通过扩大预训练规模(GPT-1 到 GPT-4)就能普遍提升各项能力的“水涨船高”模式正在改变。如今,研究人员能更高效地为特定能力(如数学)训练模型,但这可能导致模型在特定基准上表现优异,却无法代表其整体智能水平。一个模型可能在数学竞赛中夺冠,却在创意写作上表现平平。
Simon Sidorenko(西蒙·西多伦科)分享了一个趣事:当他兴奋地向一位精通多国语言的同事 Anna 提及 IMO 的进展时,对方却反问“IMO 是什么?”。这让他意识到,研究社区有时生活在“气泡”中,自己认为重要的里程碑,对其他人而言可能无关紧要。这促使他们寻找更普适的衡量标准。
一个不完美但实用的指标是ChatGPT 本身及其广泛多样的用例。数以亿计的用户将其应用于无数场景,这提供了一个覆盖范围极广的“压力测试”。然而,他们也预见到,未来衡量进展的关键,可能在于模型能否利用远超个人用户所能负担的巨量计算资源,去解决对许多人都有价值的重大问题,例如医学研究或下一代 AI 模型开发本身。
突破性瞬间:当模型开始“惊讶”我们
回顾 AI 发展的快节奏,Simon Sidorenko(西蒙·西多伦科)描述了他的“个人 AGI 时刻”。在 GPT-4 时期,他首次感到模型有时能说出让他惊讶的话。从早期的简单字符预测、漏洞百出的情感分析(如把“这部电影不错”误判为负面),到 GPT-2 产出连贯段落带来的震撼,再到 GPT-4 的惊喜,最后到如今模型能在编程竞赛中与顶尖选手竞争,这十年的进步幅度在他看来“绝对惊人”。
Ilya Sutskever(伊利亚·苏茨克弗)则提到了2025 年 8 月在推理模型(如 o1)上取得的突破。团队通过让模型进行更长的“思维链”或内心独白,显著提升了其复杂问题解决能力。他回忆道,当第一次观察到这种方法确实有效,并且增加训练数据能持续提升性能时,整个团队都感到“震惊”。他甚至提到,某个深夜,他们与 Sam Altman(萨姆·奥尔特曼)和 Mira Murati(米拉·穆拉蒂)通话,严肃地讨论组织是否已准备好迎接如此快速的发展,“有时我们确实会被这些结果吓到。”
他还分享了一个充满戏剧性的竞赛故事:在日本的 AtCoder 竞赛(一项长达 10 小时的单题启发式优化比赛)中,他们的模型与 Simon Sidorenko(西蒙·西多伦科)的一位曾是该赛事顶级选手的朋友 Siho 同台竞技。最终模型获得第二名,而 Siho 夺冠。Siho 在赛后精疲力尽地接受采访时忍不住吐槽 OpenAI 的模型“非常非常糟糕”,因为他想睡觉了。这个小插曲生动地展现了人类与 AI 在耐力与智能上的角力。
未来之路:持久性、规模化与信任
展望未来的突破,Ilya Sutskever(伊利亚·苏茨克弗)强调不应低估规模化的持续重要性。预训练的扩展范式并未消失,并将与新的研究方向产生复合效应。一个清晰的方向是扩展模型进行规划和推理的“时间视野”或“持久性”。
他指出,从 GPT-4 到 GPT-4o 或更先进的模型,每个答案消耗的计算资源可能只增加了十倍或二十倍,却能产生好得多的答案。然而,对于真正重要的问题(如医学研究),人们愿意投入的计算资源将是无可比拟地巨大。因此,让模型能够长时间、专注地处理单一复杂问题的能力,是下一个关键台阶。
对于普通 ChatGPT 用户而言,未来几年可能体验到的 AGI 级能力会是什么样?Ilya Sutskever(伊利亚·苏茨克弗)再次回到了自动化研究者的图景。这不仅仅是一个黑箱,而是能够与人类交互、吸收信息、运行实验、并产出代码和设计的智能实体。同时,用户与 AI 的交互界面将变得更加人性化、持久化,人们可能与 AI 形成更深的联结,这将成为社会重要议题。
最后,他们给当今高中生的建议务实而真诚:学习编程。Simon Sidorenko(西蒙·西多伦科)驳斥了“不要学编程”的说法,他认为编程是锻炼将复杂问题分解为模块的结构化思维能力的绝佳方式,这种能力在未来仍将至关重要。Ilya Sutskever(伊利亚·苏茨克弗)则鼓励年轻人突破自我设限,敢于拥有雄心壮志,相信能够对世界产生有意义的积极影响——这正是他在硅谷社区中感受到的鼓舞人心的精神。










