撰文:Techub News 整理
导语
在由芯片设计巨头 ARM 制作的最新一期播客节目《Tech Unheard》中,ARM 首席执行官 Rene Haas(雷内·哈斯)与 OpenAI 首席研究官 Mark Chen(马克·陈)进行了一场深度对话。作为 OpenAI 研究团队的掌舵人,Mark Chen 领导了包括 DALL·E、Codex 以及 GPT-4 视觉能力在内的多项突破性项目。此次对话正值 OpenAI 接连发布 o1 推理模型、GPT-4o 多模态模型等重磅更新之际,Mark Chen 的分享为我们理解这家全球领先 AI 公司的技术哲学、当前挑战与未来图景,提供了来自核心决策者的一手视角。
摘要
- 从金融到 AI:Mark Chen 认为,量化交易的严谨实验方法论,为他在 OpenAI 的早期科学研究奠定了坚实基础。
- Transformer 的统治力:Transformer 架构因其简洁性与表达能力的完美平衡,短期内难以被取代,行业正围绕其进行全栈协同设计。
- 多模态是数据与智能的钥匙:将图像、音频、视频视为另一种“语言”统一训练,是解锁海量非文本数据中智能的关键,并催生了如 DALL·E、GPT-4o 等成果。
- 推理是通往专业领域的桥梁:o1 等推理模型通过提升数据利用效率,让 AI 能在数据相对稀缺的领域(如药物发现、芯片设计)发挥巨大潜力。
- 智能体(Agent)与具身智能是未来:以 OpenAI 的“Operator”为代表的计算机使用智能体,是迈向通用“数字助手”的第一步,最终将延伸至机器人领域,实现 AI 在物理世界的“具身化”。
从量化交易到 AI 前沿:一段非典型的职业旅程
Mark Chen(马克·陈)的职业生涯始于一个与 AI 看似无关的领域——金融量化交易。在麻省理工学院(MIT)攻读数学与计算机科学后,他因一次偶然的实习机会进入了华尔街,先后在对冲基金和高频交易公司工作了五到六年。这段经历塑造了他对“模型”的独特认知。
他坦言,金融世界提供了一个无可辩驳的硬性评估标准:模型能否赚钱。这种环境迫使从业者必须保持极度的严谨、诚实和实验上的原则性。“我认为这其中很多方法论都延续到了我们在 OpenAI 早期的科学研究中。”Mark Chen 表示。这种从高度务实、结果导向的金融战场中磨练出的方法论,成为他后来投身于更抽象、更前沿的 AI 基础研究时,一份宝贵的财富。
然而,驱动他做出职业转变的,是对“影响力”的追求和对技术变革的敏锐感知。他感到金融行业的竞争格局相对固化,参与者与目标长期不变,缺乏改变外部世界的满足感。与此同时,DeepMind 的 AlphaGo 在围棋上战胜人类冠军,给他带来了巨大的震撼与启发,混合着兴奋与不安。这促使他开始自学强化学习,训练 AI 玩雅达利游戏,并最终被这个快速演进、充满无限可能的领域深深吸引。
2018 年,Mark Chen 以“研究员”(Resident,一种面向非 PhD 背景人才的培养项目)身份加入 OpenAI。当时的 OpenAI 还是一个规模小得多的非营利组织,其“确保通用人工智能(AGI)造福全人类”的使命,与 Mark Chen 希望从“物质主义”的金融世界转向具有深远影响事业的内心诉求不谋而合。他特别提到,OpenAI 的联合创始人兼首席科学家 Ilya Sutskever(伊利亚·苏茨克弗)当年愿意在他身上“下注”,并亲自指导他机器学习,是他职业生涯的关键转折点。
Transformer、多模态与涌现:AI 能力跃迁的驱动力
回顾过去七年的 AI 发展,Mark Chen 用“ simultaneously true”(同时成立)来形容两种感受:既对已取得的进展感到惊讶,又深知前方仍有漫漫长路。他指出,研究者们可以基于“困惑度”(perplexity)等指标预测模型在 scaling(规模扩展)后的性能提升,但无法提前预知哪些具体的“涌现能力”(emergent capabilities)会随之出现。
“当我们在 GPT-2 达到某个困惑度水平时,并不明显这意味着模型能写出连贯的段落。到了 GPT-3,也不清楚那个水平的困惑度会带来上下文学习(in-context learning)的能力。而 GPT-4 则能够轻松通过各种大学水平的考试。”这种从量变到质变、不断解锁新能力的进程,是 AI 研究最令人振奋之处。
当被问及进步主要源于算法突破还是算力堆砌时,Mark Chen 引用了相关研究,认为算法洞察和效率改进的贡献略高于纯粹的计算规模增长。他以 Transformer 架构本身为例,指出其并非一成不变,而是在注意力机制(如因子化注意力)、归一化方式、模型宽深比等方面经历了持续的优化与演进。这些细微但关键的“算法体操”,共同推动了效率的提升。
对于 Transformer 是否会被取代的问题,Mark Chen 认为其简洁性与强大表达能力的平衡近乎完美,使其在可预见的未来仍将占据主导。更重要的是,整个技术栈——从芯片设计到软件库——都已围绕 Transformer 进行深度协同优化,这为任何潜在的替代架构设立了极高的进入壁垒。
作为多模态研究的先驱之一,Mark Chen 对统一架构的价值深信不疑。他早期领导的“Image GPT”项目证明了可以用训练文本 Transformer 的相同架构来生成图像,只需将像素视为一种特殊的词汇表。这项工作为后来的 DALL·E 铺平了道路,其核心思想在于:要实现用文本精确控制图像生成,最自然的方式就是让文本和图像在同一个模型中共生共长。
这一理念在 GPT-4o 上达到了新的高度。该模型将文本、图像、音频、视频数据“一视同仁”地投入同一个模型进行训练,从而实现了高度统一的多模态理解和生成能力。Mark Chen 强调,多模态不仅仅是功能的叠加,更是解锁海量非文本数据中蕴藏智能的关键,它能将训练数据集扩大数个数量级。
推理、创造与产业赋能:AI 的下一站
当讨论转向 AI 在药物研发、芯片设计等专业领域的应用时,Mark Chen 指出了核心挑战:这些垂直领域没有互联网规模的庞大数据。这正是 OpenAI 大力投入“推理”(reasoning)研究的原因。以 o1 为代表的推理模型,其价值在于能够更高效地利用有限的数据进行学习,从而在数据稀缺的领域达到高专业水平。
“我们已经看到模型在数学和计算机科学领域表现得非常出色。很多这类技术可以适配到像药物发现这样的领域。”他认为,AI 将成为专业人士的强大杠杆,可能将他们的生产力提升两到三倍,从而服务更多需求,尽管这可能降低单项服务的成本,但潜在的市场需求在更低的成本下可能会被激发。
关于 AI 的“创造性”,Mark Chen 持乐观态度。他分享了一个观察:在参与一些世界上最难的算法竞赛时,这些模型常常能在“反模式”问题上给出超乎预期的、富有创造性的解决方案。他提出一个有趣的观点:或许人类许多所谓的“发明”,其“插值”(interpolation)的成分比我们想象的要高——即巧妙连接不同领域的已知模式。AI 已经具备了对人类审美和兴趣的潜在感知,关键在于如何引导它利用这种感知提出有趣的假设。
对于通用人工智能(AGI)的定义,Mark Chen 赞同一种观点:真正的 AGI 应具备像人类一样,在没有接触全部数据的情况下,通过推理和学习探索未知路径的能力。而当前 AI 向更数据高效算法的演进,正是朝着这个方向前进。
智能体、具身智能与未来人机交互
展望未来,Mark Chen 认为当前行业发展的瓶颈并非 GPU 等硬件算力,而是研究人员和创意的数量。这是一个研究思路爆发的黄金时期。他期望未来 AI 模型能反过来帮助自动化研究过程,加速这一循环。
他着重强调了两个关键方向:智能体(Agent)和具身智能(Embodiment)。OpenAI 2025 年 6 月推出的“Operator”就是一个计算机使用智能体,它能理解屏幕内容,并通过模拟键盘鼠标操作来完成任务。Mark Chen 将其视为通往未来人机交互的接口。“你可以把它想象成你的数字工作或数字生活的一个接口。”
这一概念的终极延伸是机器人技术。“本质上,你是在为机器人构建一个 AI 大脑,使其能够在现实世界中行动。” 这就是“具身智能”的内涵。他预见,硬件的发展速度可能会成为这一领域的瓶颈。
Mark Chen 描绘了一个由智能体主导的未来世界:应用程序和操作系统可能退居幕后,用户只需与一个统一的智能体交互,它便能理解上下文,无缝调用所有数字服务和物理设备。“我绝对希望生活在一个只需向智能体查询所有所需信息的世界,所有复杂性都被隐藏在这一层之下。” 他借用电影《回到未来2》中的场景来类比——设备能根据人的移动和情境自动提供相应服务,而这一切都由背后一个统一的云端 AI 模型驱动。
在访谈的最后,Mark Chen 表达了对身处这个时代和 OpenAI 的感激与兴奋。每一天,他都在见证并参与塑造一场堪比从 PC 到互联网再到移动手机的技术范式转移。对于所有关注 AI 未来的人而言,这场对话清晰地指出:前沿已从单纯的语言模型,拓展至更深刻的推理、与物理世界融合的具身智能,以及彻底重塑我们与数字世界交互方式的智能体革命。










