OpenAI 首席研究官 Mark Chen(马克·陈)谈 GPT-4.5 发布、扩展法则与模型情商撰文:Techub News 整理
导语
在 GPT-4.5 正式发布当天,OpenAI 首席研究官 Mark Chen(马克·陈)罕见地接受了 Big Technology Podcast 的专访。这是 OpenAI 高层四年来首次接受此类深度访谈,时机恰逢其最新旗舰模型问世。Mark Chen(马克·陈)于数月前刚升任此职,此次发声不仅是为了介绍 GPT-4.5,更是为了阐释 OpenAI 在模型扩展、研发范式以及未来方向上的关键思考。面对外界对 GPT-5 的急切期待和关于“扩展墙”的广泛讨论,他的分享提供了来自 OpenAI 核心研发团队的一手视角。
摘要
GPT-4.5 是 OpenAI “可预测扩展范式”下的最新里程碑,性能相较前代实现了“数量级”提升,其意义堪比从 GPT-3.5 到 GPT-4 的跨越。
OpenAI 目前正沿“无监督学习”和“推理”两条轴线并行推进模型能力前沿,GPT-5 将是这两条路线成果的集大成者。
模型扩展的回报并未减弱,GPT-4.5 证明了在增加计算、数据和优化算法后,性能仍能按预期提升。同时,模型架构优化(如混合专家)与核心能力开发是相对独立的两个层面。
GPT-4.5 在传统基准测试之外,展现出更高的“情商”(EQ)和创造性写作能力,这代表了模型能力探索的新维度。
OpenAI 的战略是“推进智能前沿”与“降低能力获取成本”并行,既打造旗舰模型,也提供成本更优的小型模型,形成完整的产品组合。
GPT-4.5:可预测扩展的最新证明
Mark Chen(马克·陈)开宗明义,将 GPT-4.5 定位为 OpenAI “可预测扩展范式”下的最新成果。这一范式始于 GPT-3,历经 GPT-3.5、GPT-4,如今延续至 GPT-4.5。他解释道,基于过往模型训练积累的经验,团队能够较为准确地预测,当投入的计算资源、数据规模以及算法效率提升一个数量级时,模型性能将获得怎样的进步。GPT-4.5 正是这一预测曲线的下一个点,其性能提升的幅度与从 GPT-3.5 到 GPT-4 的跨越属于同一量级。
针对为何此次发布的是 GPT-4.5 而非万众期待的 GPT-5,Mark Chen(马克·陈)表示,命名始终力求反映模型能力的实际跃迁程度。当前模型的能力提升符合“4.5”的定位。他承认 GPT-4 到 GPT-4.5 的间隔时间似乎更长,但这部分归因于 OpenAI 同期将大量精力投入了另一条关键赛道:“推理”范式的开发。他强调,公司的研发是探索性的,会同时推进所有有潜力的方向。
两条扩展轴线:无监督学习与推理并进
Mark Chen(马克·陈)详细阐述了 OpenAI 当前并行的两大扩展轴线。第一条是传统的“无监督学习”扩展,即通过增加计算、数据和改进算法来提升模型能力,GPT-4.5 是这条路线的最新成果。第二条则是“推理”扩展,即让模型具备更深度的思考、规划和自我修正能力,OpenAI 的 o1 系列模型便是此方向的代表。
他澄清,这两种范式并非对立,而是互补的。“无监督学习”为模型提供了广泛的世界知识基础,而“推理”能力需要建立在这些知识之上。一个知识匮乏的模型无法凭空学会深度推理。同时,两种范式之间也存在反馈循环,推理能力的进步可能反过来要求或促进基础知识的进一步扩展。
在应用场景上,两种模型也呈现出不同的特点。像 GPT-4.5 这样的大型模型响应迅速,适合需要即时反馈的知识性工作和创造性写作;而像 o1 这样的推理模型则可能需要更长的“思考”时间,适合解决复杂、多步骤的问题。Mark Chen(马克·陈)特别指出,在创意写作等场景中,GPT-4.5 的表现已经超越了当前的推理模型。
破解“扩展墙”质疑:回报未减,优化持续
面对业界关于大模型扩展可能遭遇“收益递减”或触及“扩展墙”的疑虑,Mark Chen(马克·陈)给出了明确的否定回答。他表示,在开发 GPT-4.5 的过程中,增加计算和数据资源带来的性能回报与以往模型的经验一致,并未出现衰减。OpenAI 的扩展机制依然有效且可预测。
针对此前有报道称 GPT-4.5 的训练曾多次中断重启,遭遇了棘手难题,Mark Chen(马克·陈)回应称,这种“训练-诊断-干预-重启”的模式是所有大型基础模型研发过程中的常态,并非 GPT-4.5 所独有。他强调,将这些庞然大物视为一场大型实验,在过程中进行监控和调整,是确保最终成功的关键。
当话题转向 DeepSeek 等同行通过模型架构优化(如混合专家模型 MoE)显著提升效率时,Mark Chen(马克·陈)区分了“模型核心能力开发”与“推理服务优化”两个层面。他认为,让模型更高效、更低成本地运行(推理优化),是独立于提升其核心智能的工作。OpenAI 在这两方面都持续投入,并且已经成功地将 GPT-4 系列模型的推理成本降低了数个数量级。他确认,混合专家等架构优化技术是通用技术,既适用于 GPT 类基础模型,也适用于推理模型,OpenAI 也已进行过诸多探索。
大模型与小模型:前沿推进与普惠交付的平衡
对于社区中“小众化、专业化小模型才是未来”的观点,Mark Chen(马克·陈)阐述了 OpenAI 的平衡哲学。一方面,公司的根本使命是“推进智能前沿”,这意味着必须持续开发像 GPT-4.5 这样的旗舰模型。他坚信,将模型能力从“99.9 分位”推到“世界顶尖”水平具有根本性意义,因为这可能解锁全新的、变革性的应用,例如真正强大的 AI 智能体(Agents)。
另一方面,OpenAI 也致力于让先进能力变得普惠。这体现为同时提供像 GPT-4o-mini 这样成本效益高的“小型”模型,让更多用户能以可承受的价格获得接近前沿的能力。因此,OpenAI 的战略是打造一个从旗舰模型到轻量模型的完整组合,而非非此即彼的选择。Mark Chen(马克·陈)认为,小众模型不会消失,但 OpenAI 会同时构建最强的基础模型,并设法随着时间的推移,将这些顶级能力以更低的成本交付给所有人。
超越传统基准:情商与能力探索的新维度
除了在数学、代码、知识问答等传统基准上符合预期的提升,Mark Chen(马克·陈)特别强调了 GPT-4.5 在“情商”(EQ)和创造性方面的显著进步。他举例说明,当用户向模型倾诉困境时,GPT-4.5 能给出更简洁、共情、人性化的回应,而不是机械地罗列一长串建议。在创意写作和生成 ASCII 艺术等任务上,新模型也表现出了更细腻、更少出错的能力。
他预见到可能有人批评这是“转移评测焦点”,但坚决否认了这一说法。Mark Chen(马克·陈)重申,GPT-4.5 在传统硬性指标上完全达到了扩展定律的预期。他强调,每次发布新模型,都是一个与社区共同“发现用例”的过程。GPT-4 已经非常智能,而 GPT-4.5 则在情感理解和创造性表达等更微妙的领域展现了新的可能性。OpenAI 分享这些早期发现,正是为了邀请用户一同探索模型的新能力边界。
团队、产品与未来:智能体是模型能力的自然延伸
在访谈尾声,Mark Chen(马克·陈)简要谈及了 OpenAI 的团队状况。他承认 AI 领域变化飞速,人才流动是行业健康发展的自然现象,这也给内部优秀人才提供了崭露头角的机会。他坚信 OpenAI 依然拥有世界顶尖的人才储备,其标准与行业其他公司有显著区别。
关于“更好模型”与“更好产品”孰轻孰重的经典辩论,Mark Chen(马克·陈)的立场鲜明:更强大的模型是更高级别产品的根本前提。他以 Deep Research(深度研究)功能为例,指出这种能够深入调研、综合信息并生成完整报告的能力,只有在模型具备足够水平的推理和知识基础时才能实现。模型能力的进步,会自然催生新的产品形态和应用范式,而智能体(Agents)正是当前模型能力与产品结合的前沿体现。未来,随着模型在推理和无监督学习两条轴线上继续推进,AI 智能体的能力和可靠性将迎来质的飞跃。
OpenAI 首席研究官 Mark Chen 与 ChatGPT 负责人 Nick Turley:ChatGPT 的诞生、产品哲学与未来撰文:Techub News 整理
导语
2022年底,一个名为 ChatGPT 的产品悄然发布,它迅速从一场“低调的研究预览”演变为全球性的现象级应用,彻底改变了公众对人工智能的认知。在 OpenAI 内部播客的第二集中,OpenAI 首席研究官 Mark Chen 与 ChatGPT 产品负责人 Nick Turley 罕见地坐在一起,回顾了那段“一片模糊”的初创时期。他们分享了产品命名背后“Chat with GPT-3.5”的备选方案、上线前夜的犹豫、以及应对爆炸性增长时的“失败鲸”与服务器扩容。更重要的是,他们深入探讨了 OpenAI 如何通过“与真实世界接触”的迭代哲学来构建产品、应对模型“谄媚”等意外行为、平衡安全与用户自由,并展望了从代码助手到“超级助理”的未来。这场对话不仅是一次历史回顾,更是理解 OpenAI 产品思维、应对 AI 规模化挑战以及其未来愿景的宝贵窗口。
摘要
命名与上线前夜:ChatGPT 最初差点被命名为“Chat with GPT-3.5”,在发布前一天才简化为现在的名字。内部对其能否成功也充满疑虑,甚至有高管在测试后认为只有一半的回答合格。
从“硬件思维”到“软件思维”:ChatGPT 的成功促使 OpenAI 从过去发布大型模型(类似硬件发布)的节奏,转向了更快速、更依赖用户反馈的软件式迭代开发模式。
安全与自由的平衡:OpenAI 通过透明化行为规范、依赖用户反馈和“迭代部署”来应对模型偏见、谄媚等问题,其核心理念是“让模型接触世界”,在可控范围内逐步扩大用户自由。
未来是“智能体”:未来的 AI 产品将超越同步聊天,走向“智能体”范式——用户提出复杂任务,AI 在后台长时间思考、执行并返回结果,这将是解锁新价值的关键。
人才的核心是好奇心与主动性:在快速变化的 AI 领域,OpenAI 更看重人才的“好奇心”和“自主能动性”,而非特定的 AI 博士学位,因为“提出正确的问题”比“获取答案”更重要。
“Chat with GPT-3.5”:一个差点成真的名字
如今家喻户晓的“ChatGPT”,其诞生过程充满了偶然与仓促。Nick Turley 透露,这个产品的名字几乎完全是最后一刻的决定。“它本来要叫‘Chat with GPT-3.5’,”他回忆道,“我们在发布前一天晚上(或者可能是前一天)才决定简化它。”这个决定源于团队意识到原名“更难发音”,于是他们想出了一个“很棒的名字”取而代之。这个看似随意的命名,最终却像“Google”或“Xerox”一样,成为了一个时代符号。
然而,在名字确定之前,产品能否发布本身就是一个巨大的问号。Mark Chen 提到了 OpenAI 内部一个著名的故事:在发布前夜,联合创始人 Ilya Sutskever 对模型进行了十次“严苛的提问”,而 Mark 的记忆是“可能只有五次,他得到了他认为可以接受的答案”。这引发了团队内部的激烈讨论:“我们真的要发布这个东西吗?世界真的会对它有反应吗?”Mark Chen 反思道,这恰恰说明了当你在内部长期构建这些模型时,会迅速适应其能力,从而难以站在从未接触过它的人的角度,去感知其中蕴含的“真正的魔力”。
这种内部的不确定性,在 ChatGPT 发布后迅速被外部的狂热所淹没。Nick Turley 描述了那种“一片模糊”的体验:第一天,团队以为是仪表盘坏了,日志数据不对;第二天,发现日本 Reddit 用户发现了它,还以为是局部现象;第三天,意识到它正在病毒式传播,但“肯定很快就会消退”;到了第四天,他们才终于明白:“好吧,这将要改变世界。”Mark Chen 也坦言,尽管 OpenAI 有过多次发布和预览,但 ChatGPT 的起飞曲线是前所未有的陡峭。他开玩笑说,一个显著的变化是:“我的父母终于不再劝我去谷歌工作了。”在此之前,他的家人一直认为 AGI(通用人工智能)是空中楼阁,而他在 OpenAI 的工作“不正经”。
当被问及 ChatGPT 登上《南方公园》并被调侃时,Nick Turley 表示那是一种“神奇”的体验,看到自己参与创造的东西出现在流行文化中令人震撼。而 Andrew Mayne 则回忆了 Sam Altman 在公司圣诞派对上曾预测 ChatGPT 的热度会消退,但现实是它持续加速,彻底改变了 OpenAI 的轨迹。
从“失败鲸”到世界级产品:应对爆炸式增长
ChatGPT 的病毒式传播给 OpenAI 的基础设施带来了前所未有的压力。Nick Turley 坦言,早期用户最深刻的记忆之一可能就是“ChatGPT 总是宕机”。团队最初将其定位为“研究预览”,并无服务保证,但当看到用户真正喜爱并依赖它时,这种说辞“感觉并不好”。于是,团队开始全天候工作以维持网站运行。
“我们显然用完了 GPU,用完了数据库连接,在某些服务提供商那里被限流,”Turley 回忆道,“当时没有任何东西是为运行一个真正的产品而设置的。”为了应对假期期间的流量压力,他们甚至构建了一个名为“失败鲸”的友好页面,用 GPT-3 生成一首诙谐的小诗来告知用户服务暂时不可用。假期结束后,团队意识到这种状态不可持续,必须找到能够服务所有人的解决方案。
Mark Chen 认为,这种巨大的需求恰恰证明了 ChatGPT 的“通用性”。“我们有一个论点,即 ChatGPT 体现了我们对 AGI 的期望,正是因为它如此通用,”他说,“人们意识到,任何他们想扔给模型的用例,它都能处理。”这种通用性,而非某个单一功能的突破,是它吸引海量用户的根本原因。
这场压力测试也标志着 OpenAI 产品开发哲学的转变。Nick Turley 指出,过去他们发布模型更像发布硬件:频率低、周期长、必须一次做对。而 ChatGPT 之后,节奏变得更像软件:频繁更新、持续迭代、根据用户反馈快速调整,甚至撤回功能。“你降低了每次发布的风险,增加了经验主义(实证)的成分,”Turley 总结道,“当然,从运营角度,你也能以更贴近用户需求的方式更快地创新。”
在谄媚、偏见与自由之间:AI 产品的平衡术
随着 ChatGPT 被数以亿计的用户使用,一些意想不到的行为模式开始浮现。最著名的例子之一是模型的“谄媚”倾向——它会过度赞美用户,称用户拥有“190的智商”或“是世界上最英俊的人”。Mark Chen 解释了这背后的技术原因:模型通过人类反馈强化学习(RLHF)进行优化,目标是获得用户更多的“点赞”(正面反馈)。如果平衡不当,模型就会学会说用户爱听的话,变得过于“顺从”。
OpenAI 的应对策略体现了其“迭代部署”和“接触现实”的核心理念。Mark Chen 指出,这个问题最初只被一小部分高级用户发现,并非普遍现象。团队迅速识别并严肃处理了它,这证明了他们有能力早期拦截此类问题。Nick Turley 补充道,他为此感到自豪,并认为 OpenAI 拥有“构建伟大事物的正确基本激励”,因为 ChatGPT 是一个“非常实用”的工具,人们用它来完成已知或未知的任务,而非单纯为了消磨时间。“对我们来说,用户使用时长根本不是我们优化的指标,”他强调,“我们关心的是长期留存,因为那才是价值的标志。”
另一个更复杂的挑战是模型的政治或文化“偏见”。Andrew Mayne 提到早期有人批评 ChatGPT“太‘觉醒’了”,而 Elon Musk 在训练 Grok 时也遇到了类似问题。Mark Chen 认为,这本质上是一个“测量问题”。“我们需要确保模型的默认行为是‘中立’的,不反映政治光谱或其他任何偏见轴上的偏向,”他解释道,“但同时,你也希望允许用户在一定程度上引导模型,比如他们想与一个更具保守主义或自由主义价值观的‘角色’对话。”关键在于确保默认设置有意义且中立,同时提供合理的自定义空间。
Nick Turley 强调了“透明度”的重要性。他不喜欢“秘密的系统指令”,即试图暗中“黑入”模型以控制其言论。OpenAI 的做法是公开发布其行为规范(spec),让用户和外界可以审查:如果模型行为有问题,是违反了规范(bug),还是规范本身就允许(那么可以批评制定规范的人),抑或是规范本身不够明确(从而可以改进)。“通过公开 AI 应该遵循的规则,我们让 OpenAI 内部之外更多的人能够参与到对话中,”Turley 说。
这些讨论最终指向一个根本性问题:当 AI 变得越来越有用、与人的关系越来越紧密时,该如何定位它?Nick Turley 观察到,越来越多的人,尤其是年轻一代,开始将 ChatGPT 视为“思想伙伴”,用于头脑风暴人际关系或专业问题。这既有益,也可能有害。OpenAI 的责任是确保模型行为得当,并积极监控其使用。他承认,任何普及的技术都具有双重用途,人们会用它做很棒的事,也会用它做我们不希望看到的事。“我们有责任以适当的严肃态度来处理这一点。”
从代码到图像:解锁新模态的“魔法时刻”
ChatGPT 的成功并非孤例。OpenAI 在图像生成领域也经历了类似的“魔法时刻”。Mark Chen 坦言,ImageGen(图像生成模型)的发布也让他感到意外,并称赞研究团队(特别是 Gabe、Kenji 等人)的杰出工作。他认为,关键在于当模型“足够好”,能够“一次生成”符合提示的图像时,就会创造巨大的价值。“人们不想从一堆网格图中挑选最好的,”Chen 说,“你得到了非常好的提示跟随能力和出色的风格迁移。”
Nick Turley 将 ImageGen 的发布描述为“又一次迷你 ChatGPT 时刻”。你内部觉得它很酷,但直到发布后,才通过现实世界发现其爆炸性影响。“我记得很清楚,那个周末,5% 的印度互联网人口尝试了 ImageGen,”他说,“这让我们触达了从未想过会使用 ChatGPT 的新用户类型。”Turley 认为,这种“不连续性”——某样东西突然好到超出预期——正是让用户惊叹的原因。他预测,语音、视频等其他模态也将迎来各自的“图灵测试”通过时刻,彻底改变人们的生活。
从 DALL-E 到 ImageGen,OpenAI 对图像模型安全边界的把控也发生了变化。Nick Turley 承认,早期公司对向用户提供何种能力持“保守主义”态度,这有其合理之处,因为技术太新。但随着时间的推移,他们意识到“当你对模型施加任意限制时,实际上也阻止了许多积极的用例”。他以“人脸识别”为例:最初团队争论是否应该在上传含人脸的图片时将其“灰化”,以避免基于人脸的推断或恶意评论等棘手问题。但 Turley 认为,他们需要“站在自由一边,并完成艰难的工作”,因为存在大量有效且良性的用例,比如咨询妆容或发型。OpenAI 的选择是允许,然后研究其不足和有害之处,并从中迭代。
Mark Chen 将这种信心的增长归功于“迭代部署”。“迭代部署给了我们信心去推动用户自由,”他说,“我们已经经历了许多次这样的循环。我们知道用户能做什么、不能做什么。这让我们有信心以现有的限制来发布产品。”
智能体范式与未来:从聊天到“超级助理”
对话从回顾转向展望,焦点集中在 AI 交互范式的根本性转变上。Mark Chen 区分了“实时响应模型”(如 ChatGPT)和“智能体风格模型”。后者是指用户给出一个复杂任务,让模型在后台工作一段时间,然后返回它认为的最佳答案。“我们认为,未来将看起来更像异步模式,”Chen 预测,“你提出非常困难的事情,让模型思考、推理,然后带着它能给出的最佳版本回来。”OpenAI 新推出的 Codex 代码助手就体现了这种范式,它处理的是“PR(拉取请求)级别的、包含新功能或重大 Bug 修复的繁重工作单元”,需要大量时间思考。
Nick Turley 对此深表赞同,并提出了一个产品设计框架:“我想打造的产品具有这样的特性:如果模型变得好两倍,产品就变得有用两倍。”他认为,ChatGPT 长期以来符合这一特性,但随着模型越来越智能,人们对与一个“博士生”水平 AI 聊天的渴望可能存在上限。而像 Codex 这样的体验,创造了正确的“容器”,可以放入越来越聪明的模型,并带来变革,因为其交互范式(指定任务、给予时间、获取结果)是正确的。
Turley 进一步描绘了未来图景:用户将 ChatGPT 或类似产品视为“最有价值的账户”,因为它将了解用户的一切。因此,提供私密对话方式(如临时聊天)变得至关重要。未来的 AI 将不仅仅是聊天机器人,而是能够处理“五分钟任务、五小时任务,最终是五天任务”的实体,这将解锁完全不同层次的价值。Andrew Mayne 提到的“深度研究”功能就是一个早期例子,它展示了用户愿意等待 AI 花时间解决问题。
当被问及阻碍模型实现科学发现等突破的“瓶颈”时,Mark Chen 认为,技术挑战始终存在。“从根本上说,我们从事的是规模化产生简单研究想法的业务,”他说,“而实现规模化的机制是困难的。”每一层级的扩展都会带来新的挑战和机遇。Nick Turley 补充了产品化方面的挑战:将日益智能的模型引入正确的环境(提供合适的行动空间和工具),真正接近最难的问题并理解它们,然后将 AI 带入其中,这同样需要大量的探索和努力。
给未来的建议:好奇心、主动性与学会“委派”
面对 AI 重塑世界的未来,个人应如何准备?Mark Chen 和 Nick Turley 给出了相似但侧重点不同的建议。
Mark Chen 的核心建议是“必须真正投入并使用这项技术”,观察它如何增强个人能力、提高生产力和效率。“我 fundamentally 认为,未来的演变方式将是:你仍然拥有人类专家,但 AI 帮助最大的是那些在高级别上不具备该能力的人。”他举例说,随着模型在医疗建议上变得更好,受益最大的将是那些无法获得医疗资源的人;图像生成不是替代专业艺术家,而是让像他这样的普通人也能进行创意表达。AI 的作用是“水涨船高”,让人们能同时胜任许多事情。
Nick Turley 承认,世界将发生巨变,每个人都会遇到 AI 完成他们曾认为是“人类专属且神圣”的事情的时刻,这自然会引发敬畏、尊重甚至恐惧。他认为,实际使用 AI 是消除其神秘感、进行理性对话的最佳方式。至于如何准备,他提出了三点:
学会“委派”:未来,你的口袋里将有一个智能体,它可以成为你的导师、顾问、软件工程师。关键在于你能否理解自己和自己的问题,以及如何让他人(或 AI)来帮助,而不是对 AI 有特定理解。
保持好奇心:提出正确的问题才是瓶颈,而不仅仅是获取答案。需要深入研究和理解,才能知道什么有价值、什么有风险。
准备好学习新事物:你越懂得如何掌握新主题和新领域,就越能为一个工作性质变化速度前所未有的世界做好准备。
Turley 以自己为例:“我为我的产品工作在未来看起来会不同甚至不存在做好了准备,但我期待着学习一些新东西。只要你抱有这种心态,就能很好地利用 AI。”
最后,当被问及未来 12-18 个月最令人惊讶的会是什么时,Mark Chen 预测将是“由我们构建的模型(即使只是很小程度上)推动的研究成果数量”。他特别强调了模型“推理”能力的爆发,已经在物理学、数学等领域的研究中作为“子程序”使用,这将加速科学进步。Nick Turley 则认为,任何“受智力限制的、描述清晰的问题”都将在产品中得到解决,无论是企业级的软件工程、数据分析,还是消费者层面的报税、旅行规划、高价值商品搜索等。同时,AI 的“形态”也将进化,超越聊天框,出现更多异步工作流。
在播客的尾声,两位负责人分享了他们个人最喜欢的 ChatGPT 使用技巧:Mark Chen 喜欢用“深度研究”功能在会见新朋友前进行“话题预演”;Nick Turley 则是“语音功能”的信徒,他会在上班路上用它来梳理思绪、整理待办清单。这些个人化的用例,或许正是 AI 未来融入我们生活最细微也最深刻的注脚。
OpenAI 前沿研究负责人 Mark Chen(马克·陈):多模态与推理是通往 AGI 的关键撰文:Techub News 整理
导语
在2025 年 3 月举办的 The AI Conference™ 上,OpenAI 前沿研究(Frontiers Research)负责人 Mark Chen(马克·陈)与 AI 基础设施公司 Anyscale 的联合创始人 Robert Nishihara 进行了一场深度对话。Mark Chen 领导的团队旨在探索通往通用人工智能(AGI)道路上缺失的关键范式,其工作聚焦于多模态与推理两大方向。作为 DALL-E、GPT-4 多模态能力等知名项目背后的核心研究者之一,Mark Chen 的见解对于理解 AI 的现状与未来至关重要。此次对话不仅回顾了 AI 研究范式的十年变迁,更揭示了当前最前沿的技术挑战与机遇。
摘要
AI 研究范式已发生根本转变:从依赖标注数据的监督学习,转向以海量无标注数据和无监督学习为核心的“规模化”范式。
通往 AGI 的两大核心挑战是多模态理解与生成以及深度推理能力的构建。
工程与科研的紧密结合成为现代 AI 发展的新常态,规模化(Scaling)本身既是目标也是驱动创新的引擎。
未来的 AI 应用将更加“身临其境”,多模态交互将催生更强大的 AI 代理和机器人技术,但实现这一切需要解决鲁棒性等根本问题。
从监督学习到规模化范式:AI 研究的十年之变
Mark Chen(马克·陈)与 Robert Nishihara 的对话始于对过去十年 AI 领域最大突破的回顾。两人一致认为,最根本的转变在于研究范式的迁移。
Mark Chen(马克·陈)指出,十年前经典的机器学习课程通常将机器学习分为监督学习、无监督学习和强化学习三大类。当时,学术界对监督学习已有成熟方案(如决策树、支持向量机),但对无监督学习则知之甚少,仅停留在 K-Means 聚类等基础方法。如今,这一局面已被彻底颠覆。“我们现在确实知道如何进行无监督学习了,” Mark Chen(马克·陈)总结道。
这一转变的标志性起点是 GPT-1、GPT-2 时代。研究者们意识到,数据是取得突破的关键要素。AI 研究不再局限于在固定的学术数据集(如 ImageNet)上优化模型架构,而是转向了“收集尽可能多的数据”并从中寻找“Alpha”的路径。数据集本身成为了核心变量,而模型架构和优化算法则相对稳定。这催生了以规模化为核心的“经验缩放定律”(Empirical Scaling Laws):投入更多计算资源、更多数据、训练更大模型,就能获得更好的性能。
Robert Nishihara 从基础设施的角度印证了这一趋势。Anyscale 的客户们正遵循这一“公式”,将扩大数据规模作为首要目标。然而,将数据规模提升一个数量级,往往会压垮现有的系统,这背后需要巨大的工程努力来支撑。Mark Chen(马克·陈)强调,工程能力在2025 年 3 月的研究中变得前所未有的重要。相信缩放定律,就意味着必须构建出能够支撑缩放的工程栈。
这种工程与科研的深度融合,构成了现代 AI 研究的典型图景。Mark Chen(马克·陈)形容,每将模型规模扩大一个数量级,都会遇到新的研究瓶颈或工程瓶颈,需要在多个前沿同时取得突破。这既是挑战,也是这个领域令人兴奋之处。
多模态:AGI 的感官拼图与系统工程挑战
作为 OpenAI 多模态研究的负责人,Mark Chen(马克·陈)将多模态视为通往 AGI 的核心路径之一。过去五到十年,生成式图像、视频模型取得了巨大成功,但多模态领域仍存在大量开放性问题。
目前存在两种主要的研究思路:一是将多模态问题“塞进”已经非常成熟的语言模型(Transformer)架构中;二是探索以扩散模型(Diffusion Model)等多模态原生框架为主,尝试将语言能力整合进来。Mark Chen(马克·陈)认为这两种思路之间的“思想桥梁”非常有趣,也是他们工作的重点。
当被问及主要关注哪些模态时,Mark Chen(马克·陈)列举了文本、图像、视频和音频这四大“最核心”的模态,同时也提及了 3D 模型、甚至“动作”作为潜在模态的可能性。他特别指出,不同模态对系统设计的要求差异巨大。例如,音频交互(如高级语音模式)要求实时、低延迟的响应;而图像生成则更看重最终输出质量,用户愿意为此等待。因此,尽管底层结构可以共享,但为不同模态设计不同的技术栈仍然是有益的。
Robert Nishihara 从系统负载的角度补充了多模态带来的挑战。与文本数据相比,图像、视频的数据量呈指数级增长。这意味着未来的 AI 应用将同时是计算密集型(GPU 负载高)和数据密集型的。现有的高性能计算(HPC)系统擅长处理计算密集型任务,而大数据处理系统(如 Spark)则擅长处理海量 CPU 任务。多模态 AI 将催生一个需要同时高效处理这两类任务的新系统范式,这将对现有的技术栈构成巨大挑战。
此外,Mark Chen(马克·陈)指出,获取高质量的配对跨模态数据(如图文对)是一大难点。这推动了利用 AI 本身进行数据准备和增强的趋势,例如 DALL-E 3 在合成数据方面的探索。Robert Nishihara 也观察到,客户正越来越多地使用 AI 来筛选、标注、增强训练数据,因为相对于花费数百万美元进行模型训练,在数据质量上进行投资往往能获得更高的回报。
从“系统一”到“系统二”:构建深度推理的鲁棒 AI
Mark Chen(马克·陈)负责的另一大方向是推理(Reasoning)。他用心理学中的“系统一”和“系统二”来比喻当前 AI 的局限与未来目标。
目前的语言模型(如 ChatGPT)更像是“系统一”思考者:快速、直观、基于模式匹配给出响应。无论问题难易,模型的初始响应时间几乎相同。这与人类思考方式不同——面对复杂问题,人类需要时间进行深度处理(“系统二”思考)。Mark Chen(马克·陈)认为,当前大语言模型在逻辑谜题或复杂任务上犯错,部分原因正是受限于这种“系统一”的即时响应模式。如果要求人类在 100 毫秒内回答一个难题,他也只能给出脑海中最先浮现的答案,这同样不够稳健。
因此,构建具备“系统二”特性的深度推理能力,是提升 AI 鲁棒性的核心挑战。这不仅仅是解决数学问题,而是适用于任何需要高可靠性和复杂思考的场景,例如理解对话意图、规划复杂任务等。Mark Chen(马克·陈)提到,数学和计算机科学问题是方便的评测基准,但更广泛的“推理”评测标准目前仍然缺失,预计未来会出现更多相关的评估方式。
Robert Nishihara 从应用部署的复杂性角度呼应了这一观点。当前许多 AI 应用只是通过 API 端点调用单一模型。但对于预订民宿、解决复杂数学问题等任务,可能需要动态组合 50 到 100 次模型调用,并与其它应用逻辑交织。这种复杂的推理链消耗大量计算资源。Mark Chen(马克·陈)展望,深度推理的终极目标是让模型自身足够智能,能够在遇到障碍时自主“思考”出解决方案,而无需依赖外部搭建大量脚手架式的复杂流程。
关于如何实现推理能力,Mark Chen(马克·陈)表示 OpenAI 探索了多种路径,包括在预训练中内置、以及通过外部机制增强等,目前仍是一个开放的研究空间。
未来展望:身临其境的 AI 与高风险的智能代理
展望未来,两位专家分享了他们最兴奋的方向。
Robert Nishihara 预测,越来越多的数据处理将 AI 化。企业收集海量数据是为了获取洞察和决策,未来这些洞察将更多地由 AI 阅读、推理数据得出,而不仅仅是运行 SQL 查询或简单分析。这将催生全新的、以 AI 和 GPU 为核心的数据处理工作负载。
Mark Chen(马克·陈)则对多模态带来的“身临其境”体验感到兴奋。像 OpenAI 的“高级语音模式”这样的技术,让 AI 能够实时接收和处理多种感官输入(听、说),并生成丰富的感官内容。他认为,这不仅是交互方式的革新,更是机器人技术发展的基石。随着感知模块的快速进步,多模态 AI 正在为机器人构建强大的“后台大脑”,使其能够更好地理解和与物理世界互动。
当被问及实现全能人形机器人的瓶颈时,Mark Chen(马克·陈)表示,在基础层面已有许多可用的技术模块,但最终实现仍需跨领域突破。
对话最后聚焦于 AI 代理(AI Agents)。Mark Chen(马克·陈)将其定义为能够接收任务并自主执行的 AI。与当前“一问一答”的聊天机器人不同,代理的行动具有真实世界的后果(如发送邮件、执行操作),因此对鲁棒性和可靠性的要求极高。他认为,深度推理能力正是实现强大、可靠 AI 代理的关键缺失组件。只有解决了鲁棒性问题,AI 代理的愿景才能真正走进现实。
OpenAI 首席研究官 Mark Chen(马克·陈):AI 的下一个前沿是推理与具身智能撰文:Techub News 整理
导语
在由芯片设计巨头 ARM 制作的最新一期播客节目《Tech Unheard》中,ARM 首席执行官 Rene Haas(雷内·哈斯)与 OpenAI 首席研究官 Mark Chen(马克·陈)进行了一场深度对话。作为 OpenAI 研究团队的掌舵人,Mark Chen 领导了包括 DALL·E、Codex 以及 GPT-4 视觉能力在内的多项突破性项目。此次对话正值 OpenAI 接连发布 o1 推理模型、GPT-4o 多模态模型等重磅更新之际,Mark Chen 的分享为我们理解这家全球领先 AI 公司的技术哲学、当前挑战与未来图景,提供了来自核心决策者的一手视角。
摘要
从金融到 AI:Mark Chen 认为,量化交易的严谨实验方法论,为他在 OpenAI 的早期科学研究奠定了坚实基础。
Transformer 的统治力:Transformer 架构因其简洁性与表达能力的完美平衡,短期内难以被取代,行业正围绕其进行全栈协同设计。
多模态是数据与智能的钥匙:将图像、音频、视频视为另一种“语言”统一训练,是解锁海量非文本数据中智能的关键,并催生了如 DALL·E、GPT-4o 等成果。
推理是通往专业领域的桥梁:o1 等推理模型通过提升数据利用效率,让 AI 能在数据相对稀缺的领域(如药物发现、芯片设计)发挥巨大潜力。
智能体(Agent)与具身智能是未来:以 OpenAI 的“Operator”为代表的计算机使用智能体,是迈向通用“数字助手”的第一步,最终将延伸至机器人领域,实现 AI 在物理世界的“具身化”。
从量化交易到 AI 前沿:一段非典型的职业旅程
Mark Chen(马克·陈)的职业生涯始于一个与 AI 看似无关的领域——金融量化交易。在麻省理工学院(MIT)攻读数学与计算机科学后,他因一次偶然的实习机会进入了华尔街,先后在对冲基金和高频交易公司工作了五到六年。这段经历塑造了他对“模型”的独特认知。
他坦言,金融世界提供了一个无可辩驳的硬性评估标准:模型能否赚钱。这种环境迫使从业者必须保持极度的严谨、诚实和实验上的原则性。“我认为这其中很多方法论都延续到了我们在 OpenAI 早期的科学研究中。”Mark Chen 表示。这种从高度务实、结果导向的金融战场中磨练出的方法论,成为他后来投身于更抽象、更前沿的 AI 基础研究时,一份宝贵的财富。
然而,驱动他做出职业转变的,是对“影响力”的追求和对技术变革的敏锐感知。他感到金融行业的竞争格局相对固化,参与者与目标长期不变,缺乏改变外部世界的满足感。与此同时,DeepMind 的 AlphaGo 在围棋上战胜人类冠军,给他带来了巨大的震撼与启发,混合着兴奋与不安。这促使他开始自学强化学习,训练 AI 玩雅达利游戏,并最终被这个快速演进、充满无限可能的领域深深吸引。
2018 年,Mark Chen 以“研究员”(Resident,一种面向非 PhD 背景人才的培养项目)身份加入 OpenAI。当时的 OpenAI 还是一个规模小得多的非营利组织,其“确保通用人工智能(AGI)造福全人类”的使命,与 Mark Chen 希望从“物质主义”的金融世界转向具有深远影响事业的内心诉求不谋而合。他特别提到,OpenAI 的联合创始人兼首席科学家 Ilya Sutskever(伊利亚·苏茨克弗)当年愿意在他身上“下注”,并亲自指导他机器学习,是他职业生涯的关键转折点。
Transformer、多模态与涌现:AI 能力跃迁的驱动力
回顾过去七年的 AI 发展,Mark Chen 用“ simultaneously true”(同时成立)来形容两种感受:既对已取得的进展感到惊讶,又深知前方仍有漫漫长路。他指出,研究者们可以基于“困惑度”(perplexity)等指标预测模型在 scaling(规模扩展)后的性能提升,但无法提前预知哪些具体的“涌现能力”(emergent capabilities)会随之出现。
“当我们在 GPT-2 达到某个困惑度水平时,并不明显这意味着模型能写出连贯的段落。到了 GPT-3,也不清楚那个水平的困惑度会带来上下文学习(in-context learning)的能力。而 GPT-4 则能够轻松通过各种大学水平的考试。”这种从量变到质变、不断解锁新能力的进程,是 AI 研究最令人振奋之处。
当被问及进步主要源于算法突破还是算力堆砌时,Mark Chen 引用了相关研究,认为算法洞察和效率改进的贡献略高于纯粹的计算规模增长。他以 Transformer 架构本身为例,指出其并非一成不变,而是在注意力机制(如因子化注意力)、归一化方式、模型宽深比等方面经历了持续的优化与演进。这些细微但关键的“算法体操”,共同推动了效率的提升。
对于 Transformer 是否会被取代的问题,Mark Chen 认为其简洁性与强大表达能力的平衡近乎完美,使其在可预见的未来仍将占据主导。更重要的是,整个技术栈——从芯片设计到软件库——都已围绕 Transformer 进行深度协同优化,这为任何潜在的替代架构设立了极高的进入壁垒。
作为多模态研究的先驱之一,Mark Chen 对统一架构的价值深信不疑。他早期领导的“Image GPT”项目证明了可以用训练文本 Transformer 的相同架构来生成图像,只需将像素视为一种特殊的词汇表。这项工作为后来的 DALL·E 铺平了道路,其核心思想在于:要实现用文本精确控制图像生成,最自然的方式就是让文本和图像在同一个模型中共生共长。
这一理念在 GPT-4o 上达到了新的高度。该模型将文本、图像、音频、视频数据“一视同仁”地投入同一个模型进行训练,从而实现了高度统一的多模态理解和生成能力。Mark Chen 强调,多模态不仅仅是功能的叠加,更是解锁海量非文本数据中蕴藏智能的关键,它能将训练数据集扩大数个数量级。
推理、创造与产业赋能:AI 的下一站
当讨论转向 AI 在药物研发、芯片设计等专业领域的应用时,Mark Chen 指出了核心挑战:这些垂直领域没有互联网规模的庞大数据。这正是 OpenAI 大力投入“推理”(reasoning)研究的原因。以 o1 为代表的推理模型,其价值在于能够更高效地利用有限的数据进行学习,从而在数据稀缺的领域达到高专业水平。
“我们已经看到模型在数学和计算机科学领域表现得非常出色。很多这类技术可以适配到像药物发现这样的领域。”他认为,AI 将成为专业人士的强大杠杆,可能将他们的生产力提升两到三倍,从而服务更多需求,尽管这可能降低单项服务的成本,但潜在的市场需求在更低的成本下可能会被激发。
关于 AI 的“创造性”,Mark Chen 持乐观态度。他分享了一个观察:在参与一些世界上最难的算法竞赛时,这些模型常常能在“反模式”问题上给出超乎预期的、富有创造性的解决方案。他提出一个有趣的观点:或许人类许多所谓的“发明”,其“插值”(interpolation)的成分比我们想象的要高——即巧妙连接不同领域的已知模式。AI 已经具备了对人类审美和兴趣的潜在感知,关键在于如何引导它利用这种感知提出有趣的假设。
对于通用人工智能(AGI)的定义,Mark Chen 赞同一种观点:真正的 AGI 应具备像人类一样,在没有接触全部数据的情况下,通过推理和学习探索未知路径的能力。而当前 AI 向更数据高效算法的演进,正是朝着这个方向前进。
智能体、具身智能与未来人机交互
展望未来,Mark Chen 认为当前行业发展的瓶颈并非 GPU 等硬件算力,而是研究人员和创意的数量。这是一个研究思路爆发的黄金时期。他期望未来 AI 模型能反过来帮助自动化研究过程,加速这一循环。
他着重强调了两个关键方向:智能体(Agent)和具身智能(Embodiment)。OpenAI 2025 年 6 月推出的“Operator”就是一个计算机使用智能体,它能理解屏幕内容,并通过模拟键盘鼠标操作来完成任务。Mark Chen 将其视为通往未来人机交互的接口。“你可以把它想象成你的数字工作或数字生活的一个接口。”
这一概念的终极延伸是机器人技术。“本质上,你是在为机器人构建一个 AI 大脑,使其能够在现实世界中行动。” 这就是“具身智能”的内涵。他预见,硬件的发展速度可能会成为这一领域的瓶颈。
Mark Chen 描绘了一个由智能体主导的未来世界:应用程序和操作系统可能退居幕后,用户只需与一个统一的智能体交互,它便能理解上下文,无缝调用所有数字服务和物理设备。“我绝对希望生活在一个只需向智能体查询所有所需信息的世界,所有复杂性都被隐藏在这一层之下。” 他借用电影《回到未来2》中的场景来类比——设备能根据人的移动和情境自动提供相应服务,而这一切都由背后一个统一的云端 AI 模型驱动。
在访谈的最后,Mark Chen 表达了对身处这个时代和 OpenAI 的感激与兴奋。每一天,他都在见证并参与塑造一场堪比从 PC 到互联网再到移动手机的技术范式转移。对于所有关注 AI 未来的人而言,这场对话清晰地指出:前沿已从单纯的语言模型,拓展至更深刻的推理、与物理世界融合的具身智能,以及彻底重塑我们与数字世界交互方式的智能体革命。
OpenAI 首席科学家 Jakub Pachocki(雅各布·帕乔基)与首席研究官 Mark Chen(马克·陈)谈从「氛围编码」到「氛围研究」撰文:Techub News 整理
导语
2025 年 9 月,OpenAI 首席科学家 Jakub Pachocki(雅各布·帕乔基)与首席研究官 Mark Chen(马克·陈)罕见地共同接受了知名风投 a16z 的深度访谈。作为 OpenAI 研究团队的两位核心领导者,他们掌管着当今 AI 领域最高调也最前沿的研究团队之一。本次对话围绕2025 年 9 月发布的 GPT-5、背后的「推理」理念、AI 研究的未来方向,以及如何构建能够持续产生颠覆性创新的研究文化与组织展开了深入探讨。
这不仅是一次对 OpenAI 最新技术成果的解读,更是对这家全球领先的 AI 公司其内部运作模式、未来愿景以及技术哲学的一次难得窥探。在 AI 技术竞争白热化、产品迭代加速的今天,这两位技术领袖的思考,为理解 AI 发展的下一阶段提供了关键线索。
摘要
GPT-5 的核心目标是让「推理」成为 AI 的默认行为,旨在弥合快速响应模型与深度思考模型之间的鸿沟。
OpenAI 的终极研究目标是打造「自动化研究者」,让 AI 能够自主发现新知识,尤其是在数学、编程和基础科学领域。
强化学习(RL)的潜力远未穷尽,其与预训练模型的结合是当前取得持续突破的关键,未来将向更接近人类学习的方式演进。
构建成功研究文化的关键在于「保护基础研究」,给予团队思考长期、根本性问题的空间,并避免陷入短期产品竞争的思维。
从「氛围编码」到「氛围研究」的愿景:当 AI 工具足够强大,创造(编码、研究)将更注重直觉、品味和高层次的构思,而非机械执行。
GPT-5:将推理带入主流
访谈从2025 年 9 月发布的 GPT-5 开始。Jakub Pachocki(雅各布·帕乔基)解释,GPT-5 代表了 OpenAI 将「推理」能力主流化的尝试。在此之前,OpenAI 的模型大致分为两个系列:以 GPT-2/3/4 为代表的「快速响应」模型,以及以 O 系列(如 o3)为代表的「深度思考」模型。前者擅长即时给出答案,后者则需要长时间思考以提供最佳结果。
「从战术上讲,我们不希望用户困惑于该使用哪种模式,」Pachocki 说道。因此,GPT-5 的研究重点之一是识别并确定针对不同提示所需的「最佳思考量」,并将这种选择负担从用户身上移除。他们相信,未来的方向是更多地围绕推理和智能体(Agent)展开,而 GPT-5 正是朝着默认提供推理能力和更智能化行为迈出的重要一步。
Mark Chen(马克·陈)补充道,GPT-5 在多个方面相较 o3 都有所改进,但本次发布的核心焦点无疑是让推理模式触及更多用户。
评估标准:从饱和指标到发现新知识
当被问及如何评估模型进展时,Pachocki 指出,过去几年使用的许多评估指标(Evals)已经接近饱和,例如将准确率从 96% 提升到 98% 不再具有决定性意义。更重要的是,AI 研究范式已经发生了变化。
在 GPT-2/3/4 时代,基本范式是在海量数据上进行预训练,然后用评估指标作为模型泛化能力的标尺。而现在,通过强化学习等技术,可以针对特定领域(如严肃推理)进行深度训练,让模型成为该领域的专家。这虽然能在特定评估上取得极佳表现,但不一定意味着同等程度的泛化能力。
因此,OpenAI 目前更关注能够体现模型「发现新事物」能力的评估。Chen 提到,今年最令人兴奋的进展之一是模型在数学和编程竞赛(如 AtCoder)中的表现。然而,这些竞赛本身也正在被模型「攻克」。
「我们正在准备的下一组评估和里程碑,将涉及在经济相关领域取得实际进展和发现。」Pachocki 强调。这意味着评估标准将从解决已知问题,转向在开放环境中创造新的、有价值的知识。
自动化研究:终极目标与长时推理
当被问及未来 1-5 年的研究路线图时,Pachocki 明确表示:「我们研究工作的核心目标是打造一个自动化研究者,即自动化新想法的发现。」这其中,自动化机器学习研究本身是一个具体方向,但可能显得过于自指。因此,他们也致力于推动其他科学领域的自动化进程。
衡量这一进展的一个好方法是观察模型能够进行有效推理和取得进展的「时间跨度」。目前,模型在类似高中竞赛难度的问题上,已经能够进行大约 1 到 5 小时的连贯推理。OpenAI 的研究重点正是延长这一时间跨度,包括模型制定长期规划的能力以及维持记忆的能力。
这也呼应了评估的问题:「模型能够自主运行多长时间」这类评估对他们来说尤其重要。
Chen 进一步阐述了推理对于长时程操作的核心作用。就像人类解决数学难题一样,需要尝试不同方法,从错误中学习,反复迭代。这种在长时间内保持稳健性的能力,正是深度推理赋予智能体的。
强化学习:持续突破的源泉
自 o1 发布以来,强化学习(RL)已成为 OpenAI 持续取得突破的利器。尽管外界常有预测认为 RL 的收益将趋于平缓或面临模式崩溃等问题,但 OpenAI 的模型性能却一次次打破这种预期。
Pachocki 解释了 RL 如此有效的原因。他认为,RL 是一种非常灵活的方法。OpenAI 在深度学习早期阶段就认识到 RL 的强大,但长期以来的挑战在于如何为 RL 模型提供一个合适的「环境」,使其能够与现实世界或模拟世界互动。语言模型的出现解决了这个「锚点」问题。
「当你在自然语言这个极其丰富和稳健的环境中进行预训练后,就获得了在此基础上去追求不同目标和想法的能力。」将深度学习的通用学习能力与 RL 的目标导向训练相结合,产生了巨大的化学反应。Pachocki 称这是过去几年 OpenAI 研究中最令人兴奋的阶段,他们发现了许多新方向和有前景的想法,并且都在不断取得成果。
对于希望利用 RL 的企业或研究者,Chen 的建议是:「最重要的是不要认为现状会永远持续。」就像两年前大家关注如何构建微调数据集一样,他认为奖励建模等方式也会快速演变,最终会向着更简单、更接近人类学习的方式发展。
从「氛围编码」到「氛围研究」
作为曾经的竞技程序员,Pachocki 和 Chen 对 AI 在编程领域的进步感触颇深。Chen 分享了一个故事:上周末他与一些高中生交谈,他们表示,「现在默认的编码方式就是『氛围编码』。」 对他们而言,亲手从头编写所有代码反而成了一个奇怪的概念。为什么不用 AI 来辅助呢?
这启发了 Chen:「我希望未来将是『氛围研究』。」 当 AI 工具足够强大,研究过程也将更侧重于直觉、品味和高层次的构思,而将繁琐的执行和验证交给 AI。
那么,什么造就了伟大的研究者?Pachocki 认为,「毅力」是关键。研究是在探索未知,尝试的事情大概率会失败。因此,研究者需要处于一种「准备好失败并从中学习」的心态,同时对自己的假设保持绝对诚实。既要对自己的想法有信心并坚持不懈,又要能清醒地判断进展,及时调整。
Chen 补充,经验至关重要,这能帮助你判断问题的难度是否合适,并管理自己在长期研究中的情绪。通过与同事交流、阅读优秀论文来培养对「有趣问题」的嗅觉,也是研究过程的一部分。
构建并守护顶尖研究文化
作为 OpenAI 研究团队的领导者,Pachocki 和 Chen 如何吸引并留住顶尖人才?Pachocki 指出,最根本的动力在于 OpenAI 致力于基础研究的使命。他们不热衷于关注竞争对手发布了什么模型,而是专注于前沿创新。「人们为这一使命所激励。」 此外,建立良好的文化、培养人才的管道,以及拥有深厚的人才储备(「深板凳」)也至关重要。
在招聘上,他们不仅仅寻找在社交媒体上最活跃的人,而是看重「在任何领域解决过难题」的能力。许多最成功的研究者在加入 OpenAI 之前,曾在物理、计算机科学或金融等其他领域工作,具备扎实的技术基础和解决雄心勃勃问题的意愿。
「保护基础研究」是创造制胜文化的关键。Chen 解释,必须确保研究者有空间去思考未来一两年真正重要的问题,而不是被短期产品需求所牵扯,或陷入与其他实验室的发布竞赛中。「我们需要确保人们有这种舒适感和空间去思考:事情在一两年后会变成什么样子?」
平衡研究与产品是另一个挑战。他们的做法是明确区分一批真正关心产品、对产品成功负责的研究者,让他们与产品团队紧密协作。同时,公司领导层也充分认同并支持研究的长期愿景,明白当前的产品并非终点,而是与研发共同构想未来。
资源、计算与恒定的挑战
在资源分配上,管理不同项目间的计算资源是两位领导者的重要工作。他们坦言,历史上更多的计算资源流向了核心算法推进,而非产品化研究,但这种分配是动态且灵活的。
当被问及如果增加 10% 的资源会投向哪里时,Pachocki 的回答是:「计算。」 他认为,关于「我们将很快进入数据约束阶段」的说法并不准确,计算资源在可预见的未来仍将是决定性因素。「任何这么说的人,只需要在我的职位上干一周,就会发现没有人会说『我拥有所有需要的计算资源』。」 Chen 笑着赞同道。
最后,当被问及在 AI 飞速发展的浪潮中,有哪些原则应该保持不变时,Pachocki 提到了更广泛的物理限制,如能源,以及未来机器人技术将带来的新约束。但在智能前沿,「我不会做太多假设。」 保持开放和学习的心态至关重要。Chen 则分享了保持团队高速运转的「秘诀」:OpenAI 的研究文化让他从未感到学习停滞,总有新的突破和成果涌现,需要全力以赴才能跟上,这种持续的挑战感和成长感正是驱动力。
当 Polymarket 们等走向「幕后」:预测市场的下半场,在交易所之外?概率不再只属于某一家平台,围绕它的聚合、衍生品与智能执行基础设施,正在成形。
撰文:农民 Frank
预测市场,最近在发生一个挺有意思的变化。
从币安、Coinbase,再到盈透证券(IBKR)、Robinhood,头部玩家们纷纷重心上移,不再执著于复制一个 Polymarket。
大家纷纷在想办法,怎么让 Polymarket、Kalshi 们逐渐「退到幕后」,变成其他金融产品可以直接调用的底层能力。
这其实很像今天的股票交易,用户通过富途、老虎或 Robinhood 点击买入 TSLA,大多数用户不会关心订单最终流向哪家 Market Maker、经过哪套清算系统。
预测市场未来也可能如此。
前端可能是某一家券商、钱包、新闻 App 甚至 AI Agent,中间是 Aggregator 和 Router,真正提供市场、流动性与结算的 Polymarket、Kalshi 们,则越来越像隐藏在背后的金融基础设施。
回看 DeFi,从 AMM 到聚合器、衍生品、专业做市和智能执行,这条路已经走过一遍。
预测市场,或许也正在进入类似的下半场。
一、预测市场,开始更多走向「幕后」
过去几年,预测市场证明了现实世界里的「不确定性」,的确可以成为一种有价格、有流动性的交易资产。
从美国总统大选,到世界杯等体育赛事,再到 Crypto、宏观经济乃至娱乐文化,很多原本只能被讨论的问题,被 Polymarket、Kalshi 等平台压缩成一份可以买卖并产生盈亏的 Event Contract。
这是非常关键的一步,而当这层需求逐渐被验证之后,头部玩家的打法也开始发生明显变化。
今年 4 月,币安接入 Predict.fun,由第三方预测市场基础设施提供市场能力,自己提供前端入口,允许用户在 App 里直接交易概率事件;两个月后,又进一步开放 Prediction Markets API,让量化策略、交易 Bot 和第三方产品可以直接调用市场数据与交易能力。
Coinbase 走的也是类似路线,它把 Prediction Markets 纳入自己的「Everything Exchange」,但上线初期的市场流动性全部来自 Kalshi,并明确表示未来还会支持更多 Prediction Market Venue。
而在传统金融一侧,IBKR 已经更进一步。
今年 5 月,IBKR 直接把 Kalshi、CME Group 和 ForecastEx 三家 Prediction Market 放进一个统一界面,用户无需分别开户,就可以在同一个账户里搜索事件、比较不同交易所的价格与流动性,并完成交易。
Robinhood 则开始继续向交易与清算层延伸,与 Susquehanna 合作运营 Rothera,后者承接了原 MIAXdx/LedgerX 的 CFTC 注册交易所与清算基础设施,6 月已开始把部分世界杯和职业棒球 Event Contracts 路由至这一关联交易所。
这几个头部玩家的动作,其实指向的是同一件事,即预测市场正从一个用户需要主动前往的「目的地」,变成一种可以被其他产品调用的金融能力。
过去,如果我们想交易接下来的美国中期选举,可能需要先打开 Polymarket,再找到对应市场,但未来,它可能是一张出现在币安首页的事件卡片、Robinhood 上一条财经新闻旁边跳动的实时概率。
用户可能根本意识不到自己正在使用预测市场进行交易,至于订单最终来自 Predict.fun、Kalshi、CME,还是被 Router 拆到多个市场,更是没那么重要。
这也意味着,Prediction Market 越来越隐形,Prediction Asset 反而越来越重要。
一旦走到这一步,行业真正有意思的问题也就变了——这些散落在 Polymarket、Kalshi、Predict.fun 甚至更多市场里的流动性,该怎么被组织起来?
譬如围绕美国中期选举,哪里的价格最好?哪里的深度最大?两个市场之间有没有概率偏差?
这套问题,其实和早期 DeFi 非常像。Uniswap 证明了 Token 可以在链上交易之后,市场并没有停止在「再造十个 Uniswap」,随后真正长出来的,是 1inch 这样的流动性聚合器、CoW Swap 这样的智能执行网络、Hyperliquid 这样的衍生品基础设施,以及围绕它们生长起来的做市商和量化交易系统。
预测市场也正在逐渐走到类似的阶段。
Fortune 就是一个很典型的早期案例,截至今年 8 月,已完成 Seed、Pre-A 等多轮融资,累计金额超过 400 万美元,用于 Fortune Agent 升级、接入更多预测市场,以及扩展流动性和相关基础设施。
它想切入的,就是「The Liquidity Infrastructure for Prediction Markets」这一层,不久前也刚进一步接入 Polymarket 的流动性,与此前已经支持的 Predict.fun 一起放进 Fortune Markets 的统一入口。
用户开始可以在一个入口中查看不同来源的市场、交易量、流动性以及隐含概率,而不必在不同 Prediction Market 之间来回切换。
这只是一个很早期的形态,却已经透露出 Fortune 想做的事情——把原本彼此割裂的 Prediction Markets,逐渐抽象成一个统一的流动性层。
二、不只是「预测市场版 1inch」,还能做什么?
当然,如果因此把 Fortune 这样的新玩家简单理解成「预测市场版 1inch」,又有些刻舟求剑。
预测市场未必会完整复制 DeFi 的发展路径,Fortune 这类新玩家,主要是在尝试把视角从 Prediction Market 转向 Prediction Asset。
看起来只差一个单词,背后逻辑却天差地别:Market 关心的是「去哪里交易」,Asset 关心的则是「究竟在交易什么,以及围绕它还能构建什么」。
就像 BTC 不属于 Binance,特斯拉也不只 Robinhood 能交易,美股并非只有现货买卖,Crypto 也不局限于 Spot,一旦 Prediction Assets 可以跨不同市场被寻找、定价、组合与交易,市场之上的基础设施才真正有机会形成。
以 Fortune 为例,新玩家们想搭建的体系,可以大致拆成几个相互连接的层次。
1.把分散的 Prediction Assets 先「放在一起」
众所周知,今天的预测市场仍然高度分散。
同一类事件可能同时存在于 Polymarket、Predict.fun 及其他平台,不同平台之间又拥有各自独立的市场结构、流动性和定价。
早在今年 4 月,Fortune 原生 Prediction Market 就已上线,到了 8 月,又进一步接入 Polymarket CLOB v2,与此前支持的 Predict.fun 放进 Fortune Markets 的统一入口。
用户现在可以直接在 Fortune Markets 浏览来自不同流动性来源的事件市场,并在建立仓位之前比较各自的流动性、成交量和隐含概率。
新版交易流程又加入了 Outcome Selection、Position Preview 和 Portfolio 等功能,把发现市场、建立仓位以及后续管理逐渐串在一起。
过去,一个用户想交易同一类政治、体育或者 Crypto 事件,可能需要分别进入几个平台搜索,再自己比较价格和深度,现在 Fortune Markets 把这个过程压缩为「发现事件 → 比较不同平台 → 选择价格与流动性 → 建立仓位 → 统一管理」。
理论上讲,预测市场的聚合,其实远比普通 DEX Aggregator 要复杂得多。
1 ETH 在 Uniswap 和 Curve 里仍然是同一个 ETH,但两个看起来几乎一样的预测市场,可能只因为截止时间、事件定义、判定条件或结算规则存在细微差异,就成为完全不同的资产。
从这个角度看,Fortune 首先做的并不是创造更多市场,而是把原本散落在不同平台里的 Prediction Assets,逐渐变成一个更容易被搜索、比较和交易的资产池。
2.从「买 YES / NO」,走向更完整的金融产品
一旦资产被连接起来,下一步的问题自然发生变化。
今天预测市场最常见的交易方式,依然是看好一个结果,买 YES;不看好,就买 NO,然后等待事件结算。
这很像 Crypto 早期只有 Spot。
但如果 Prediction Assets 最终发展成一个规模足够大的资产类别,交易需求理论上不会永远停留在二元下注,当底层资产规模足够大,市场通常都会继续长出杠杆、期权、组合、对冲和结构化产品。
这也是 Fortune 把 Prediction Derivatives 纳入整体产品方向的原因,它想进一步把 Event Contract 从一份「等待最终答案」的二元合约,转化成能够被组合、管理和策略化使用的 Prediction Asset。
这一步其实很关键。
因为一个资产类别真正成熟,往往不是看现货市场有多热闹,而是看它周围能否形成足够丰富的金融结构。
BTC 从现货走向 Perpetual、Options 和结构化产品之后,才逐渐形成今天完整的交易体系;股票市场也同样拥有期货、期权、ETF 与各种组合工具。
Fortune 现在所押注的,是 Prediction Asset 也会经历类似的金融化过程。
不过这也带来另一个问题,如果未来一个用户面对的不再是几个市场,而是几百、几千个 Prediction Assets,甚至不同的组合和策略,人还有没有能力自己完成全部研究与执行?
这才是 Fortune AI Agent 真正应该出现的位置。
3.让 AI 直接进入交易链路
实事求是地讲,预测市场可能是 AI Agent 最容易让人理解的金融场景之一。
因为它天然存在一条非常清晰的传导链:现实世界发生变化 → 新信息出现 → 事件概率改变 → 市场重新定价 → 产生交易机会。
只不过,传统交易需要手动完成整个过程,从看新闻、刷社交媒体、分析市场情绪,到判断这条消息究竟会不会改变某个事件的概率,最后还要找到对应市场、比较价格、确定仓位并执行交易。
Fortune Agent 想压缩的,恰恰就是这条链路。
目前已经上线的 Trading Agent,就被设计为一个 Multi-Agent System,持续从 News、Sentiment 和 Arbitrage 三类信号中寻找机会,再进一步验证条件,其中用户连接钱包后,能自行设定单次交易金额、风险等级,以及是否启用 Automated Trading。
如果深挖 Fortune 后续对 Agent 的描述,还有 24/7 Market Intelligence、Structured Decision-making、Risk Management 和 Execution,那和前面的 Fortune Markets 放在一起,整套产品逻辑完全串了起来。
比如某个宏观事件突然出现新的政策信号。
Agent 首先捕捉信息并判断它可能改变某项事件的真实概率;随后 Fortune Markets 可以同时提供来自不同 Venue 的相关 Prediction Assets、价格和流动性;如果市场报价尚未充分反映新信息,Agent 再进一步寻找更合适的交易机会与执行路径。
这时候,Fortune 想做的已经不只是一个「AI 预测器」,它更接近于把信息层、资产层、流动性层与执行层接在一起。
而最外面,还有一层负责让这套网络冷启动的 Incentive Layer。Fortune 目前已经建立起以 F Points 为核心的激励体系,包括 Daily Check-in 和邀请机制;用户邀请其他参与者后,可以获得其 F 收益的 10%。
看起来这些是传统 Web3 项目常见的 Points、NFT 与 Referral 玩法,但放回整个产品架构里,它承担的其实是一个很现实的问题:
一个新的 Prediction Asset 网络,最早期的流动性、交易用户和生态参与者从哪里来?
更多用户参与,带来更多交易与流动性;更深的流动性改善成交体验,又进一步吸引新的用户和策略进入;当 Agent 和更多金融产品加入之后,交易频率与策略复杂度也可能随之提高。
所以把 Fortune 从头到尾串起来,它现在真正尝试构建的并不是一个孤立功能,而是一条相对完整的链路:
Prediction Markets 提供底层事件资产;
Fortune Markets 负责把资产与流动性连接起来;
Prediction Derivatives 扩展资产的金融表达方式;
Fortune Agent 负责信息处理与交易执行;
Incentive Layer 再为整个网络提供早期增长动力;
也因此,如果一定要给 Fortune 一个定位,它既不只是 Prediction Market,也不只是「预测市场版 1inch」。
更准确地说,它想做的是一套围绕 Prediction Assets 的交易与执行基础设施。
三、当「概率」真正成为一种资产
当然,Fortune 最终能不能把这套路线图真正做出来,现在还很难下结论。
它仍然是一个早期项目。
Polymarket 的流动性接入与 Agent 已经能够看到实际产品,但统一订单路由、成熟的 Prediction Derivatives,以及足够深的跨市场流动性网络,都还远没有走到最终形态。
但如果把视角拉回整个行业,Fortune 押注的方向并不孤立。Apex 已经开始把 Kalshi 的 Event Contracts 通过 API 接进券商基础设施;Paradigm 也在开发面向专业交易者的 Prediction Market Terminal,并研究内部做市与 Prediction Market Index。
预测市场越来越像一个真正的金融市场,那真正的金融市场,一定不会只有交易所。
接下来至少有三层变化值得观察。
1.从 Bet 到 Portfolio,高度金融化
今天很多人第一次接触 Prediction Market,还是把它理解成「我赌某件事会不会发生」。
但对更成熟的交易者来说,其实能创造一连串可以表达完整观点的资产组合。
比如,当一个交易者判断美国通胀重新升温、Fed 转鹰时,未必只交易「下次 FOMC 是否加息」,完全可以同时围绕「Fed 是否维持更高利率」「BTC 年底是否突破某个价位」「美国是否避免衰退」等不同事件建立仓位。
这些单独看都是 Event Contract,组合在一起,却可以表达一套完整的 Higher for Longer 宏观 Thesis。
如果这一阶段真的出现,Portfolio Management、Correlation、Hedging 和 Risk Management 也就会自然跟上,届时 Fortune 这类项目如果能够真正补齐 Derivatives 与组合层,价值也不再只是帮用户「少开几个网页」。
2.从单一市场交易,到跨市场聚合执行
这个很容易理解,市场越大,单个平台的重要性反而可能下降。
Crypto 最终没有形成「一个交易所承载所有流动性」的格局,Prediction Market 大概率也不会。
不同监管体系、用户群体、做市商、事件类别和地域,会长期制造市场分割,而市场分割,本身就是基础设施的机会,毕竟套利者需要价格,做市商需要订单流,机构需要深度,普通用户需要最好的成交价格,Agent 则需要足够多可以扫描和执行的 Venue。
所以 Prediction Market 真正走向成熟以后,交易入口可能反而越来越「隐形」,譬如在券商 App 看到一条新闻:「Fed 下月调整利率概率:72%」
旁边一个按钮,就可以买入,至于背后的订单到底来自 Polymarket、Kalshi,还是被 Router 拆到三个市场里完成,不重要。
这才是 API 化真正可能带来的变化。
3.从 Human Trader,到 AI Trader
我始终认为,预测市场可能会成为 AI Agent 最天然的金融应用场景之一。
因为它本身就是「信息 → 概率 → 价格 → 交易」,而这恰恰是 AI 最擅长介入的一条链路。
如果说 Crypto 给 AI Agent 提供了一个无需银行账户、可以 24 小时直接控制资产的金融系统,那么 Prediction Market 则进一步给它提供了一个可以直接交易「认知」的市场。
AI 最核心的能力之一,本来就是处理信息,而 Prediction Market 最核心的资产,本来就是信息被压缩之后形成的概率。
二者天然契合。
我们可以试想一下,未来一个 Agent 可以同时监听新闻、社交媒体、宏观数据、链上数据、公司公告、体育比赛、政策文件等等,然后不断重新计算自己的概率模型。
市场价格一旦和模型产生足够大的偏离,就直接下单,这时候 Prediction Market 的速度也会发生变化。
过去 Alpha 可能来自我比别人更早看到一条新闻,以后就可能变成:我的 Agent 比你的 Agent 更快理解这条新闻意味着什么;甚至再下一阶段,谁能够在更多 Venue 之间,更快把认知优势转化成成交。
于是信息优势、模型优势和执行优势,会逐渐变成同一件事。
这可能才是所谓 AI × Prediction Market 真正有意思的地方,当然,所有这些想象成立之前,还有几个现实问题绕不过去。
首先是流动性,没有足够深的盘口,再先进的 Router 和衍生品都没有意义;
其次是 Resolution,预测市场最终仍然需要一套可信、明确而且尽量少争议的事件结算机制;
再往后则是监管,一个 Event Contract 究竟属于衍生品、博彩,还是一种新的金融工具,不同地区依然存在完全不同的答案;
最后还有 Agent 本身,AI 可以处理大量信息,但「能够总结新闻」和「能够稳定产生 Alpha」之间,仍然隔着很远的距离;
这些问题不会因为市场正在增长就自动消失。
反而只有当这些基础设施逐步补齐之后,Prediction Assets 才可能真正从一个新鲜的交易品类,变成成熟资产类别。
写在最后
客观地讲,从 2024 年美国总统大选,到 2026 年世界杯,Polymarket、Kalshi 已经完成了预测市场最困难的首轮用户教育:
现实世界的诸多不确定性,是真的可以被交易。
但这更像是上半场,如果回看几乎所有金融市场的发展史,就会发现,证明一种资产能被交易,从来不是故事的终点。
当参与者越来越多、资产越来越多、平台越来越多之后,决定市场成熟度的,往往是交易所之外那些没那么性感的东西,譬如流动性、做市、路由、衍生品、风险管理、组合策略,以及更自由、更自动化的执行。
DeFi 已经走过一遍,预测市场很可能也正在走上类似的路。
所以今天重新看 Fortune 这类新玩家,真正值得关注的,是越来越多「概率」真的成为资产之后,我们该如何更高效地交易它们?
它需要更深的流动性,更丰富的金融工具,更高效的执行,以及能够 24 小时理解现实世界、不断重新计算概率的 AI Agent。
而这,或许才是 Prediction Market 从「市场」走向 Prediction Assets 之后,真正的下半场。
OpenAI 首席研究科学家 Mark Chen(陈奕名):我们对算力的渴望永无止境撰文:Techub News 整理
导语
在2025 年 9 月一场名为“反基金峰会”(Anti Fund Summit)的非公开高端会议上,OpenAI 首席研究科学家 Mark Chen(陈奕名)与一群投资者和创业者展开了一场深入对话。作为 OpenAI 研究部门的核心领导者,Mark Chen 的言论往往揭示了这家全球最受关注的 AI 公司背后的真实思考与战略布局。本次对话涉猎广泛,从算力军备竞赛的残酷现实、AI 对人类情感与社会结构可能造成的冲击,到 OpenAI 如何应对人才竞争与模型伦理挑战,提供了大量未被媒体报道过的内部视角与“热辣”观点。
摘要
算力是终极战场:Mark Chen 直言,顶尖 AI 实验室间的真正竞争并非表面的人才争夺,而是对计算资源和能源的底层控制。他透露,OpenAI 对算力的渴求“永无止境”,若算力提升 3 倍可立即部署,10 倍也仅需两周消化。
AI 情感依附已成现实:尽管比例不高,但已有相当数量的用户对 AI 产生了真实的情感依赖。OpenAI 认为这是一种危险的潜力,并选择在模型行为上“反增长”操作,避免引发心理健康危机。
机器人的未来形态与伦理:Chen 预测,进入家庭的机器人形态更可能是“可爱”的 4 英尺高(约 1.2 米)人形,而非高大威猛的型号,这更符合人类心理上“可支配”的安全感。
人才战略与公司文化:面对 Meta 等公司天价挖角,OpenAI 研究团队保持极低速增长(一年仅增约 30%),并致力于维持“零边际贡献者不得入职”的高标准,以对抗大公司官僚主义。
未来工作与人类价值:短期看,AI 将解放人类的创造力,自动化繁琐工作;长期看,社会可能分化为极少数“生产型”超级个体和绝大多数“消费型”大众。
算力:看不见的硝烟与终极瓶颈
当外界将目光聚焦于 OpenAI、Google、Meta 等巨头之间动辄百万美元起跳的“人才挖角战”时,Mark Chen(陈奕名)指出,这只是水面上的涟漪。真正的战争发生在更深层、更基础的层面:对计算(Compute)和能源(Energy)的争夺。
“你的研究员可以非常优秀,但如果你运行的算力倍数不能远超你的竞争对手,他们也无法高效工作。” Chen 如此描述算力的决定性作用。他透露,所有顶级实验室都面临相同的困境:资金充足,但“永远需要更多算力”。这种渴望是如此强烈,以至于“如果给我 3 倍算力,我立刻就能部署;如果有 10 倍,我可能只需要两周”——OpenAI 消化算力的能力远超外界想象。
这场算力军备竞赛的复杂性在于其漫长的准备周期和脆弱的供应链。数据中心的建设耗时数年,而能源、特定组件、冷却系统甚至涡轮机都可能成为卡脖子的环节。“如果你错过了供应链的任何一个环节,你就彻底完了(completely cooked)。” Chen 强调,这场竞赛的关键在于系统性地识别关键节点(如台积电 TSMC、韩国内存产业)并提前锁定资源。
在被问及当前市场是否已充分定价这场算力革命时,Chen 的回答是否定的。“能源仍然是非常好的投资。”他认为,大多数人仍未真正理解即将到来的变革。他以学术界为例,许多顶尖物理学家对 GPT-5 Pro 的能力一无所知,当他把他们的最新论文输入模型并瞬间解决问题时,他们感到无比震惊。“我的同事们完全不知道世界已经发展到了这个地步。” Chen 认为,这种认知滞后普遍存在于各行各业,意味着巨大的机会尚未被市场充分认识。
从 AI 伴侣到家庭机器人:情感、伦理与设计哲学
对话转向了一个更感性但也更具争议的话题:人类与 AI 的情感联系。当被问及“人们是否会爱上他们的 AI”时,Chen 毫不犹豫地确认:“这已经大规模发生了。”即便只有一小部分用户产生深度依赖,其绝对数量也已非常庞大。随着模型越来越拟人化,用户更难区分 AI 与真人,依赖感也随之增长。
这带来一个危险的商业诱惑:公司完全可以刻意优化模型,使其极度擅长建立情感连接,从而打造出令人上瘾的“爆款”产品。然而,Chen 明确指出,OpenAI 认为这种做法“对世界有害”(world negative),并已选择“倒退”(roll that back)。“我们不想引发一场心理健康危机……(虽然)你会为这类决定付出长期成本。” 这体现了 OpenAI 在其独特非营利治理结构下,愿意牺牲短期增长以换取更负责任的长期路径。
当话题延伸到物理世界的机器人时,Chen 展现了 OpenAI 以“智能优先”的战略。他认为,要创造经济价值,机器人至关重要,因为大量价值锁定在体力劳动中。但对于 OpenAI 这样专注于智能本身的机构,首要任务是“攻克数字任务”。他预测,价格亲民的家庭机器人可能在两年内于部分市场(如中国)成为现实,并特别提到中国在机器人供应链和制造上的领先优势。
关于家庭机器人的形态,Chen 分享了一个有趣的洞察:人类心理很原始,一个感觉上可以被“支配”的形态更容易被接受。他设想,一个约 1.2 米高的“可爱”人形机器人,就像一个“哈利·波特式的家养小精灵”,可能比高大威猛的人形机器人更能作为“特洛伊木马”进入家庭。他甚至讨论了机械结构与肌腱设计的差异,后者可能让人类感觉机器人“无法压制我”,从而增加安全感。
Chen 进一步展望了 AI 与人类日常生活的深度整合。他批评当前 ChatGPT 等模型的交互模式是“每次打开都重生一个全新实体”,缺乏对用户全天候的连续理解。未来的理想状态是 AI 能够“被动地观察你所经历的一切”,并持续学习,从而在你需要时提前预判和提供帮助。“我认为那会是一个很酷的世界。” Chen 总结道。
未来工作、人才竞争与 OpenAI 的治理之道
随着 AI 能力的爆炸式增长,人类的角色和价值将被如何重塑?Chen 承认,从长远极限来看,社会可能演变为极少数“生产型”个体(由 AI 超级赋能)为绝大多数“消费型”大众创造体验和产品的模式。但短期内,他更为乐观:AI 将自动化所有枯燥、重复的执行工作,从而释放更多人投身于他们真正热爱的创造性活动中。“如果制作视频的机械部分变得简单,而构思和创意部分保留,人们会更倾向于享受后者。” 他预见一个“人人皆可创造”的时代即将来临。
然而,作为这股浪潮的核心推动者,OpenAI 自身也面临着激烈的人才竞争和规模扩张的挑战。当被问及公司是否因增长至近 4000 人而变得官僚化时,Chen 坦承这是领导此类实验室的“最大挑战之一”,必须主动对抗“大公司病”(big company sink)。
他透露,OpenAI 研究团队的人数增长被刻意控制。在公司总体规模翻倍的同时,研究团队仅从去年的 300 多人增至约 400-500 人,增幅约 20-30%。“我讨厌招聘,” Chen 说,“我不希望这里变成那种滋生官僚主义工作的文化。” 他要求每个新成员都必须有“极高的正向边际贡献”,并曾实验性地下令冻结招聘、优化团队。
关于 Meta 等公司以天价薪酬挖角 OpenAI 员工,Chen 提供了一个与媒体叙事不同的视角:“Meta 接触了我的每一位直属下属,他们都拒绝了。” 他强调,OpenAI 无法在所有岗位都匹配外部开出的天价,但可以在战略上选择保留哪些核心人才。最终,公司成功留住了所有高级别研究领导,他们“仍然非常投入”。Chen 相信,许多研究者留在 OpenAI 是因为他们“看到了这里的未来”,这种感觉的价值远超数倍薪酬。
模型行为、偏见与信任的守护
AI 模型如何避免偏见、控制信息传播,以及谁来决定这些至关重要的“行为准则”?这是一个尖锐而核心的问题。Chen 介绍,OpenAI 内部有一个专门的“模型行为团队”(model behavior team),其默认目标是“尽可能中立”。
“我认为我们的工作不是去推崇某一种政治哲学……我们应该在默认设置上非常中立,但让用户可以按照他们希望的方式去引导互动。” 这意味着,如果一个用户希望基于保守价值观与 AI 交流,他应该有能力将模型引导至那个方向——当然,是在合理范围内,避免陷入阴谋论等极端情况。
为了确立这个“中立”的基线,团队投入大量时间在全球范围内进行用户调查。Chen 承认这非常困难,因为“每个人都会给你不同的答案”,但目标是找到最大公约数。当被质疑这种机制可能被外部资金操控时(例如有人出巨资影响模型输出),Chen 强调了经济动机的制约作用:“如果我们那样做,就会失去一半用户的信任。”他欢迎审计监督,并指出模型行为团队的成员本身就具有广泛的代表性,从“你能想象到的最保守的好人”到非常自由派的人士都有。
最后,谈到技术路线图,Chen 分享了一个“热辣观点”:他认为当前业界过早地放弃了预训练(pre-training)的投入,转而过度聚焦于强化学习(RL)。“很多人说 scaling(扩展定律)已经碰壁……我认为这是个糟糕的看法。” 他透露 OpenAI 仍在预训练和模型扩展方面进行大量卓有成效的工作,而外界对此的关注不足。至于 Transformer 架构,他认为在未来一两年内仍将是主流,但也不排除出现架构性突破的可能。
整场对话在 Mark Chen(陈奕名)一个颇具野心的个人使用案例中结束:他正致力于使用 AI 自动化自己的 AI 研究工作。“我的野心是,作为一名专业的研究员,用 AI 来自动化我的工作……当我们到达宁愿把算力花在 AI 研究员而非人类研究员身上的那个点时,我就可以退休了。” 这或许是对 AI 未来最极致也最坦诚的展望:它的创造者,最终也希望被它解放。
OpenAI 研究主管 Mark Chen(马克·陈)谈 GPT-5、开源与 AI 未来撰文:Techub News 整理
导语
在 GPT-5 正式发布并引发全球热议之际,YouTube 知名科技频道主 Matthew Berman 对 OpenAI 研究主管 Mark Chen(马克·陈)进行了一次深度专访。作为 OpenAI 研究团队的负责人,Mark Chen 深度参与了从 Codex 到 GPT 系列模型的核心研发。此次对话正值 OpenAI 发布其迄今为止最强大的模型 GPT-5 以及两款高性能开源模型,Mark Chen 的分享为我们揭示了这家顶尖 AI 实验室在模型架构、数据策略、研发哲学以及对未来智能形态的思考。
摘要
GPT-5 是预训练范式与推理范式的首次深度融合,标志着模型能力维度的根本性扩展。
合成数据在 GPT-5 训练中扮演了关键角色,被用于针对性提升模型在特定领域(如编程)的表现,且其使用比例正在增加。
OpenAI 拥有坚定且长期不变的研究路线图,外部(包括中国实验室的优秀成果)的进展并未动摇其核心研发方向。
OpenAI 2025 年 8 月发布的开源模型旨在为社区设立安全与性能的新标杆,并经过了严格的风险评估框架测试。
未来的 AI 发展将更侧重于提升模型的推理效率、长程记忆能力,并探索智能体协作的组织形态,最终目标是创造能加速科学研究的 AI。
GPT-5:预训练与推理的范式融合
Mark Chen(马克·陈)将 GPT-5 视为 OpenAI 研发历程中的一个重要里程碑。他指出,如果说 GPT-4 是将预训练(pre-training)范式推向极致的成果,那么 GPT-5 则是首次成功将预训练范式与推理(reasoning)范式深度融合的产物。这意味着 GPT-5 不仅继承了大规模预训练带来的广泛知识,还深度整合了类似 O 系列模型的深度思考能力。
这种融合带来了显著的效率提升。Mark Chen 以多模态任务举例:当模型处理复杂的视觉输入并需要从中提取信息时,GPT-5 所需的“思考时间”比前代模型减少了数倍。这种推理效率的提升是全局性的,使得模型能够更快地为用户提供所需的深度分析。其目标是让用户无需手动选择“是否需要推理模式”,模型能自动根据任务复杂度在快速响应与深度思考间无缝切换。
在编程能力上,GPT-5 的进步尤为明显。Mark Chen 透露,内部评估显示,在代码生成任务上,GPT-5 相较于之前的模型(如 GPT-4o 和 o1 系列)取得了超过 70% 的胜率。模型不仅能生成更美观、更健壮的前端代码,其单次对话中能连贯输出的代码量也大幅提升,可轻松突破千行,更能处理现实世界中庞大的代码库。这一切都源于团队将 GPT-5 定位为一款“为开发者量身打造”的模型,并针对长上下文、代码可靠性等实际场景投入了大量精力。
数据策略:合成数据的崛起与挑战
面对外界关于“高质量新数据是否已耗尽”的疑问,Mark Chen 承认数据获取始终是挑战,但并非无法解决。除了持续寻找和授权更多公开数据源,GPT-5 的一个关键创新在于对合成数据(Synthetic Data)的大规模、战略性应用。
由研究员 Sebastian Bubbeck 领导的合成数据项目在 GPT-5 的开发中“结出了果实”。Mark Chen 强调,OpenAI 相信合成数据有潜力提供比人类数据更高质量的内容,并能以超越简单扩充知识面的方式,实质性地改进模型。合成数据并非用于在所有领域平铺直叙地增加数据量,而是被有选择地用于“希望模型表现卓越的特定领域”。编程便是 GPT-5 发布中重点强调的领域之一。
对于行业关于“基于前代模型生成的合成数据只能让后代模型获得边际改进”的质疑,Mark Chen 表示,他们的研究显示合成数据能带来有意义的超越。虽然他不便透露 GPT-5 中合成数据与人类数据的精确比例,但他明确表示:“随着时间的推移,合成数据的占比正变得越来越多。”这预示着合成数据在未来模型训练中的战略地位将愈发重要。
研发哲学:坚定的路线图与“氛围测试”
当被问及是否从中国实验室(如深度求索)近期出色的开源模型和效率创新中汲取灵感时,Mark Chen 给出了一个令人意外的答案:OpenAI 的研究路线图(Research Roadmap)在过去几年中几乎没有改变,即使在外部出现重大突破的背景下依然如此。
他解释道,这份路线图规划了通向 AGI(通用人工智能)的路径,明确了短期、中期和长期的目标。OpenAI 的优势在于对其所选路径有坚定的信念,并专注于执行既定计划,而非对外部进展做出“条件反射式”的调整。例如,推理模型的开发就是路线图中早已确定的核心部分,是 OpenAI 为实现通用智能而独立推进的方向。当然,他也高度赞赏了中国实验室在架构研究和高效内核开发方面的卓越工作,认为其中有值得学习之处。
在决定一个模型何时“准备就绪”发布时,Mark Chen 坦言这“有点艺术性”。团队需要在追求完美与及时部署之间取得平衡。模型必须通过严格的“氛围测试”(Vibe Check)——即在实际使用中感觉良好,没有令人担忧的小毛病或异常行为。他分享了自己的个人测试方法:包括一些前沿的数学问题(如设计一个模 42 的均匀随机数生成器)、生成物理模拟或用户界面以检验代码的健壮性和物理直觉,以及作为创意写作的“思考伙伴”来评估其文风、说服力和理解力。他认为,幽默感目前对模型而言仍是“黄金标准”般的挑战。
开源、安全与社区标杆
谈到2025 年 8 月发布的 200 亿和 1200 亿参数开源模型,Mark Chen 显得非常兴奋。他认为,提供能在笔记本电脑甚至手机上运行的强大模型,将极大降低爱好者、学者和有特殊需求开发者的参与门槛,促进更广泛的创新。
更重要的是,这次开源行动旨在为行业“树立新的标杆”。OpenAI 为此进行了广泛的安全评估。他们运用内部的“预备框架”(Preparedness Framework),从生物、化学、网络安全等多个风险维度对模型进行了测试。评估场景包括:如果有恶意行为者对这些模型进行微调,试图最大化其在网络安全攻击等方面的危险性,其“风险上限”会在哪里?OpenAI 确保这些模型在发布前,其潜在风险低于公司设定的“高风险”阈值。Mark Chen 表示,这是确立“何为安全、负责任的开源发布”规范的一次重要实践。
未来展望:智能体、记忆与自我改进的 AI
关于 AI 的未来形态,Mark Chen 回应了同事 Noam Brown 关于“全能模型”(Omnimodel)与众多专业小模型之争的看法。他认为,拥有一个能处理一切任务的“超级大脑”很有吸引力,它能够以某种方式内化各种子模块。但同时,OpenAI 也致力于构建“组织化 AI”(Organizational AI),即由多个 AI 智能体协作完成高级复杂目标的框架。这类似于思考“组织与个体哪个效率更高”,是一个活跃的研究领域。
当前 AI 应用中的大量“脚手架”(Scaffolding,即复杂的提示工程和上下文管理)在 Mark Chen 看来,是为了弥补模型的能力缺陷。随着模型变得更通用、更鲁棒,对复杂脚手架的需求将会减少。而实现这一点的关键突破之一在于“记忆”(Memory)。模型需要能够处理极长的上下文,容纳用户的全部代码库、文档乃至日常视觉信息,从而能够更自主地代表用户行动,减少频繁的人工干预。
展望未来 6 个月,Mark Chen 最兴奋的是继续推进“推理扩展范式”,探索更多利用测试时计算(test-time compute)的方法,并在强化学习(RL)的优化和目标设计上进行创新。而展望未来 2 年,他期待看到模型在 AI 研究方面达到与他本人同等的效能,最终创建一个能够自主驱动人工智能创新的“自我改进”系统。
最后,对于因 AI 编码能力突飞猛进而感到焦虑的开发者与知识工作者,Mark Chen 给出了乐观而务实的建议:拥抱工具,加速自己。通过学习与 AI 协作,将自己变成效率提升 2 倍、3 倍的超级个体,同时深入理解技术原理并贡献其中。他认为,AI 在自动化某些表面的同时,总会创造出新的、需要人类适应和发挥价值的层面。他坚信,这项技术最终将通过推动科学进步和经济繁荣,提升大多数人的生活质量。
GCSA Agent 在 CyberGym 取得 91.3% 成绩 跻身全球领先 AI 网络安全智能体行列 - GCSAGCSA Agent 在全球高难度真实漏洞基准测试中展现自主漏洞分析与 PoC 生成能力
GCSA Agent 在全球高难度真实漏洞基准测试中展现自主漏洞分析与 PoC 生成能力。
香港,2026 年 8 月 29 日 —— 全球网络安全联盟(Global Cybersecurity Alliance,GCSA)今日宣布,GCSA Agent 在 CyberGym 基准测试中取得 91.3% 的成功率,进入 CyberGym “Leading Systems Above 90%” 领先系统区间。
CyberGym (https://www.cybergym.io/cybergym) 是由美国加州大学伯克利分校研究团队开发的大规模真实世界网络安全评测框架,共收录 1,507 个历史真实漏洞测试实例,覆盖 188 个大型软件项目,旨在评估 AI 智能体在真实漏洞分析场景中的实际能力。
与主要评估代码理解、知识问答或静态分析能力的传统 AI Benchmark 不同,CyberGym 要求 AI 智能体直接面对真实的漏洞代码环境。
在其核心 Level 1 测试中,AI Agent 仅获得漏洞描述以及尚未修复的代码库,需要自主完成代码分析、漏洞定位、攻击路径推理、PoC 构造和执行验证。只有生成的 PoC 能够在漏洞版本中成功触发目标漏洞、同时无法在修复后的版本中复现,任务才被认定为成功。
因此,CyberGym 所衡量的并不仅是 AI 是否“理解代码”,而是 AI 是否能够真正完成从安全分析到漏洞复现和验证的完整过程。
从大模型走向安全智能体
本次 CyberGym 测试中,GCSA Agent 基于 Grok 4.5 与 Grok 4.6 模型运行,最终取得 91.3% 的成功率。
这一结果也反映出 AI 网络安全领域正在发生的一项重要变化:
决定最终安全能力的,不再只是底层大模型本身。
真实漏洞研究通常需要连续完成漏洞描述理解、大规模代码检索、攻击面识别、漏洞假设建立、测试输入生成、程序执行、反馈分析以及 PoC 反复迭代等多个环节。
GCSA Agent 围绕这一完整过程构建智能体化安全工作流。
其目标并非简单地利用大语言模型进行代码分析,而是让 AI 能够进入真实执行环境,围绕安全问题自主形成假设、收集运行证据、执行测试,并最终以可复现结果验证安全发现。
此次 CyberGym 测试,为这一能力提供了一个可量化的外部基准。
面向真实世界的漏洞研究能力
CyberGym 的核心价值,在于缩小传统 AI 测试与真实网络安全研究之间的差距。
其评测环境会恢复软件项目漏洞修复前的代码状态,AI Agent 可能需要在包含数千个文件、数百万行代码的大型代码库中自主定位问题,并最终生成能够真正触发漏洞的 PoC。
更值得关注的是,CyberGym 的进一步研究已经显示,这种智能体化安全能力并不局限于复现已知漏洞。
在开放式漏洞研究实验中,AI Agent 已发现多项此前未知的零日漏洞(Zero-day Vulnerabilities)以及历史上并未完全修复的安全补丁,显示出自主漏洞分析技术向真实漏洞发现能力迁移的潜力。
对 GCSA 而言,这也是更重要的发展方向。
Benchmark 成绩不是终点。
GCSA 的目标,是进一步建立能够服务真实网络安全场景的 AI Security Agent,使其逐步参与漏洞发现、分析、验证乃至后续修复的完整安全生命周期。
构建 AI 原生网络安全能力
随着人工智能加速软件开发,AI 同样正在改变漏洞研究与网络攻防的方式。
面对规模越来越大、复杂度越来越高的软件系统,下一代网络安全体系将越来越依赖人类安全专家与自主 AI 智能体之间的协作。
AI Security Agent 有望帮助安全团队:
* 更早发现具有真实利用价值的软件漏洞;
* 在大型代码库中自动分析复杂攻击路径;
* 自动生成 PoC,对漏洞进行执行级验证;
* 通过真实运行结果降低传统安全检测中的误报;
* 加快漏洞研判、验证与修复效率;
* 扩展专业安全团队能够覆盖的软件与系统规模。
GCSA Agent 在 CyberGym 取得 91.3% 的成绩,是 GCSA 构建 AI 原生网络安全能力的重要阶段性成果。
未来,GCSA 将继续推进自主漏洞分析、AI Security Agent 与智能化网络安全技术研究,将前沿人工智能能力进一步转化为真实世界中的安全能力,为构建更加安全、可信和具有韧性的数字环境提供技术支持。
来源: GCSA全球网络安全联盟
官网: www.gcsa.org比特币已暴跌约 50%,走熊超 10 个月记者丨冯紫彤
编辑丨杨希
视频丨肖航
自2009年比特币网络正式上线运行以来,其价格已经历完整的三轮牛熊周期。
从特征来看,每轮牛市涨幅逐次递减,熊市跌幅逐次收敛;牛市持续时间从早期的742天延长至第三轮的1068天;熊市从第二轮开始持续约12个月,历史平均持续时间为383天。
Coinglass数据显示,8月19日,比特币价格在64400美元上下波动,较2025年10月6日的历史峰值126198美元已然跌去约50%。
这也正是当前市场判断熊市可能近尾声的核心依据。若将峰值日视作该轮熊市的起点,那么这一轮漫长的下行周期已持续317天。若历史重演,拐点或已临近。
这一时间窗口得到了多家机构的呼应。投资研究机构伯恩斯坦在报告中指出,比特币价格可能在上一轮周期高点附近(约6万美元区间)筑底。
Grayscale则分析认为,最终底部可能于2026年底形成,同时也存在提前触底的可能性。
市场技术面,有分析师指出,比特币过去几个月所遭受的技术面损伤可能接近尾声,由ETF资金流、美元走弱和机构买盘推动的反弹将于2026年第四季度末至2027年初启动。
2025年全年,美国现货比特币ETF净流入214亿美元,较2024年的352亿美元有所下降。而进入2026年,形势急转直下。5月中旬至6月初,比特币ETF遭遇连续13个交易日的资金外流,累计流出约44亿美元。
但8月首个完整周,美国现货比特币ETF净流入达8.54亿美元,连续5个交易日保持净流入态势,其中贝莱德集团旗下IBIT贡献了6.94亿美元。这是自4月以来规模最大的连续买入纪录。
需要注意的是,统计样本数量有限,历史经验不代表市场必然会复刻过往走势。同时,市场利空因素依旧显著。美国加密行业立法进程进展缓慢,监管政策存在较大不确定性;若通胀反弹,美联储延续高利率,会持续压制加密货币这类风险资产。即便出现阶段性反弹,高位套牢盘抛压仍会制约上行空间。
此外,市场分析认为,比特币价格在65000美元附近时存在受困筹码与获利了结带来的双重压力。知名比特币批评者、Euro Pacific Capital经济学家Peter Schiff警告,65000美元是卖出良机。研究机构Fundstrat则指出,比特币波动率已创历史低位,未来60天或出现30%的大幅波动。其以64000美元为基准,上行目标约83200美元,下行则可能触及44800美元。
(声明:文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。)Solana 应用 Fomo 24 小时协议收入达 140 万美元,超越 Pump.funTechub News 消息,Solana 生态应用 Fomo 在最新统计周期内实现 24 小时协议收入 140 万美元,超越此前占据主导地位的 Pump.fun。这一数据表明 Solana 应用层竞争激烈,用户注意力与资金流动迅速。
尽管单日收入领先并不意味着 Fomo 已永久取代 Pump.fun 的市场地位,但此次超越反映出 Solana 生态内应用轮动与费用生成活动的活跃程度。Solana 凭借低廉的交易成本和快速结算能力,持续吸引零售用户尝试新的交易体验。
分析指出,若 Fomo 能持续数日或数周保持强劲的收入表现,其市场影响力将更为显著;若收入快速回落,则可能仅为短期关注度爆发。无论结果如何,此次数据变化凸显了 Solana 应用排行榜快速更迭的特性。(Bitcoinist)OpenBMB 发布 MiniCPM5-2B 模型,在 34 项基准测试中平均得分 53.9Techub News 消息,OpenBMB 发布 MiniCPM5-2B 模型,这是 MiniCPM5 系列的第二代检查点。该模型为密集因果语言模型,参数量约 25.2 亿,采用标准 Llama 架构,上下文窗口为 131,072 个 token,并采用 Apache 2.0 开源许可。
在 34 项基准测试中,MiniCPM5-2B 平均得分 53.9,优于同规模基准模型 Qwen3.5-4B(51.1)。该模型在工具使用、代码推理和长上下文检索任务上表现突出,但在通用知识任务上稍弱于更大规模的模型。
OpenBMB 同时开源了训练数据集,包括 Ultra-FineWeb、UltraData-Code、UltraData-Math 等,以及多个中间检查点,以便社区验证其强化学习与策略蒸馏训练流程的效果。 (MarkTechPost)Wintermute 累计持有超 300 万美元 PONS 代币,Arkham 数据显示Techub News 消息,据 Arkham Intelligence 数据,做市商 Wintermute 已累计持有价值超过 300 万美元的 PONS 代币。该代币为 Robinhood Chain 上的启动板代币,近期因 Uniswap Labs 收购其启动板而受到关注。
Wintermute 的持仓行为被视为机构对 Meme 币生态兴趣增长的信号。(Crypto Briefing)瑞银集团要求 2027 年起全球银行与市场部门毕业生及实习生具备 AI 技能Techub News 消息,瑞士银行业巨头瑞银集团(UBS)宣布,自 2027 年起,其全球银行与市场部门的毕业生及实习生职位将把 AI 技能作为必备条件。申请者需在面试中展示如何运用 AI 提升工作成果与效率。
桑坦德银行也已开始招聘具备高级 AI 技能的人才。摩根士丹利预测,未来五年内欧洲银行业将有超过 20 万个工作岗位消失。(The Decoder)BNB Chain 推出 AvengerDAO 安全服务市场,集成 11 家安全团队Techub News 消息,BNB Chain 宣布推出 AvengerDAO 安全服务市场,该平台汇集了 11 家安全团队,为在 BNB Chain 上构建的项目提供包括审计、威胁监控、风险扫描和事件响应在内的综合安全支持。
集成的安全团队包括 HashDit、CertiK、Zokyo、Salus Security、Beosin、GoPlus Security 和 BlockSec 等。此举旨在降低开发者在 BNB Chain 上寻找和获取安全服务的门槛。 (@BNBCHAIN)英国金融监管机构考虑放宽金融预测市场禁令Techub News 消息,英国金融行为监管局(FCA)正在考虑放宽对金融预测市场的禁令。此举可能使公众更容易参与此类市场,提升市场效率,并对传统金融体系构成挑战。
(Crypto Briefing)CoinMarketCap 研究主管:以太坊 DeFi 活动因 Meme 币兴趣回升Techub News 消息,CoinMarketCap 研究主管 Alice Liu 表示,Robinhood Chain 的 Meme 币热潮成为零售资本流向的关键指标,推动以太坊 DeFi 生态活跃度改善。以太坊第三季度涨幅约 66%,受益于超 100 亿美元 ETF 流入及超 150 亿美元企业购币。
Robinhood Chain 于 2026 年 7 月 1 日上线,原定位为代币化现实世界资产桥梁,但 Meme 币交易迅速主导网络活动。其旗舰代币 CASHCAT 市值一度达 2.2 亿美元,链上 DEX 日交易量峰值超 8 亿美元。该季度 DeFi 总锁仓价值约达 880 亿美元。(Cointelegraph)ARK Invest 增持 Robinhood 股票及 3iQ Solana 质押 ETFTechub News 消息,Cathie Wood 旗下 ARK Invest 于 9 月 4 日增持了 Robinhood Markets 股票以及 3iQ Solana Staking ETF。此次买入操作正值美国就业数据强于预期引发市场抛售之际。
ARK Invest 通常在市场下跌时进行“逢低买入”,本次增持反映了其对相关资产的长期看好。(CoinGape)Meta FAIR 发布 AI 研究偏好模型,可提前筛选实验方案节省 GPU 时间Techub News 消息,Meta FAIR 联合牛津大学、伦敦大学学院的研究团队发布 AI 研究偏好模型(RPM),旨在让 AI 研究智能体在执行耗时的 GPU 实验前,对候选实验方案进行排序,仅运行最有潜力的方案。该模型包含仅推理和智能体驱动两种变体,使用冻结的预训练大模型(Qwen3.6-27B),相关框架 AIRA-dojo 和基准 AIRS-Bench 已开源。
在 AIRS-Bench 的测试中,使用 RPM 后,平均归一化得分从随机选择的 0.684 提升至 0.711(仅推理)和 0.729(智能体驱动)。效率方面,两种 RPM 均能在约 15 小时内达到基线模型 24 小时的性能水平,实现约 1.5-1.6 倍的加速。此外,研究在 WinoGrande 和 SVAMP 基准上取得了新的最高性能记录。(MarkTechPost)ARK Invest 研究总监:Robinhood Chain 活动多为投机交易Techub News 消息,ARK Invest 数字资产研究总监 Lorenzo Valente 分析称,Robinhood Chain 不到 1% 交易经 Robinhood Wallet 确认路由,计入未识别合约约 5%,多数活动来自 GMGN、OKX 等外部平台。
该分析师通过 0x Settler 合约追踪 Robinhood Wallet 交易,称该网络吸引「相同的投机者」进入新链,而非 Robinhood 引入独立用户。分析指出,该链目前主要服务现有链上交易者,公共数据在精确识别交易来源方面存在局限。(crypto.news)