OpenAI 首席科学家 Jakub Pachocki(雅各布·帕乔基)与首席研究官 Mark Chen(马克·陈)谈从「氛围编码」到「氛围研究」撰文:Techub News 整理
导语
2025 年 9 月,OpenAI 首席科学家 Jakub Pachocki(雅各布·帕乔基)与首席研究官 Mark Chen(马克·陈)罕见地共同接受了知名风投 a16z 的深度访谈。作为 OpenAI 研究团队的两位核心领导者,他们掌管着当今 AI 领域最高调也最前沿的研究团队之一。本次对话围绕2025 年 9 月发布的 GPT-5、背后的「推理」理念、AI 研究的未来方向,以及如何构建能够持续产生颠覆性创新的研究文化与组织展开了深入探讨。
这不仅是一次对 OpenAI 最新技术成果的解读,更是对这家全球领先的 AI 公司其内部运作模式、未来愿景以及技术哲学的一次难得窥探。在 AI 技术竞争白热化、产品迭代加速的今天,这两位技术领袖的思考,为理解 AI 发展的下一阶段提供了关键线索。
摘要
GPT-5 的核心目标是让「推理」成为 AI 的默认行为,旨在弥合快速响应模型与深度思考模型之间的鸿沟。
OpenAI 的终极研究目标是打造「自动化研究者」,让 AI 能够自主发现新知识,尤其是在数学、编程和基础科学领域。
强化学习(RL)的潜力远未穷尽,其与预训练模型的结合是当前取得持续突破的关键,未来将向更接近人类学习的方式演进。
构建成功研究文化的关键在于「保护基础研究」,给予团队思考长期、根本性问题的空间,并避免陷入短期产品竞争的思维。
从「氛围编码」到「氛围研究」的愿景:当 AI 工具足够强大,创造(编码、研究)将更注重直觉、品味和高层次的构思,而非机械执行。
GPT-5:将推理带入主流
访谈从2025 年 9 月发布的 GPT-5 开始。Jakub Pachocki(雅各布·帕乔基)解释,GPT-5 代表了 OpenAI 将「推理」能力主流化的尝试。在此之前,OpenAI 的模型大致分为两个系列:以 GPT-2/3/4 为代表的「快速响应」模型,以及以 O 系列(如 o3)为代表的「深度思考」模型。前者擅长即时给出答案,后者则需要长时间思考以提供最佳结果。
「从战术上讲,我们不希望用户困惑于该使用哪种模式,」Pachocki 说道。因此,GPT-5 的研究重点之一是识别并确定针对不同提示所需的「最佳思考量」,并将这种选择负担从用户身上移除。他们相信,未来的方向是更多地围绕推理和智能体(Agent)展开,而 GPT-5 正是朝着默认提供推理能力和更智能化行为迈出的重要一步。
Mark Chen(马克·陈)补充道,GPT-5 在多个方面相较 o3 都有所改进,但本次发布的核心焦点无疑是让推理模式触及更多用户。
评估标准:从饱和指标到发现新知识
当被问及如何评估模型进展时,Pachocki 指出,过去几年使用的许多评估指标(Evals)已经接近饱和,例如将准确率从 96% 提升到 98% 不再具有决定性意义。更重要的是,AI 研究范式已经发生了变化。
在 GPT-2/3/4 时代,基本范式是在海量数据上进行预训练,然后用评估指标作为模型泛化能力的标尺。而现在,通过强化学习等技术,可以针对特定领域(如严肃推理)进行深度训练,让模型成为该领域的专家。这虽然能在特定评估上取得极佳表现,但不一定意味着同等程度的泛化能力。
因此,OpenAI 目前更关注能够体现模型「发现新事物」能力的评估。Chen 提到,今年最令人兴奋的进展之一是模型在数学和编程竞赛(如 AtCoder)中的表现。然而,这些竞赛本身也正在被模型「攻克」。
「我们正在准备的下一组评估和里程碑,将涉及在经济相关领域取得实际进展和发现。」Pachocki 强调。这意味着评估标准将从解决已知问题,转向在开放环境中创造新的、有价值的知识。
自动化研究:终极目标与长时推理
当被问及未来 1-5 年的研究路线图时,Pachocki 明确表示:「我们研究工作的核心目标是打造一个自动化研究者,即自动化新想法的发现。」这其中,自动化机器学习研究本身是一个具体方向,但可能显得过于自指。因此,他们也致力于推动其他科学领域的自动化进程。
衡量这一进展的一个好方法是观察模型能够进行有效推理和取得进展的「时间跨度」。目前,模型在类似高中竞赛难度的问题上,已经能够进行大约 1 到 5 小时的连贯推理。OpenAI 的研究重点正是延长这一时间跨度,包括模型制定长期规划的能力以及维持记忆的能力。
这也呼应了评估的问题:「模型能够自主运行多长时间」这类评估对他们来说尤其重要。
Chen 进一步阐述了推理对于长时程操作的核心作用。就像人类解决数学难题一样,需要尝试不同方法,从错误中学习,反复迭代。这种在长时间内保持稳健性的能力,正是深度推理赋予智能体的。
强化学习:持续突破的源泉
自 o1 发布以来,强化学习(RL)已成为 OpenAI 持续取得突破的利器。尽管外界常有预测认为 RL 的收益将趋于平缓或面临模式崩溃等问题,但 OpenAI 的模型性能却一次次打破这种预期。
Pachocki 解释了 RL 如此有效的原因。他认为,RL 是一种非常灵活的方法。OpenAI 在深度学习早期阶段就认识到 RL 的强大,但长期以来的挑战在于如何为 RL 模型提供一个合适的「环境」,使其能够与现实世界或模拟世界互动。语言模型的出现解决了这个「锚点」问题。
「当你在自然语言这个极其丰富和稳健的环境中进行预训练后,就获得了在此基础上去追求不同目标和想法的能力。」将深度学习的通用学习能力与 RL 的目标导向训练相结合,产生了巨大的化学反应。Pachocki 称这是过去几年 OpenAI 研究中最令人兴奋的阶段,他们发现了许多新方向和有前景的想法,并且都在不断取得成果。
对于希望利用 RL 的企业或研究者,Chen 的建议是:「最重要的是不要认为现状会永远持续。」就像两年前大家关注如何构建微调数据集一样,他认为奖励建模等方式也会快速演变,最终会向着更简单、更接近人类学习的方式发展。
从「氛围编码」到「氛围研究」
作为曾经的竞技程序员,Pachocki 和 Chen 对 AI 在编程领域的进步感触颇深。Chen 分享了一个故事:上周末他与一些高中生交谈,他们表示,「现在默认的编码方式就是『氛围编码』。」 对他们而言,亲手从头编写所有代码反而成了一个奇怪的概念。为什么不用 AI 来辅助呢?
这启发了 Chen:「我希望未来将是『氛围研究』。」 当 AI 工具足够强大,研究过程也将更侧重于直觉、品味和高层次的构思,而将繁琐的执行和验证交给 AI。
那么,什么造就了伟大的研究者?Pachocki 认为,「毅力」是关键。研究是在探索未知,尝试的事情大概率会失败。因此,研究者需要处于一种「准备好失败并从中学习」的心态,同时对自己的假设保持绝对诚实。既要对自己的想法有信心并坚持不懈,又要能清醒地判断进展,及时调整。
Chen 补充,经验至关重要,这能帮助你判断问题的难度是否合适,并管理自己在长期研究中的情绪。通过与同事交流、阅读优秀论文来培养对「有趣问题」的嗅觉,也是研究过程的一部分。
构建并守护顶尖研究文化
作为 OpenAI 研究团队的领导者,Pachocki 和 Chen 如何吸引并留住顶尖人才?Pachocki 指出,最根本的动力在于 OpenAI 致力于基础研究的使命。他们不热衷于关注竞争对手发布了什么模型,而是专注于前沿创新。「人们为这一使命所激励。」 此外,建立良好的文化、培养人才的管道,以及拥有深厚的人才储备(「深板凳」)也至关重要。
在招聘上,他们不仅仅寻找在社交媒体上最活跃的人,而是看重「在任何领域解决过难题」的能力。许多最成功的研究者在加入 OpenAI 之前,曾在物理、计算机科学或金融等其他领域工作,具备扎实的技术基础和解决雄心勃勃问题的意愿。
「保护基础研究」是创造制胜文化的关键。Chen 解释,必须确保研究者有空间去思考未来一两年真正重要的问题,而不是被短期产品需求所牵扯,或陷入与其他实验室的发布竞赛中。「我们需要确保人们有这种舒适感和空间去思考:事情在一两年后会变成什么样子?」
平衡研究与产品是另一个挑战。他们的做法是明确区分一批真正关心产品、对产品成功负责的研究者,让他们与产品团队紧密协作。同时,公司领导层也充分认同并支持研究的长期愿景,明白当前的产品并非终点,而是与研发共同构想未来。
资源、计算与恒定的挑战
在资源分配上,管理不同项目间的计算资源是两位领导者的重要工作。他们坦言,历史上更多的计算资源流向了核心算法推进,而非产品化研究,但这种分配是动态且灵活的。
当被问及如果增加 10% 的资源会投向哪里时,Pachocki 的回答是:「计算。」 他认为,关于「我们将很快进入数据约束阶段」的说法并不准确,计算资源在可预见的未来仍将是决定性因素。「任何这么说的人,只需要在我的职位上干一周,就会发现没有人会说『我拥有所有需要的计算资源』。」 Chen 笑着赞同道。
最后,当被问及在 AI 飞速发展的浪潮中,有哪些原则应该保持不变时,Pachocki 提到了更广泛的物理限制,如能源,以及未来机器人技术将带来的新约束。但在智能前沿,「我不会做太多假设。」 保持开放和学习的心态至关重要。Chen 则分享了保持团队高速运转的「秘诀」:OpenAI 的研究文化让他从未感到学习停滞,总有新的突破和成果涌现,需要全力以赴才能跟上,这种持续的挑战感和成长感正是驱动力。
OpenAI 开源 Codex Harness,是几个意思撰文:硅谷 Alan Walker
一周之内三家公司做了同一件事,这才是重点2026 年 8 月 20 日California Ave 的酒吧,第二杯还没喝完,群里已经在传「OpenAI 全面开源 Codex Harness」——但真正值得看的不是这一条消息,是它前面六天里发生的另外两件事。01 先把话说准:开源的到底是什么8 月 19 日,OpenAI 开发者博客发了一篇《Codex as a platform: build on the open agent harness》。中文圈翻成了"全面开源"。这个说法有两处不准,得先修掉,不然后面全是错的。
第一,不是新开源。Codex CLI 从 2025 年 4 月发布起就是开源的,用 Rust 写的,MIT / Apache2.0 许可。8 月 19 日这篇不是一次代码发布,是一次定位发布——把已经开源的一堆东西,重新包装成"平台"这个叙事。新东西是 app-server 协议、官方 SDK,和一整套"怎么把 Codex 装进你自己产品里"的说明书。
第二,也是最关键的——不是"全面"。OpenAI 在文章里写得清清楚楚:开源的是 harness 和集成层,模型访问与托管服务 仍然是分开的。先解释一下 harness 是什么模型只会做一件事:给它一段文字,它吐一段文字。它不会读文件、不会跑命令、不会等你点"同意"、不会记住上一轮干了啥。harness 就是包在模型外面、让它能干活的那一整套东西:怎么找上下文、怎么调工具、怎么控制沙箱权限、什么时候停下来要你批准、怎么把上一轮的结果接到下一轮。
模型是发动机,harness 是变速箱、方向盘、刹车和仪表盘。OpenAI 送出去的是车壳和底盘,发动机还锁在自己车间里。02 时间线:三家公司,七天把日历摊开,这件事的性质就完全变了。2026 年 8 月,harness 层的一周8 月 13 日 - DeepSeek 发布 DeepSeek Harness v0.1,MIT 许可,GitHub 开放下载,公开对标 Claude Code。同日发布 V4-Pro,原生支持 OpenAI Responses API,并且直接集成 Codex。8 月 18 日 - Block(Square 和 Cash App 的母公司)开源 Berd——一个本地桌面应用,用一个界面同时管 Goose、Claude Code 和 Codex。8 月 18 日 - Anthropic 的 Claude Code CLI 发布 v2.1.229 性能修复,把 p99 CPU 占用从 24% 压到 10%(改了 Bun 垃圾回收的调度方式)。8 月 19 日 - OpenAI 发布《Codex as a platform》。看出来了吗?harness 这一层,在这七天里被三家公司同时按到了"免费"这个价格上。DeepSeek 用 MIT 许可送,Block 直接送了个统一壳子,OpenAI 第六天出来说"我们的也是开源的,而且是标准"。
这一段是全文的地基你没法卖一样马上就要免费的东西。你只能决定,要不要当那个把它送出去的人。DeepSeek 在 8 月 13 日把时钟按下去了。OpenAI 在 8 月 19 日回答的,不是"我要不要开源",而是"这件事的署名权归谁"。时间差只有六天,这不是巧合。
一句话解读把这理解成 OpenAI 主动出招,会误判它的处境。更准确的说法是:它抢在别人之前,把一个已经保不住的东西送了出去,并且要求署名。03 那句最容易被跳过的话整篇公告里最重要的一句,藏在中段,语气平淡到几乎让人跳过去:"开源的这一层是 harness 和集成界面;模型访问 与 托管服务 保持独立。"这一句话把整件事的结构说完了。而且它有一个现成的、所有人都见过的模板——举个例子 · 安卓
安卓是开源的。任何人都可以拿 AOSP 源码去改、去发行、去做自己的手机系统。但 Google 移动服务(GMS)——应用商店、地图、推送、账号体系——不开源。结果是什么?十几年过去,能 fork 安卓的公司有几十家,能在没有 GMS 的情况下把手机卖到全球的,几乎没有。Google 送掉了操作系统,留下了操作系统之上那层让它值钱的东西。
Codex harness 就是 AOSP。模型访问加托管服务,就是 GMS。
这个结构的精妙之处在于:送掉的那一层,本来就快没有定价权了;留下的那一层,定价权在变强。04 为什么 harness 突然这么重要要理解 OpenAI 为什么肯送,得先理解 harness 到底能带来多大差别。公告里给了一个数,我认为是全文最硬的一个数据点。同一个模型,换一套 harness
模型 - GPT-5.6 Sol,一字未改测试 - ARC-AGI-3改动 - 只改了两个 harness 设置:保留推理链(retained reasoning)+ 上下文压缩(context compaction)结果 - 得分从 13.3% 升到 38.3%,同时输出 token 减少到原来的 六分之一
把这个数分析一下:模型没动,只动了外面那层壳,能力接近翻了三倍,成本降到六分之一。一句话解读这意味着在今天这个阶段,harness 对"你实际能拿到多少智能"的影响,可能比换一代模型还大。那么一个反直觉的推论就出来了:如果外面这层壳的杠杆有这么大,而全世界大部分人的壳都做得很烂,那就等于你的模型一直在被别人的烂壳测量、被低估。把自己的壳开源,是最省钱的一种自证——让所有人在评估你的模型时,用的是你自己调好的那套。
再看两个技术细节,能佐证这不是营销文案:网络成了瓶颈。OpenAI 工程师在 AI Engineer World's Fair 上讲过,当 GPT-5.3 Codex Spark 在 Cerebras 硬件上跑到每秒 1000 个 token 时,卡住的不再是推理速度,是 网络往返。于是他们把 harness 从 HTTP 请求改成了 WebSocket 长连接。推论:推理已经快到让"管道"成为限制。这条路继续走下去,harness 的重要性只会更高。
工具太多会撑爆上下文。harness 里用了"延迟工具"和"工具搜索"两个设计,目的是别把几百个工具定义一股脑塞进上下文。MCP 生态铺开之后,这是一个真实的、马上会撞上的工程问题。05 是冲着 Anthropic 上市来的吗
先说时间:Anthropic 6 月保密递交招股书,市场预期 9 月或 10 月 上市,传的目标估值 2 万亿美元。OpenAI 8 月 19 日 发这篇。正好落在路演窗口里。但要判断它有没有杀伤力,得先看杀伤路径是什么。Anthropic 的估值故事里,有一条很关键的支柱:Claude Code 是稀缺资产。它长得快、赚钱、而且是 闭源 的——外面买不到。第三方追踪的数字是 Claude Code 占 Anthropic 总 ARR 约 22%。OpenAI 这篇文章要传达的,正好是这条支柱的反面:
攻击点agent 的那个执行循环,不是稀缺资产。它是基础设施,而且我们免费送,还带 SDK 和示例应用。如果市场信了这一句,Claude Code 就从"稀缺资产"变成"做得比较好的一个实现"。倍数会跟着这个判断走。但我要把这个判断的边界说清楚,不然就是危言耸听:它打的是 叙事,不是报表。harness 免费,不代表模型免费。Claude Code 的收入来自 token 消耗和席位订阅,不来自卖 harness——Anthropic 从来没卖过 harness。所以短期内这一击落不到损益表上。
它只够到 22%。另外 78% 是 API 和企业业务,跟 harness 是不是开源基本无关。路演窗口里,叙事就是钱。承销商定价靠的是可比公司和故事强度。在这个特定的六周里,"编程 agent 是不是稀缺资产"这个问题的答案,值真金白银。一句话解读时间点太巧了,说完全没有考虑对手的上市窗口,不太可信。但把它读成"OpenAI 为了打击 Anthropic 才开源",会看错因果——DeepSeek 已经在六天前把这层送出去了,OpenAI 不跟就是白丢署名权。对上市窗口的伤害,更像是一个顺手的副产品,而不是主要动机。06 做 harness 的创业公司,生意没了
这是所有影响里最直接、最没有悬念的一条。一家创业公司如果原来的定位是"我们做一个更好的 agent 运行时/执行循环/CLI 工具",那么从 8 月 19 日起,它的融资材料需要重写。理由很简单:agent 执行循环 → 免费(MIT / Apache 2.0,Rust 写的,生产级)客户端协议 → 免费(app-server,有完整文档)编程接口 → 免费(官方 Codex SDK)可参考的完整实现 → 免费(Relay 示例应用,带 MCP 工具和人工审批)
另一家的同类品 → 免费(DeepSeek Harness,MIT,6 天前)OpenAI 甚至没有用"竞争"这个动作。它在文章里直接对创业者说:别去 复刻 一个换了 logo 的 Codex app,去做那些我们不做的东西——你自己的界面、你自己的上下文、你自己的工具、你自己的审批流程。
举个例子这套打法有个老名字,叫「把互补品做成白菜价」。Google 免费送安卓,是为了让手机变便宜,好让更多人用搜索。Meta 免费送 React 和 PyTorch,是为了让前端和 AI 人才用它的标准长大。你送掉的东西越不值钱,你留下的东西就越值钱——前提是这两样必须一起用。那还剩什么能做?三块,而且都不在运行时这一层:垂直的上下文和工具。报税、安全事件响应、供应链调度——OpenAI 自己点名说这些归你。Thrive Holdings 和 Crete 做的报税 agent 处理了 7000 份报税表、把准备时间砍掉约三分之一,这是个真实的样本。
评测与可观测。agent 跑错了怎么发现、怎么归因、怎么回归测试。这一层还没有标准答案。跨模型的编排层。Block 的 Berd 就是这个方向——一个界面管三家的 agent。但要注意,Block 自己把它开源了,说明这一层也很难直接卖钱。07 对 DeepSeek、Kimi 是帮忙还是下套
这是全文我认为最值得想清楚的一节,因为直觉给的答案是错的。表面上:这是天大的好事harness 开源了,理论上任何开源模型都可以塞进去跑。DeepSeek 也确实立刻这么做了——V4-Pro 原生支持 OpenAI 的 Responses API,并且直接集成 Codex。国产开源模型的开发者体验,一夜之间接上了世界上打磨得最好的那套壳。往下一层:接口的定义权归谁
问题在于,DeepSeek 为了接进这套壳,做了一件事——它让自己的 API 去 兼容 OpenAI 的 schema。而 Responses API 的规范,现在由一个多厂商机构治理,成员包括 Nvidia、Ollama、LM Studio。这一段是重点
把自己的 API 交给一个标准组织去治理,看上去是放权。实际效果是相反的:标准组织会让一个原本属于某一家的设计,变成所有人的默认。标准委员会几乎从不推翻发起者的架构,它们的工作是把它固化下来、发给全行业。举个例子这就像所有电器厂商都同意用同一种插座。听起来很公平——直到你意识到插座的形状是其中一家画的。之后每一个新做电器的人,都得先量一遍那个孔位。做电器的可以随便竞争、随便降价,但"什么叫能插上"这件事,永远由画孔位的人定义。
后果:模型从"平台"降级成"零件"顺着这条路走下去,会发生一件对开源模型很不利的事:用户的工作流、记忆、插件、技能、审批规则、上下文管理策略——全都活在 harness 里,不在模型里。模型变成了那个可以 随时被拔下来换掉 的部分。好消息是:换模型变容易了,DeepSeek 和 Kimi 可以靠价格和权重抢份额。坏消息是:换模型变容易了。你抢来的份额,明天同样可以被下一家用同样的方式抢走。把它说完整开源 harness,把模型之间的竞争,从平台战争降级成了零件比价。而在零件比价里,价格一定往下走,利润归那个定义了插孔的人。
所以对 DeepSeek、Kimi 这类开源模型来说,这一步短期是实打实的助力—— 分发成本骤降,开发者能立刻用上。长期是一个结构性的陷阱——你越好用,就越证明"模型是可替换零件"这个命题,而这个命题成立之后,最难赚钱的恰恰是做零件的。一句话解读
OpenAI 没有拦着开源模型进场。它做的是把场地铺好、把规则写好,然后欢迎所有人进来打——在它画的球场上。08 商业模式:送中间,收两头把整条价值链摊平,OpenAI 的取舍一目了然。最底层 - 模型权重、推理算力、托管服务、企业管控 → 收钱,且不开源
中间层 - agent 执行循环、客户端协议、SDK、CLI → 免费送出上层 - 界面、垂直上下文、工具、审批流 → 交给开发者做最上层 - ChatGPT 约 10 亿月活、插件生态、结算与广告 → 收钱,且不开源注意最后一行。翻 OpenAI 开发者文档的侧边栏,能看到 Commerce(结算)和 Ads(广告)两套完整 API——商品目录、转化追踪、广告主账户、竞价、效果衡量,一应俱全。
这才是终局的形状:免费送掉中间那层没有定价权的管道,把流量入口和结算入口这两头攥死。
举个例子你可以把 harness 想成高速公路,OpenAI 免费修、免费让所有人跑。但加油站是它的(模型和算力),路尽头那座城是它的(10 亿月活的 ChatGPT),城里收租和收广告费的也是它(结算和广告 API)。路修得越好、跑的车越多,两头越赚钱。修路这件事本身赚不赚钱,根本不重要。顺带回答"是不是为了资本市场":是,而且很有效。"我们有一个很好用的编程 app"和"我们是 agent 时代的平台层",在募资材料里是两个完全不同量级的故事。前者的对标是一家软件公司,后者的对标是安卓和 Windows。09 数字与摩擦
几个能 量化 的东西,正反都列出来。往上的· 用户规模:Codex 从 2026 年 3 月的 200 万周活,到 8 月约 1000 万月活。OpenAI 整体约 10 亿月活。· 已经接进来的:GitHub 和 JetBrains 把 Codex 作为 agent provider 接入了自己的 IDE(7 月 7 日);Cisco 用 Codex SDK 做了 Cloud Control 里的 App Builder;Thrive Holdings 与 Crete 的报税系统跑了 7000 份报税表。
· 内部自证:OpenAI 的 harness 团队从 2025 年 8 月到 2026 年 1 月,用 agent 写出了 100 万行生产代码、1500 个合并 PR,期间没有一行源码是人手写的;团队到七个人时,稳定在每人每天3.5 个 PR。10 Anthropic 手里还有什么牌
这一节必须写,否则前面九节就是选择性叙事。Anthropic 在这件事上真实的暴露面是:Claude Code 的 harness 是闭源的。如果行业在一套开放 harness 加一套开放协议上标准化了,Claude 的处境就会变成"一个可以插进去的模型",而 Claude Code 那套完整体验的差异化,会越来越难讲清楚。这是真的风险,不该回避。
但棋盘上还有另外一半:值得注意的事实OpenAI 这篇公告里,MCP 出现了七次以上——"应用自有的 MCP 服务"、"MCP 工具"、Relay 示例应用的工具层,全部建立在 MCP 之上。MCP 是 Anthropic 提出并开源的协议。再翻一层:OpenAI 的开发者文档里,有一个页面叫 "Submit a Claude Code plugin"。所以真实的格局,比"OpenAI 围剿 Anthropic"复杂得多:
Anthropic 拿下了 工具协议层。MCP 已经是事实标准,连对手的旗舰产品都建在上面。OpenAI 正在拿下 执行循环层 和 API schema 层。harness 加 Responses API。两家都在对方的地基上盖房子。这不是一方吃掉另一方,是两个标准体系在互相咬合。一句话解读这一层的竞争,赢面不在"谁的产品更好",在"谁定义的东西被更多人当成默认"。到今天为止,工具怎么接是 Anthropic 说了算,agent 怎么跑是 OpenAI 说了算。两家各拿了半张牌桌。11 写在最后
回到最开始那个问题:到底是几个意思?我的答案是,主要是三个意思,重要性递减:第一,抢署名权。DeepSeek 8 月 13 日已经把 harness 用 MIT 送了出去,Block 8 月 18 日送了个统一壳子。这一层的价格已经是零,OpenAI 唯一能争的,是"这套标准是谁定的"。它在第六天出手,争到了。第二,把智能的度量权收回来。同一个模型,换两个 harness 设置,得分从13.3% 到38.3%,token 降到六分之一。当外壳的 杠杆 有这么大,你就不能容忍全世界用别人做的烂壳来评估你的模型。开源自己的壳,是最 省钱 的自证方式。第三,把中间那截不赚钱的管道送掉,把两头攥紧。底下是模型和算力,上头是 10 亿月活加结算和广告。中间那截,本来就没有定价权。
至于"打击 Anthropic 上市"——时间点太巧,不信它完全没考虑过。但把它当成主要动机,会看错这件事的因果方向:OpenAI 不是在选择进攻,它是在被推着做一件不做就吃亏的事,然后顺手把动作做得很漂亮。真正需要盯的,是九月十月两件事撞在一起:Anthropic 的 招股书,和第一批真正建在 Codex app-server 上的第三方产品。前者会把叙事换成审计过的数字,后者会告诉你这套标准到底有没有人真的用。
核实说明一、已核实(一手来源)· OpenAI 开发者博客《Codex as a platform: build on the open agent harness》,2026 年 8 月 19 日,作者 Nicolas Bonamy、Derrick Choi。文中关于 harness 定义、三种集成方式(codex exec / Codex SDK / app-server)、Relay 示例应用、以及"开源层为 harness 与集成界面,模型访问与托管服务保持独立"的表述,均直接来自该文。
· ARC-AGI-3 数据:保留推理与上下文压缩使 GPT-5.6 Sol 得分从 13.3% 升至 38.3%,同时输出 token 减少至六分之一——来自该文引用的 OpenAI 官方页面。· 已公开的采用方:GitHub 与 JetBrains(2026 年 7 月 7 日)、Cisco App Builder、Thrive Holdings 与 Crete 的报税系统(7000 份报税表、准备时间约减三分之一),均在该文中列出并附官方链接。
· OpenAI 开发者文档确实包含 Commerce 与 Ads 两套 API,以及名为「Submit a Claude Code plugin」的页面(见开发者站导航结构)。· DeepSeek Harness v0.1 于 2026 年 8 月 13 日发布,MIT 许可、GitHub 开放,公开对标 Claude Code;同日 DeepSeek-V4-Pro 发布,原生支持 OpenAI Responses API 并集成 Codex(VentureBeat,8 月 13 日)。
· Codex CLI 于 2025 年 4 月首发;2026 年 3 月超过 200 万周活(Wikipedia 引 Reuters 等)。二、单一来源 / 需二次核对· harness 用 Rust 编写、MIT / Apache2.0 双许可,Responses API schema 由含 Nvidia、Ollama、LM Studio 的多厂商机构治理,以及 WebSocket 改造与「延迟工具/工具搜索」设计——来自 OpenAI 工程师 Dominik Kundel 在 AI Engineer World's Fair 的演讲报道(BigGo Finance 转述),未核对演讲原始录像。
· Codex「约 1000 万月活」与 OpenAI「约 10 亿月活」来自 The Deep View 的独家报道,非 OpenAI 官方披露。· harness 团队 100 万行代码、1500 个 PR、零人工手写代码、每人每天3.5 个 PR——来自 OpenAI《Harness engineering》博客及第三方转述(SaaSCity),数字口径未独立复核。
· Block 于 2026 年 8 月 18 日开源 Berd、Anthropic Claude Code CLI v2.1.229 的 p99 CPU 优化数据,均来自 explainx.ai 的行业汇总,未见双方官方公告原文。· Claude Code 占 Anthropic 总 ARR 约 22%,来自第三方追踪机构 TickerTrends 的估算,非 Anthropic 官方披露。Anthropic 从未单独公开 Claude Code 的 ARR。· Anthropic 2 万亿美元 IPO 目标估值为媒体转述的市场预期,非公司公开表态。
三、作者推断(非事实)· 「OpenAI 是被 DeepSeek 8 月 13 日的动作推着走、争的是署名权而非主动进攻」——这是基于时间线的推断,OpenAI 从未如此表述,也不排除其内部早有此规划。· 安卓 / GMS 的类比、「插座孔位」的类比、以及「开源 harness 把模型从平台降级为零件」的结论,均为作者判断。· 「打击 Anthropic 上市窗口更像顺手的副产品而非主要动机」为推断,无任何内部信息支持。
· 对 harness 创业公司剩余空间的三点判断(垂直上下文、评测可观测、跨模型编排),为作者判断。· 「工具协议归 Anthropic、执行循环归 OpenAI,两家各拿半张牌桌」为作者对当前格局的概括,随时可能被新事件推翻。四、重要提示· 本文由 Claude(Anthropic 制造)协助撰写,核心议题涉及 OpenAI 与 Anthropic 的直接竞争,存在最直接的利益冲突。第十节已尽量写出 Anthropic 真实的暴露面,但读者仍应假定本文存在无法完全消除的偏向。· 「全面开源」是媒体表述,不是 OpenAI 的表述。OpenAI 明确说明模型访问与托管服务不在开源范围内。
· 本文不构成投资建议。—— Kea
DeepSeek做了一款"不是模型"的产品Harness,却可能比模型更重要8月13日晚,DeepSeek没有发新模型,而是开源了一个叫Harness的东西。
一天之内,GitHub星标近8万。这个速度超过了当年R1和Grok-1的纪录。
Harness不是模型权重,不是API接口,而是一层"壳"——套在模型外面、让模型真正能干活的执行系统。DeepSeek给了一个公式:Model + Harness = Agent。
翻译一下:模型负责想,Harness负责干。
为什么DeepSeek要做这个?
这个问题才是整件事最有意思的部分。
就在Harness发布之前,DeepSeek的API文档里列了十几家第三方Agent集成工具——Claude Code、Codex、Cursor、Copilot……什么都有,唯独没有自家的Agent产品。模型是它家的,干活的手是别人家的。
这就像一个造了顶级发动机的人,发现所有整车厂都在用他的引擎,但方向盘、底盘、变速箱全是别人的。他决定自己造一辆完整的车。
更深层的原因是:同一个模型被放进不同的Agent系统,表现可能差出一大截。模型只负责预测下一步,真正决定体验的是Harness——它决定模型能看到什么上下文、能调哪些工具、出错怎么重试、什么时候算任务完成。
没有Harness的强模型,本质上只是"很贵的自动补全"。
"一切皆插件"到底意味着什么
Harness的核心设计原则写在官网首页:Everything is a plugin。
大多数Agent框架只在工具层开放扩展——加个搜索工具、接个MCP服务器,到头了。DeepSeek Harness把插件边界一路下沉到了运行时底层:模型适配器、工具、技能、会话、沙箱、存储、Agent循环、调度、甚至UI,全是可替换的插件。
整套架构基于Cordis插件元框架构建。开发者不需要改源码,只在配置文件里调整插件清单,就能换模型、换沙箱、换循环逻辑、换整个界面。
这跟LangChain、LangGraph那类编排库的思路完全不同。LangGraph是在框架里画流程图,节点和边写死了;Harness是给你一块巨大的洞洞板,每个零件都能拔下来换掉。
四种运行模式本质上就是同一套插件的四种组合方式:
标准模式:全副武装,文件编辑、shell、搜索、子Agent、工作流,日常开发直接用。
PTC模式:模型不是一步步调工具,而是先写一段TypeScript代码,用代码编排多轮调用——适合复杂多步任务。
极简模式:只留shell和文件编辑两个工具,专门用来做模型基准测试。V4-Flash的Agent跑分就是用这个模式跑的。
创造模式:实时检查运行时、在内存里试验插件、拼出新的运行模式——这是给框架开发者准备的实验室。
和Claude Code、Codex有什么不同
直接对标的是Anthropic的Claude Code和OpenAI的Codex。三者都意识到执行层是模型能力落地的最后一环。
但路径截然不同:
Claude Code是闭源成品,开箱即用,体验丝滑,但编排核心不开放,模型天然优先Anthropic。你用它,就得按它的规则玩。
Codex是OpenAI的托管Agent方案,同样闭源,深度绑定GPT系列。
DeepSeek Harness选了最难走的路:开源、MIT协议、模型中立。它支持DeepSeek、Anthropic、OpenAI、Bedrock、Vertex、Azure以及任意OpenAI兼容端点。你不一定非得用DeepSeek的模型——你可以把Harness当成一个通用的Agent底座来用。
这意味着什么?意味着DeepSeek赌的不是"我的模型最好",而是"我的壳最好,你用我的壳,大概率还是会选我的模型"。
这个策略很精明。框架是入口,模型是变现。Harness免费开源,但跑Agent需要消耗模型token——而DeepSeek刚刚把API价格涨了。
一个设计细节值得单独说
Harness有一个看似不起眼但极其关键的设计:append-only会话日志。
模型看到的一切——系统提示词、思维链、工具调用结果、子Agent调度、每一次上下文注入——都被写进一条只追加不修改的事件流。恢复、分叉、检索、回放全部基于同一条事件流。
这解决了一个Agent开发中非常痛的问题:长任务跑着跑着挂了,你想从断点恢复,但你不知道模型当时到底看到了什么。如果上下文只活在内存里,一恢复就串味。Harness让任务状态有了"唯一事实来源"。
这个设计思路,跟分布式系统里的event sourcing一脉相承。
结语:AI竞争的战场正在转移
DeepSeek Harness把开源竞争的边界从模型延伸到了Agent工程体系。
之前大家比的是上下文窗口多大、跑分多高、价格多低。现在DeepSeek把竞争推到了一个新的维度:谁的Agent跑得稳、扩得动、生态建得起来。
当然,v0.1只是开发者预览版,官方明确警告"会有破坏兼容性的改动"。仓库超过230个workspace成员,架构野心很大,但离生产级稳定还有距离。现在就说颠覆谁,为时过早。
但三个信号已经很清楚了:
第一,模型厂商的下一个战场不是模型本身,而是执行层和反馈闭环。
第二,"一切皆插件"的微内核架构,可能成为Agent框架摆脱单体瓶颈的主流方向。
第三,谁掌握了Harness,谁就更接近真实任务入口——进而影响模型选择、工具分发和开发者工作流。
DeepSeek造了一个发动机,现在又造了一辆车。至于这辆车能跑多远,取决于有多少人愿意在它上面装自己的零件。
CEX、DEX 与 AI Agent:融合交易基础设施优势,进入智能化链上金融新时代CEX 时代:交易效率如何推动数字资产走向规模化
加密交易基础设施的发展,本质上是一场围绕效率、信任与智能化能力展开的演进。
中心化交易所(CEX)是数字资产市场规模化发展的重要推动力。在早期阶段,区块链解决了资产发行和价值转移的问题,但实际交易仍面临链上确认效率限制、流动性不足、操作复杂以及用户进入门槛较高等挑战。
CEX 通过中心化撮合系统解决了这些问题,将复杂的区块链交互转化为更接近传统金融市场的交易体验。CEX 的核心贡献不仅是提供交易入口,更是建立了数字资产市场的效率基础:
- 高效交易执行:通过订单簿系统提高交易速度与稳定性。
- 集中市场流动性:提升市场深度,降低交易成本。
- 简化用户体验:降低用户进入数字资产市场的门槛。
CEX 完成了行业发展的重要阶段:让更多用户能够参与数字资产交易。
DEX 的出现:从机构信任到链上协议驱动的金融体系
随着区块链基础设施成熟,去中心化交易所(DEX)开始重新定义交易中的信任机制。DEX 的意义并不是简单取代 CEX,而是改变金融系统中信任的来源。
传统模式:用户 → 平台 → 交易执行
DEX 模式:用户钱包 → 智能合约 → 链上执行
通过智能合约,交易规则由代码定义,执行过程由区块链验证。
DEX 带来了三项重要变化:
1. 资产自主权:
用户可以直接管理资产,并通过钱包参与交易。
2. 交易透明度:
交易记录、资金流向和执行逻辑均可以通过链上数据验证。
3. 开放金融生态:
DEX 成为连接流动性、借贷以及其他 DeFi 应用的重要基础设施。
DEX 建立了数字资产市场的信任层,让金融系统更加开放和透明。
CEX 与 DEX 的融合:下一代交易基础设施需要多层能力结合
CEX 与 DEX 并不是简单的竞争关系,而是解决不同阶段的行业需求。
CEX 建立了交易效率层:提供速度、流动性以及成熟的用户体验。
DEX 建立了链上信任层:提供透明度、资产自主权以及开放金融能力。
未来的发展方向并不是其中一种模式取代另一种,而是不同基础设施能力的融合。然而,当交易环境越来越开放,新的问题正在出现:市场已经不再缺少数据,而是缺少理解数据的能力。
从链上数据到智能决策:AI Agent 成为交易系统的新智能层
区块链创造了一个高度开放的数据环境。
每天链上产生大量信息,包括资金流动、钱包行为、流动性变化、市场趋势以及资产之间的关联关系。但数据公开,并不代表数据具有价值。
下一阶段交易基础设施需要解决的问题是:
- 如何从复杂数据中识别有效信号?
- 如何判断市场变化?
- 如何形成更合理的策略?
AI Agent 正是在这一背景下进入链上金融体系。
它并不是简单替代人工交易,而是成为连接:
链上数据 → 市场分析 → 风险评估 → 策略执行
交易系统正在从获取信息,走向理解信息。
SuperFlow:融合数据、智能与执行的下一代链上交易基础设施
未来交易基础设施的发展方向,不会是 CEX 与 DEX 的单一竞争,而是效率、透明度与智能能力的融合。
CEX 提供交易效率。DEX 提供链上透明与资产自主。AI Agent 提供数据理解与智能决策能力。SuperFlow 探索的方向,正是在这些基础能力之上,构建 AI 驱动的链上交易基础设施。
通过:
数据 → 智能 → 策略 → 执行
将公开链上数据转化为智能分析,并进一步形成策略支持。
未来交易平台的核心竞争力,将不只是更快的执行速度或更大的流动性规模,而是谁能够:
- 更深入理解市场
- 更有效管理风险
- 更智能执行策略
从中心化交易所,到去中心化交易所,再到人工智能智能体,交易基础设施正从单纯的交易平台,迈向智能金融基础设施。
关于 SuperFlow
SuperFlow 是面向 Web3 金融市场打造的新一代 AI 驱动交易操作系统。它将市场数据、流动性、策略生成、交易执行、风险控制与收益归因整合为系统化的交易能力。
不同于仅提供交易入口的传统平台,SuperFlow 通过 AI 决策与多市场执行能力,将交易从依赖个人判断,升级为可规模化运行的系统能力。
SuperFlow 的核心由 SUPER AGENT 与 SUPER Token 价值层共同驱动。SUPER AGENT 作为 AI 交易引擎,支持市场分析、信号筛选、策略生成、资金调度、交易执行与风险管理。
SuperFlow 不只是一个交易平台,而是围绕交易能力构建的 AI 驱动基础设施系统,服务于全球 Web3 金融生态。
官方网站:https://exchange.superflow.me/
RWA 代币化龙头 Ondo,要下场做 Perp DEX 了撰文:Eric,Foresight News
永续合约赛道正在经历一场静悄悄的革命。
过去两年,Perp DEX 从边缘实验成长为衍生品市场中不可忽视的力量。2025 年 Perp DEX 总交易量达到了 7.9 万亿美元,接近中心化交易所总交易量的 10%。彼时在这片喧嚣之中,一个根本性的局限始终存在:几乎所有平台都困在加密原生资产的牢笼里,交易标的不外乎比特币、以太坊和少数山寨币,抵押品更是几乎清一色的稳定币。
与此同时,现实世界资产(RWA)代币化赛道正在以惊人的速度崛起,从 2023 年的概念验证,发展到如今超过 300 亿美元的市场规模。在这条赛道上,Ondo Finance 已经确立了无可争议的龙头地位:其代币化股票平台 Ondo Global Markets 的市场份额接近 7 成,是第二名的 2.5 倍左右。
今年开始,贵金属、大宗资产和股票开始被列入 DEX 的交易列表。但我们所习惯的方向都是 Perp DEX 上线代币化 RWA 资产。
当 RWA 赛道的绝对龙头决定进军 Perp DEX 领域,事情开始变得有趣。Ondo Perps 的推出,意味着永续合约赛道终于出现了一个真正从传统金融资产出发、将机构级资产发行能力与加密原生交易基础设施深度融合的玩家。这或许标志着 Perp DEX 从一个纯加密衍生品工具,向真正意义上的全球资产交易基础设施进化的转折点。
「反其道而行之」
2021 年,前高盛员工 Nathan Allman 和 Pinku Surana 创立了 Ondo,最初定位是一个 DeFi 结构化产品协议。2022 年底到 2023 年初,团队敏锐地察觉到,DeFi 内循环的模式终将触及天花板,而连接传统金融与链上世界的桥梁,才是下一个真正的大机会。于是他们毅然转向 RWA 赛道,推出了代币化美国国债基金 OUSG,随后又推出了面向非美国零售投资者的 USDY。这两个产品精准地切入了当时市场的最大痛点:加密世界巨额的资金迫切需要找到低风险、高收益的链上落脚点,而美联储激进的加息周期让美国国债成为了最诱人的选择。
可惜的是,就在 5 月底,Ondo 创始人兼 CEO,RWA 代币化赛道的主要推动者之一 Nathan Allman 意外离世,长期总裁 Ian De Bode 将接任 CEO。Ondo 表示,Ian De Bode 在过去两年多负责公司战略、产品及日常运营,其接任 CEO 获得了管理团队的充分支持。
Ondo 的执行力令人印象深刻。2024 年 3 月,当贝莱德推出代币化货币市场基金 BUIDL 时,Ondo 迅速将 OUSG 的主要持仓转移至 BUIDL,既借助了全球最大资产管理公司的信用背书,又保持了自己在分销渠道上的独立性。到 2025 年,Ondo 的 TVL 突破 25 亿美元,其中 USDY 单一产品便超过 10 亿美元,成为全球最大的面向零售投资者的代币化国债产品。
而 Ondo Global Markets 的推出,则将公司的版图从固定收益扩展到了权益类资产。2025 年 9 月上线的这个平台,提供了超过 260 种代币化美股和 ETF 的交易。从苹果、英伟达到标普 500 指数 ETF,覆盖 AI、生物科技、国防、能源等热门板块。不到八个月 TVL 破 10 亿美元、累计交易量超 180 亿美元的数据,放在任何金融产品的历史上都是现象级的增长速度。相比之下,稳定币在早期阶段都没有展现出如此陡峭的采纳曲线。
更重要的是,Ondo 并非只是一个在灰色地带运作的加密项目。它在列支敦士登获得了覆盖 30 个欧洲国家的监管批准,向美国证券交易委员会(SEC)秘密提交了注册声明,还与摩根大通、万事达卡等传统金融巨头合作完成了首次跨境代币化国债赎回测试。当富兰克林邓普顿这样的老牌资管公司都选择通过 Ondo 的平台来代币化其 ETF 产品时,Ondo 在 RWA 领域的枢纽地位已经不言而喻。
今年,交易所和 DEX 都在争先恐后地上线代币化 RWA 资产。Hyperliquid 在美伊战争期间的周末承接了包括黄金、白银和原油的交易量,引得彭博社一周内两度对其进行报道。这种趋势不言而喻,但大家似乎都把目光放在了交易所如何抢夺 RWA 代币化资产的交易上,忘记了专注于 RWA 代币化本身项目自己推出交易所的潜力。
正如此前 pump.fun 在推出 DEX 之前,Solana 上的 DEX 都在疯狂抢夺 Meme 代币交易的市场。而在 pump.fun 推出 PumpSwap 的 13 个月后,PumpSwap 以交易量计算的市场占有率已经来到了第二,且与第一相差无几,而曾经独占半壁江山的 Raydium 市占率仅剩 5%。
「华尔街 2.0」
Ondo Perps 的核心定位非常清晰:这是一个专注于代币化股票、指数和大宗商品的永续期货平台,将机构级的金融基础设施与无需许可的全球化交易平台接入结合在一起。用更直白的话说,它是一个真正意义上把华尔街资产带入 DeFi 永续合约赛道的平台。
这种定位带来的第一个、也是最直观的差异化优势,在于资产端的丰富度。Ondo Perps 可以将 Ondo 此前已经完成代币化的资产直接放到 Perp DEX 上进行交易。对于一个想要在全球资产配置中灵活运用杠杆的交易者来说,这种选择空间的差异是质变级的。
目前 Ondo Perps 已经向所有用户开放,我们来看一看有哪些亮点:
Ondo Perps 作为一个 Perp DEX 来说基础功能应有尽有,具体的不再赘述。目前 Ondo Perps 支持的最高杠杆为 20 倍,其中美股合约的最高杠杆大多数为 10 倍,大宗资产、股指等最高杠杆为 20 倍。
当前 Ondo Perps 支持 24 个永续合约市场的 24/7 交易,其中包括:
16 只美股:SPCX、MU、NVDA、TSLA、AAPL、MSFT、GOOGL、AMZN、META、NFLX、AMD、INTC、ORCL、PLTR、COIN、HOOD、MSTR、CRCL;
3 个大宗商品:XAU(黄金)、XAG(白银)、WTI(原油);
2 个指数:US 500、US 100;
1 个 ETF:Roundhill Memory ETF (DRAM)。
在实际使用中,笔者发现了两个特点,一是用户并不是直接使用自己的钱包交易,而是需要将以太坊上的 USDC 转入 Ondo 给定的地址才可交易;二是 Ondo Perps 采取全仓模式,意味着针对不同资产的做多做空仓位共用保证金。
这些设计其实是对应着更长远的计划。根据提供的资料,Ondo Perps 未来将采用多资产抵押系统,除了稳定币之外,还支持 Ondo 推出的美股、美债代币作为保证金来开仓。如此你就可以在不卖出自身投资组合的前提下进行对冲等操作。
从金融工程的角度看,多资产抵押不只是增加了一个功能选项,它实际上重构了整个系统的风险计算逻辑。Ondo Perps 更接近传统金融中的组合保证金(Portfolio Margin)概念,将整个资产组合视为一个统一的风险池。这意味着不同资产之间的自然对冲关系可以被系统自动识别,比如你同时持有代币化 SPY 多头和标普 500 永续合约空头,系统能够识别这种对冲并相应降低保证金要求。可能普通用户并不了解其中价值,但却能真实服务到复杂的量化策略和基差交易者。
流动性方面,Ondo Perps 并非从零开始在链上搭建流动性池,而是通过代币化股票的发行与赎回机制,将链上市场与传统交易所直接连接。这意味着价格发现和流动性深度可以继承自纳斯达克和纽交所这些万亿美元级别的传统市场,而不是依赖于有限的链上资金池。
可以说,Ondo Perps 的设计在满足了普通投资者的基本需求之外,也充分考虑了专业交易员和机构投资者的需求。此外,Ondo Perps 还称其是「最快的无需许可永续合约交易平台」,订单路由、保证金更新和清算全部实时处理,同时保持去中心化的安全保证。
在去中心化与用户体验之间的平衡,以及将合约交易直接路由至传统金融交易所,这两种设计使得 Ondo 需要将资金归集,在链下处理订单路由、交易和清算,并在链上分配资金。
不止于交易
旗舰交易平台一直是 Ondo 缺少的拼图,Perp DEX 实际上是 RWA 金融化闭环中的关键一环。
让我们回到 Ondo 的业务全貌。一方面,Ondo Global Markets 负责代币化资产的发行,将美股、ETF、国债等传统证券转化为可以在区块链上自由流转的代币。这些代币化的资产天然具有两个属性:它们代表了对底层金融资产的价格敞口,同时又可以像任何 ERC-20 代币一样在 DeFi 协议中组合使用。但问题在于,如果代币化资产只能被「持有」,那它们的价值就远未被充分释放。
另一方面,随着美国对代币化监管的放松,目前与 Ondo 合作,使用 Ondo 代币化资产的平台随时可以选择倒戈或者自行发行代币化产品。如果不能把终端的交易用户也把持在自己手中,再高的市占率也只是为别人做嫁衣。
Ondo Perps 的出现,为这些代币化资产注入了生产性。当一枚代币化苹果股票不仅可以被动持有,还可以作为保证金去开杠杆仓位、去执行复杂的基差套利策略、去对冲投资组合风险时,它的金融属性就被完全激活了。这种从「收益资产」到「信用基础」的转变,是整个 RWA 赛道从早期采用走向主流金融基础设施的必经之路。
更进一步看,Ondo 正在构建的其实是一个横跨现货与衍生品、连接传统金融与链上世界的统一生态。代币化股票在 Ondo Global Markets 上发行,之前通过 Ondo Bridge 跨链流转至 Hyperliquid 的 HyperEVM 等生态,现在又可以直接在自家的 Ondo Perps 上直接交易。这种网络效应一旦形成,竞争对手将极难复制,因为你无法仅凭一个更好的交易界面就取代一个已经深度嵌入多链 RWA 基础设施的完整生态。
事实上,这个图景已经开始变为现实。Ondo 已经与 Chainlink 合作,为其代币化股票提供机构级的价格预言机,使这些资产能够首次在 DeFi 借贷市场中作为抵押品使用。与 Euler 等借贷协议的整合正在推进,未来交易者可以在不出售持仓的情况下借入资金。这种「持仓即资本」的体验,正是传统金融中主经纪商业务的核心价值,如今正在被 Ondo 搬到链上。
新基础设施的时代
Ondo Perps 的推出,放在更宏观的视角下看,其实是两个历史性趋势的交汇产物:一个是 RWA 代币化从边缘实验走向主流金融基础设施的必然进程,另一个是 Perp DEX 从纯加密衍生品工具向全资产类别交易平台进化的自然延伸。Ondo 恰好站在了这两个趋势的交叉点上:它是 RWA 赛道的最大发行方,又拥有最深度的机构金融合作关系和最广泛的全球监管布局。
对于交易者而言,Ondo Perps 代表了一种全新的可能性:一个可以用英伟达股票做保证金、在周日晚上交易标普 500 永续合约、同时享受机构级流动性和执行速度的平台。这种体验在传统金融中根本不存在,在现有的 DeFi 中也无从获得。它属于那个正在加速到来的新世界:传统金融与加密原生基础设施的边界逐渐消融,而资产本身成为了可以在任何时间、任何地点、以任何方式组合使用的纯粹金融积木。
这或许才是 Ondo Perps 真正的意义所在。它不只是一个新的永续合约交易所,用 Ondo 自己的话说,是一个「将传统金融资产引入链上交易基础设施的「下一代」平台。
OpenAI CEO Sam Altman(萨姆·奥尔特曼):AI 奇点已至,我们正迈向“智能公用事业”时代撰文:Techub News 整理
在2026 年 5 月于旧金山举行的 Stripe Sessions 大会上,OpenAI 联合创始人兼 CEO Sam Altman(萨姆·奥尔特曼)与 Stripe 联合创始人兼 CEO Patrick Collison(帕特里克·科里森)进行了一场长达一小时的深度对话。这场对话发生在 AI 技术发展看似进入“抛物线增长”的关键时刻,两位科技领袖不仅回顾了 OpenAI 近十年的跌宕历程,更聚焦于 AI 如何从一项前沿研究演变为即将重塑全球基础设施、商业逻辑与科学发现的根本性力量。Altman 的分享,为理解 OpenAI 的战略意图和 AI 产业的未来走向提供了极为珍贵的视角。
感知奇点:从 Codex 爆发到无处不在的 AI 助手
Patrick Collison(帕特里克·科里森)在开场便抛出了一个有趣的说法:将今年 1 月 1 日定义为“奇点”的开始,当天是第 119 天。Sam Altman(萨姆·奥尔特曼)对此表示认同,他认为当前确实处于技术“起飞”阶段。这种感知并非空穴来风,OpenAI 内部的多项指标从去年末到今年初发生了“抛物线式”的 inflection(拐点)。Altman 将这一变化归因于模型能力,特别是编码能力,在去年底今年初跨越了某个关键阈值。
“Codex 正在迎来它的高光时刻,” Altman 说道。他分享了两个个人感知的拐点:一次是随着 GPT-5.2,而最近几周则是一次巨大的飞跃,让他感觉这即将成为自己与计算机交互的主要界面。尽管目前最坚定的用户仍将 AI 用于编程,但一股“浪潮”正推动更多用户涌入,并将其用于各种非编码任务。OpenAI 的雄心远不止于编程,而是覆盖所有在电脑前完成的工作。Altman 估计,在非编码领域,他们可能只完成了 10% 的路径,但拥有真实用户基础后,进展会非常迅速。
那么,继编程之后,下一个被 AI 彻底解锁的领域会是什么?Altman 认为,编程因其巨大的社会需求和对模型的天然适配性,可能是一个特例。但更根本的变革在于,人们将意识到自己浪费了多少时间在繁琐的电脑操作上——在消息应用间切换、复制粘贴、回复枯燥邮件等。AI 将接管这些“苦差事”,从而大幅提升人们的工作幸福感和生活品质。这种主观体验的改善将是巨大的。
谈到具体的 AI 应用体验,Altman 以 OpenAI 2026 年 5 月推出的智能体产品 OpenClaw 为例,分享了几个“魔法时刻”。作为一个家庭自动化爱好者,他多年来尝试构建更好的家庭自动化系统均告失败,而 OpenClaw 是第一个让他满意的方案。他还用它构建了一个一直想要的消息处理应用,来自动化处理早晨令人不悦的消息洪流。更令人惊奇的是,在测试新产品时,他让他的 AI 代理用一次性虚拟卡为自己在网上购买一份 20 美元以下的礼物,结果代理选择在 Gumroad 上为自己购买了一个 HTTP 状态码设计图。这些体验模糊了工具与具有“意愿”的实体之间的界限,带来了奇妙甚至略带诡异的感觉。Altman 甚至透露,在为 GPT-5.5 策划庆祝派对时,他询问了模型自己的想法,而模型给出了一套详尽、周到且带有幽默感的方案,这让他感受到了某种真实的“道德压力”。
OpenAI 的演进:从研究实验室到全球智能公用事业
对话自然转向了 OpenAI 本身。这个如今举世瞩目的组织已走过 11 个年头。Altman 分享了 OpenAI 历史上一个未被讲述的“最疯狂”故事:在 GPT-4 训练完成到正式发布的八个月空窗期里,公司内部所有人都在使用这个他们认为将改变世界的模型,而外界几乎一无所知。这种内部集体认知与外部反馈真空的状态,让他们一度怀疑自己是否陷入了“集体精神病”。这段经历虽然不如后来的董事会戏剧或诉讼引人注目,但亲身经历者感觉异常奇特。
谈及管理风格,Sam Altman(萨姆·奥尔特曼)自称绝非事无巨细的管理者。他的哲学是找到优秀的人,给他们指明一个高层次的方向,然后让事情自然发生。他将 OpenAI 的发展分为三个阶段:第一阶段是纯粹的研究公司,目标是探索在当时看来“完全疯狂”的 AGI 之路;第二阶段是在继续研究的同时,学习如何打造一家产品公司;现在正进入第三阶段,即在前两者的基础上,学习如何构建一个面向全球的、超大规模的“智能代币工厂”。
“我认为我们所做的是在构建一种新的公用事业,” Altman 阐述道,“人们会希望以各种方式使用大量的代币、大量的智能。我们需要让这些智能尽可能聪明、便宜、丰富且易用。” 这需要深度的全栈整合和 Massive(巨大)的基础设施建设。他坦言,从第一阶段到第二阶段的转变中,他并未充分意识到管理风格需要做出多大改变,而第三阶段又将截然不同,这对他并非天然契合。他正在思考如何改变自己,或找到合适的人,甚至打造一个能管理这项新事业的 AI。
对于外界关于 AI 实验室将“吞噬整个价值链”并形成霸权力量的担忧,Altman 给出了明确的回应。他赞赏 Stripe 作为基础设施提供商,其成功与客户成功高度 aligned(对齐)的模式。他希望 OpenAI 也能达到类似的模式:成为一家基础设施提供商,一个“永远低利润率”但规模巨大、增长迅速的业务,提供一种“智能计量器”,让企业购买用以自动化流程、加速内部运作或构建产品。他相信,随着 AI 越来越智能,切换成本会降低,维持高利润率将很困难。OpenAI 的目标是与全球分布式经济引擎的成功深度对齐。
这自然引向了另一个热议话题:对算力的巨额投资。Altman 早在两三年前就提出的、当时听起来“荒谬”的基础设施建设规模,如今正日益成为现实。他承认,这很可能将成为人类历史上最昂贵的基础设施项目。好在收入正在快速增长以匹配支出,同时效率提升也远超预期。关键在于,当智能单位价格足够低时,需求几乎是无限的。“我们不会去建造戴森球然后铺满数据中心……但也许我们会?”他半开玩笑地说。他认为目前并未处于资本支出泡沫中,需求规模与投资规模相比是合理的。至于如何辨别真正的泡沫,这位前投资者承认自己从未找到可靠的框架,经济学家们“成功预测了过去八次衰退中的三次”。
人才、合作与创业生态的变迁
在高度依赖顶尖人才的 AI 领域,如何管理那些才华横溢但可能个性鲜明、难以合作的“明星”员工?Altman 透露,曾有人为他总结 OpenAI 成功的“秘诀”:他成功让一群都自认为是唯一或最有能力、且凡事必须按自己方式行事的人,在一起合作足够长的时间,直至实现突破。秘诀就是“大量的痛苦”。OpenAI 依靠的是少数深层次的共同信念:相信规模化、相信集中资源、相信正在做的事业足够重要,以至于人们愿意放下个人恩怨。例如,在训练 GPT-3 时,公司将绝大部分算力投入单一研究项目,这与当时其他实验室(如 DeepMind)强调均衡分配的文化截然不同,但他们选择了坚信并排除干扰。
谈及与联合创始人 Greg Brockman(格雷格·布罗克曼)长达近十年的成功合作,Altman 认为共同的历史、共享的价值观、深刻的相互尊重以及互补的技能组合是关键。他观察到,在 Y Combinator(YC),创始团队相识时间的长短是预测成功的重要指标。他非常感激能有这样一位深度信任的伙伴共同经历这场 intense(高强度)的创业之旅。
作为全球最成功的创业投资者之一,Altman 也被问及 AI 时代成功创业者的特质是否发生了变化。他幽默地提到,过去行业会嘲笑只有“点子”没有技术能力的“点子王”,但现在情况正在反转——“点子王”们正在迎来“复仇时刻”。虽然技术能力依然重要,但他现在也非常愿意投资那些深度理解用户但完全不会编程的创始人。这是一个巨大的转变。
面对可能在未来几年内出现的 AGI 或“奇点”,如何思考具有十年周期的风险投资?Altman 认为,这确实需要“真正的不信 suspension of disbelief”,但这可能是正确的生活方式。你不能因为相信奇点将至就什么都不做,你必须像世界仍将长期以可理解的方式运行那样去生活和规划。OpenAI 自己的规划也是如此:他们签署了长达 20 年的电力和土地协议,对两年内的产品有清晰愿景,但再往后就模糊得多。
关于建立在 AI 之上的创业公司(曾被称为“GPT 包装器”,现多称“AI 应用”或“智能体平台”)的持久性问题,Altman 的观点始终如一:一家公司应该站在希望 AI 变得更聪明的这一边。如果你的业务是修补当前模型的某个明显弱点,那么下一个更强大的模型发布时你就会难过。如果你的业务是随着模型智能提升而变得更好,那么你会更开心。无论是“包装器”还是“平台”,道理相通。
赋能未来:科学、社会与 OpenAI 的终极愿景
当被问及哪些组织最能有效利用 AI 时,Altman 举了几个例子。首先是 Shopify 的 CEO Toby Lutke(托比·吕特克),他率先宣布公司要“全面投入 AI”,并亲自动手用 AI 自动化一切,要求团队也必须这样做。这种来自最高层的、亲身实践的推动力效果显著。OpenAI 甚至计划尝试派遣类似“技术专家”直接与公司 CEO 合作,自动化其工作,产生“分形效应”。其次,是那些对数据访问“ uncomfortably permissive”( uncomfortably 地宽松)的公司,允许 AI 访问代码库、会议记录、Slack 消息、邮件等一切数据。这对于拥有敏感数据的大公司来说挑战巨大,涉及隐私与效率的权衡,可能需法规调整,但其威力在小团队中已展现得淋漓尽致。Altman 以 Stripe 孵化的区块链项目 Tempo 为例,其团队在 Slack 中设置了一个智能体工具,几乎能 orchestrating(协调)公司的一切——阅读文档、创建任务、编写代码、部署、测试,整个小型组织的运作在一个 Slack 频道中完成,景象令人震撼。
对于开源 AI 的未来,Altman 肯定地表示“当然有未来”。目前大多数需求仍集中在更智能、更快、更便宜的前沿模型上,但对开源的需求也很大,并且他预计其相对重要性会随时间增加。
科学是 Altman 极度兴奋的领域,也是 OpenAI Foundation(OpenAI 基金会)的重点方向。他认为,AI 对人类生活质量最重要的贡献可能就在于加速科学发现。从几个月前的模型开始,特别是 GPT-5.5,模型已经足够智能,能够帮助优秀科学家产生更好的想法,甚至做出一些小型但重要的发现。未来,结合自动化实验室和机器人,科学进程将极大加快。如果能将过去需要十年的科学工作在一年内完成,其复合效应将是巨大的。OpenAI 基金会将投入资金、专业知识和技术来加速科学,并相信这将以美妙的方式惠及世界。Altman 透露,这很可能将成为世界上规模最大的基金会之一。他们已向 Arc Institute(弧研究所)提供资助,该机构致力于利用 CRISPR 和 AI 等技术,目标是实现人类对复杂疾病(如阿尔茨海默症)的首次治愈。
最后,Patrick Collison(帕特里克·科里森)问及,在 AI 发展看似具有某种“必然性”的背景下,Sam Altman(萨姆·奥尔特曼)希望他个人的参与如何改变世界的轨迹。Altman 的回答回到了 OpenAI 的核心理念之一:迭代部署。他回顾了发布 ChatGPT 前,业界存在的一种主流观点,认为 AI 过于危险,只能由一小群思考 AI 安全的人掌握,是“信息危害”,必须锁在象牙塔中。这种权力集中的前景让他深感不安。他坚信,避免这种权力集中,让世界能够广泛使用并在此基础上进行建设,尽管过程会有些混乱,但最终将为世界带来一份礼物,而世界将在此基础上为所有人建造一份更大的礼物。他相信创业精神、创新,相信人们大多是善良的,并能用工具做出惊人的事情。因此,他自认最大的贡献,就是推动这项技术成为一种民主化的技术,供人们使用和构建。这或许正是 OpenAI 之名在新时代下的最深层次诠释。
OpenAI CEO Sam Altman(萨姆·奥尔特曼):AI 应用、智能体与软件开发的新纪元撰文:Techub News 整理
北京时间 2025 年 4 月 10 日,OpenAI 在旧金山举办了第二届开发者大会 DevDay。CEO 萨姆·奥尔特曼(Sam Altman)发表了开幕主题演讲,公布了多项旨在赋能全球开发者的重磅更新。从将 ChatGPT 转变为应用平台,到大幅简化智能体(Agent)开发流程,再到让 AI 成为软件工程的核心协作者,本次发布标志着 AI 从“可对话的工具”正式迈向“可构建、可集成、可行动”的生态系统。以下是本次演讲的核心内容梳理。
ChatGPT 进化:从聊天机器人到应用平台
萨姆·奥尔特曼(Sam Altman)首先回顾了 OpenAI 生态的惊人增长:开发者数量从 2023 年的 200 万增至 400 万,每周使用 ChatGPT 的用户超过 8 亿,API 每分钟处理的令牌数从 3 亿飙升至 60 亿。这背后是 AI 从“新奇玩具”到“日常生产力工具”的深刻转变。
为了进一步释放创造力,OpenAI 宣布推出 Apps SDK,允许开发者在 ChatGPT 内部构建和分发功能完整的交互式应用。这不再是简单的插件或工具调用,而是拥有独立前端界面、后端逻辑和数据连接的“原生应用”。
Apps SDK 基于开放的 MCP(Model Context Protocol)标准构建,开发者拥有对前后端的完全控制权。其最大吸引力在于,应用一旦上架,即可触达 ChatGPT 的数亿用户,获得前所未有的分发渠道。未来,OpenAI 还将支持应用内直接购买等货币化方式。
现场演示生动地展示了这一愿景:
Coursera:用户可在 ChatGPT 对话中直接搜索并播放课程视频。视频会以小窗形式置顶,用户可边看边问,ChatGPT 能根据当前播放内容(通过 API 获取的上下文)进行即时答疑。
Canva:在 ChatGPT 中为一个虚构的遛狗业务“Walk This Wag”构思名称后,用户可直接指令 Canva 应用生成海报和宣传用的 Pitch Deck,所有创作过程都在对话流中完成。
Zillow:当 ChatGPT 建议将业务扩展到匹兹堡后,用户可调用 Zillow 应用,在对话中嵌入交互式地图查看房源,并进一步要求 ChatGPT 筛选“带后院的三居室”。应用与模型深度协作,提供无缝体验。
OpenAI 工程师 Alexi 在演示中强调,这种“与应用对话”的能力是核心魔法。应用不再是孤立的工具,而是与 ChatGPT 的智能深度整合,能理解用户意图并主动推荐。Apps SDK 即日起开放预览,开发者可开始构建,后续将开放应用提交审核和官方目录。
Agent Kit:将智能体从原型带向生产
智能体(Agent)是能理解目标、使用工具并自主完成任务的 AI 系统。尽管潜力巨大,但将其投入实际生产仍面临巨大挑战:从选择框架、流程编排、工具连接到构建 UI 和评估循环,每一步都充满复杂性。
为解决这一痛点,OpenAI 推出了 Agent Kit。这是一个旨在帮助开发者将智能体想法快速落地生产的完整工具集,包含三大核心组件:
Agent Builder:一个可视化的工作流构建画布。开发者可以通过拖拽节点(如分类器、工具调用、条件分支)的方式,直观地设计智能体逻辑并测试流程,无需从零开始编写复杂代码。
Chat Kit:一个可嵌入的聊天界面组件。开发者可以将其轻松集成到自己的应用中,并完全自定义品牌和交互风格,为用户提供与智能体自然对话的体验。
评估工具:专为智能体设计的新评估功能。包括追踪评分(逐步理解智能体决策)、数据集测试、自动提示词优化,甚至支持在 OpenAI 平台上对外部模型进行评估。
此外,通过 OpenAI 的连接器注册表,企业可以安全地将智能体连接到内部工具和第三方系统。
现场演示极具冲击力。工程师 Christina 在8分钟内,使用 Agent Kit 为 DevDay 官网构建并部署了一个名为“Ask Froge”的智能体助手。该助手能理解用户关于会议日程的查询,从文件中检索信息,并以品牌化的青蛙风格(Froge)回答,同时还能通过预置的“护栏”防止泄露个人敏感信息(PII)。整个过程完全可视化,无需编写代码,构建完成后即可通过 Chat Kit 组件嵌入网站实时使用。
萨姆·奥尔特曼(Sam Altman)还分享了企业案例:美国大型连锁超市 Albertsons 利用 Agent Kit 构建了店内管理智能体。当冰淇淋销量意外下滑 32% 时,店员只需询问智能体,它便能分析季节性、历史趋势等上下文,直接给出调整陈列或投放本地广告的建议,将原本冗长的报表和会议流程极大简化。
Codex:软件工程进入“无代码”协作时代
“我们正在进入一个软件编写方式被彻底改变的新时代。”萨姆·奥尔特曼(Sam Altman)如此定义 Codex 带来的变革。Codex 是 OpenAI 的软件工程智能体,旨在与开发者并肩工作,加速软件创建。
此前处于研究预览版的 Codex,如今正式推出通用版本(GA)。它已深度集成到开发者的工作流中,支持 IDE、终端、GitHub 和云端环境,并通过 ChatGPT 账户同步所有工作。其底层模型已升级为专门为编码和智能体任务训练的 GPT-5 Codex,在代码重构、审查等任务上表现更佳,并能根据任务复杂度动态调整“思考时间”。
数据证明了它的成功:自 8 月初以来,Codex 的日处理消息量增长了 10 倍,GPT-5 Codex 也成为 OpenAI 有史以来增长最快的模型之一,已处理超过 40 万亿令牌。在 OpenAI 内部,几乎所有新代码都由 Codex 用户编写,使用 Codex 的工程师每周完成的拉取请求(PR)数量增加了 70%。
为服务工程团队,Codex 新增三大功能:Slack 集成(可直接在团队对话中让 Codex 写代码或回答问题)、Codex SDK(用于在团队工作流中扩展和自动化 Codex)以及新的管理员工具和报告面板。
现场演示将 Codex 的能力推向了新高度。工程师 Raman 在未手写一行代码的情况下,完成了一系列令人惊叹的操作:
通过自然语言指令,让 Codex 创建了一个控制舞台上方索尼摄像头的网页控制面板。
让 Codex 研究并编写了通过 Visca 协议控制该摄像头的 Node.js 服务器代码。
指令 Codex 将 Xbox 无线手柄连接到该控制界面,实现了用手柄操控摄像机摇移。
通过集成实时语音 API 和 Agent SDK,实现了用语音控制摄像机(如“对准观众”)和会场灯光系统(通过构建 MCP 服务器)。
最后,通过语音指令,让 Codex 现场修改 React 应用代码,为所有现场参会者生成了一个电影片尾式的“演职员表”叠加层。
整个过程展现了 Codex 作为“AI 队友”的强大能力:理解复杂意图、自主研究协议、调用工具、编写并集成代码。正如 Raman 所言:“唯一的限制现在是你的想象力。”
模型更新:GPT-5 Pro、Sora 2 与 Realtime Mini 开放 API
所有强大的应用和智能体都离不开底层模型的支撑。萨姆·奥尔特曼(Sam Altman)宣布了多项模型更新:
GPT-5 Pro API 全面开放:这是 OpenAI 迄今为止最智能的模型,专为需要高精度和深度推理的复杂任务设计,如金融、法律、医疗等领域。它现已面向所有开发者开放。
Realtime Mini:这是一个小型、快速、低成本的实时语音模型,语音质量和表现力与两个月前发布的 Advanced Voice 模型相同。OpenAI 认为,语音将成为人机交互的主要方式之一。
Sora 2 API 预览:备受瞩目的文生视频模型 Sora 2 现已开放 API 预览。其最大进步在于可控性增强,开发者可以给出详细指令,模型能保持状态并生成风格化、准确、构图精良的视频。更令人兴奋的是,Sora 2 能生成与画面同步的丰富音效和背景音乐,而不仅仅是语音。现场展示了其如何将一张小狗照片扩展为一群小狗玩耍的动态视频,并配以同步音效。玩具公司美泰(Mattel)已利用其 API 快速将设计师草图转化为可分享的动态概念视频。
在演讲的最后,萨姆·奥尔特曼(Sam Altman)总结道,软件构建曾需要数月或数年,而现在借助 AI,只需几分钟和一个好想法即可实现。OpenAI 的目标是通过 Apps SDK、Agent Kit、Codex 和新模型等一系列工具,成为这个新时代的最佳构建平台。这场发布会不仅是对现有能力的展示,更是对“AI 全民化”和“创意即时实现”未来的一次强力召唤。
Josh & Ejaaz:为何我们从 Claude Code 转向 OpenAI Codex撰文:Techub News 整理
在 AI 编程助手竞争白热化的当下,工具的选择往往决定了开发效率与创造力边界。Limitless Podcast 的主持人 Josh 和 Ejaaz 2026 年 5 月进行了一场深度对谈,基于他们从 Anthropic 的 Claude Code 转向 OpenAI 的 Codex(集成于 ChatGPT 5.5)的实际经历,剖析了这两款顶尖产品的现状、核心差异以及未来的趋势。这场讨论不仅提供了直观的功能对比和 Demo 演示,更触及了 AI 工具演进背后的关键概念,对于任何依赖 AI 进行开发或创意工作的从业者而言,都具有极高的参考价值。
市场格局的戏剧性翻转:Codex 的“觉醒”与数据碾压
仅仅几个月前,Claude Code 还是几乎所有软件工程师和企业的首选,安装量遥遥领先。但 Josh 指出,在圣诞节前后,AI 编程的“氛围”发生了根本性转变——从一个“有趣的工具”变成了开发者实际交付代码时使用的利器。而此后,OpenAI 似乎“醒了过来”。
Ejaaz 用一组惊人的数据说明了这种转变:在过去一周,Codex 的安装量超过了 4600 万次,而 Claude Code 则低于 50 万次。这与历史数据形成了鲜明对比,此前 Claude Code 的安装量曾远远超过 Codex。Ejaaz 认为,这种戏剧性翻转的核心原因很简单:OpenAI 推出了更好的模型。他们在过去几周内密集发布的功能,比大多数公司一年内推出的还要多。
为了直观对比,他们制作了一个“比分牌”:OpenAI Codex 以 11 分领先,Anthropic Claude 仅得 2 分。这 11 分的优势来源于多个关键领域的突破。
Codex 的五大核心优势:从“超人”操作到屏幕监控
1. 计算机控制与速度:Claude 率先实现了让 AI 接管桌面、移动光标的能力,但速度较慢,且常遇到障碍,需要用户手动引导。Codex 不仅比普通人操作更快,甚至比 Josh 本人还快。Ejaaz 描述其光标移动速度之快,如同“使用电脑的超人”,并且可以近乎 24/7 不间断运行。
2. 长时程自主性:Codex 能够更智能、更持久地工作。传统上,AI 完成任务依赖一种名为“Ralph Loop”(以《辛普森一家》中坚持不懈的角色命名)的规划模式,即 AI 会持续迭代直至达成目标。Codex 原生集成了这种长时程思考能力,有人甚至观察到它为了完成目标持续“思考”了 36 小时。这对于解决复杂任务至关重要。
3. 浏览器使用与意图理解:Codex 可以接管浏览器,并更智能地理解它所浏览的内容。此前它不具备此能力,而现在它能进行更有目的性的操作。
4. 图像生成集成:OpenAI 2026 年 5 月发布了 ChatGPT Images 2.0 图像生成模型,其质量“绝对令人震惊”,在所有基准测试中击败了包括谷歌 Nano Banana 2.0 Pro 在内的前任领先者。而 Anthropic 目前甚至没有图像生成模型。对于任何涉及视觉工作的用户,直接在软件中使用此功能非常强大。
5. “Chronicle”——秘密的屏幕监控与效率分析:这是 Josh 认为大多数人尚未知晓的 Alpha 功能。Chronicle 会观察你滚动、点击和键入的内容,以此构建关于你的上下文和记忆,无需你主动输入。这带来了一个极其强大的提示:“根据 Chronicle(这个新的记忆功能),我在电脑上做什么事情效率很低?提出一些建议,直接告诉我我需要听到什么。”它会评估你的电脑使用习惯(例如在 Twitter 上滚动的时间),并基于其观察到的实际行为给出真实反馈,以优化你的工作流程。目前该功能仅面向付费会员(每月 100-200 美元订阅),Josh 认为这是未来重要功能的早期迹象。
此外,Codex 2026 年 5 月还推出了“自动审核”功能,能智能区分可能构成系统性威胁的操作和无需批准的操作,自动批准后者,大大简化了用户界面,让用户可以暂时离开电脑而任务照常进行。
Claude 的现存优势:个性、UI 与移动访问
Josh 和 Ejaaz 也指出了 Claude 目前仍保持优势的领域。首先是其“OpenClaw”能力(有趣的是,OpenAI 收购了 OpenClaw)。Claude 的 Dispatch 是其移动应用功能,允许用户远程与 Claude Code 交互,而 Codex 目前尚未提供此功能(团队已承诺会推出)。
其次,在个性化和用户界面方面,Claude 更出色。当使用 LLM 本身而非工具套件时,Claude 的体验更佳,UI 更温暖。此外,两者都发布了“宠物”功能(如屏幕上显示的 Angry Dario),但 Codex 的宠物能作为持久角色存在于整个电脑使用过程中,在后台与你聊天,显示进度,更具趣味性,体现了对用户体验的关注。
实战 Demo 对比:从零构建游戏与草图生成应用
为了验证理论,他们准备了两个具体的演示。
Demo 1:一次性提示构建马里奥风格游戏
Ejaaz 给出了一个提示:要求 AI 创建一个具有未来感、带霓虹灯元素的马里奥风格侧卷轴游戏,包含游戏设计、敌人、陷阱和计分板。他们将此提示输入给 ChatGPT 和 Claude,让各自的编码模型在最高设置下执行。
Claude Opus 4.7 的结果:游戏名为“Neon Plumber Moon Base Run”。视觉效果很好,有音效设计,遵循游戏原则。玩家能识别危险(如尖刺)。但逻辑存在缺陷,例如承诺的双跳功能并未正常实现,导致无法收集某些硬币。
OpenAI Codex (GPT-5.5) 的结果:游戏同样命名为“Neon Plumber Moon Base Run”。起始画面更基础,但有背景动画。游戏逻辑更好,完全可玩,有清晰的爱心(生命值)显示和计分系统,能获得功能增强道具。虽然也存在一些边缘错误,且没有音乐,但整体游戏体验更流畅、功能更完整。
在构建体验上,Ejaaz 更偏好 Codex。Codex 在接到单一提示后,没有请求任何许可,自行思考并决策推进;而 Claude Code 则会不时向用户求助。对于构建像游戏这样的非生产级项目,这种“放手”模式可能更受欢迎。
Demo 2:从手绘草图生成应用
他们提供了一个手绘(实际由 GPT Image Gen 2.0 生成)的“通用 Limitless 仪表盘应用”草图,将其输入模型。
Claude 的结果:生成了一个仪表盘,但风格基础且可预测。页面文本和图形元素很多,它推断出了旅行预算等功能(尽管提示未明确要求)。然而,它创建的是一个旅行规划板,而非围绕 Limitless Podcast 的仪表盘,可能与提示理解有关。
OpenAI Codex 的结果:界面更简洁、干净,没有追求未来感或霓虹风格。提供了一个五日旅行计划的基本信息,有多个标签页,视觉效果更好。虽然同样不是草图指定的内容,但设计更易于理解,不那么密集,且看起来已经连接到数据(顶部有“重新优化”开关)。Josh 认为 Codex 在这方面“完全碾压”,更准确地还原了原始纸张上的设计。
两个演示均显示 Codex 在逻辑实现和功能完整性上更胜一筹。
超越模型本身:“AI 模型套具”与“Vanilla Maxing”哲学
Ejaaz 指出,两大公司的模型之所以能如此快速进步,一个关键因素是“AI 模型套具”。这指的是在基础模型之上添加的层,包括预设的提示词、模型运行的环境以及确保模型以特定方式行为和发声的策略。这也解释了为何 Claude 的个性优于 ChatGPT。
Cursor 2026 年 5 月将其套具 Cursor SDK 通过 API 开放,这具有重要意义。批评者曾认为 Cursor 只是一个 AI 包装器,但事实证明,这个“包装器”或“套具”能让模型变得更智能。如果将 Cursor 的套具应用于 GPT-5.5 和 Claude Opus 4.7,得到的模型比原始基础模型更聪明、更高效。这意味着,尽管 AI 实验室投入巨资训练模型,但初创公司通过构建更好的“套具”也能创造卓越产品。套具与模型本身已密不可分,是 valuable moat。
Josh 进一步阐述了“套具”在构建“超级应用”中的作用。每个公司都试图打造一个全能的操作系统级应用,让 AI 成为其基础。OpenClaw 在此方面早期表现卓越。2026 年 5 月,Sam Altman(萨姆·奥尔特曼)宣布用户现在可以将其 ChatGPT 账户连接到 OpenClaw 生成令牌,这可能是将 OpenClaw 深度集成到 Codex 的多步计划开端。OpenAI 拥有 OpenClaw,虽然承诺保持开源,但有能力直接集成到自家产品中。Codex 的开发者也确认,原生编辑器、iOS 应用、完整浏览器和 OpenClaw 等功能都将到来。
然而,Ejaaz 指出 OpenClaw 的热度已消退,因为尽管这些工具处于前沿水平,但难以扩展到实际应用。用户不敢将其集成到存有个人文件的桌面,曾出现过访问信用卡数据或删除旧婚礼照片等恐怖故事。相比之下,在品牌信誉下提供的工具(如 ChatGPT Codex、Claude Cowork 或 NVIDIA 的企业级安全版本 NemoClaw)更能让人安心使用。
这引出了 Josh 推崇的“Vanilla Maxing”哲学:你应该 100% 使用原厂工具。很多人陷入使用各种不同仓库、技能和插件的情况,但现实是,AI 实验室的迭代速度足够快,他们会直接将功能集成到原生应用中。因此,最好的策略就是“Vanilla Maxing”——使用官方提供的工具,无需急于尝试前沿但可能不安全的外部工具。
未来展望与个人使用栈
Ejaaz 总结道,目前并没有明确的赢家,但他倾向于 Codex GPT-5.5。不过叙事转换如此之快,Claude 仍可能追赶上来。一个未被讨论和演示的模型是Claude Mythos,它在几周前伪发布,在所有基准测试中都技术上优于 5.5,但 Anthropic 因其“过于危险”和“网络安全风险”而未开放访问(美国战争部的 Peter Heskett 也提及此担忧)。OpenAI 则创建了 Mythos 级别的模型并使其对所有人可用。这或许也源于 Anthropic 计算资源的不足。
关于个人使用栈,Josh 表示他已完全转向 Codex,用于所有困难任务。但他认为,作为 LLM 或聊天机器人,GPT-5.5 略逊于 Opus 4.7,后者个性更温暖、更精准,更能理解他的意图。因此,在构建复杂项目时,他用 Opus 4.7 作为“协调者”,Codex 作为“执行者”。他还发现 Opus 4.7 在某些方面不如 4.6,例如在写作或文本消化任务上,他仍使用 Opus 4.6。
Ejaaz 的栈则更多样化。对于研究,他开始转向 GPT-5.5,因为它能进行更长时间、更深入的讨论。他举例测试了关于 AI 电力堆栈和投资标的的提示,5.5 完全超越了 4.7。但他仍因个性原因使用 4.7。总体而言,他认为 OpenAI 正处于“一代人的奔跑”中,可能很快会修复现有问题。
Josh 最后鼓励用户亲自尝试两款工具,用实际提示进行测试。无论你从事何种工作,只要使用电脑,AI 都可能帮助你更高效地完成任务,或助力你实现一直想做的爱好和副业。这场竞争的最大赢家是用户,因为每月仅需 20 美元,就能获得所有这些前沿智能和能力。
OpenAI Codex负责人Thibault:AI代理正在重塑知识工作,编程只是起点撰文:Techub News 整理
在2026 年 5 月 OpenAI 论坛的一场对话中,OpenAI Codex 负责人 Thibault 与全球事务团队的 Chris Nicholson 深入探讨了 Codex 的演变与影响。这场对话之所以重要,是因为它清晰地揭示了 Codex——最初作为代码生成工具而闻名——正在如何跨越软件工程的边界,成为各行各业知识工作者提升生产力的核心工具,并从根本上改变我们与计算机和信息的交互方式。
从代码生成到通用代理:Codex 的使命演变
Codex 的故事始于一个经典的挑战:让 AI 达到高产软件工程师的编程水平。大约两年前,OpenAI 团队开始探索这一领域。最初的公开版本是“Codex Web”,一个云端实体,用户只需陈述意图,它便能分析代码仓库并提交更改。然而,这个方案存在较高摩擦:设置复杂,且模型可靠性尚未达到能完美处理长期任务的水平。
团队很快意识到,将工具运行在云端并要求所有人配置环境过于困难。于是他们转向了一个更自然的路径:让 Codex 在每个人的本地机器上工作。这一转变降低了使用门槛,也为后来的广泛应用奠定了基础。
真正的转折点出现在大约六个月前,随着 GPT-5 的发布,模型的通用性和可靠性迎来了阶跃式提升,尤其是在处理长期任务方面。Thibault 指出,即使是软件工程师,他们日常工作中真正编写代码的时间可能只占 20-30%。大部分时间用于处理工单、优先级讨论、架构决策、排查故障报告、处理系统中断、信息收集等。那些早期采用 Codex 的技术人员,早已开始用它处理这些日常的非编程工作。
团队发现,为了让 Codex 在编程任务上更有用,它需要访问更广泛的上下文信息,例如存储在 Notion 或各类文档中的信息。当他们不断提升这方面的可靠性时,一个有趣的现象出现了:如今在 Codex 上执行的大部分任务,实际上已是非编程任务。 Codex 从搜索代码,进化到了搜索各类文档并返回信息,这恰恰是所有知识工作者都需要的能力。
Thibault 分享了让他意识到 Codex 潜力将惠及所有人的关键时刻。在一次产品发布前夕,产品经理 Alexander Americus 使用 Codex 来追踪所有待落地更改的状态。Thibault 从未见过有人能像 Alexander 那样高效:他仿佛拥有许多小小的 Codex 代理,代表他处理工作、跟进人员、更新文档,汇总所有来自用户反馈和开发者的信息,并保持计划整洁且实时更新,而 Alexander 本人则在与他开会讨论。这让他感到震撼:“我们真的在改变一切,不仅仅是软件工程。” 在此之前,Alexander 需要亲自翻阅 Slack 频道、文档或 GitHub PR,花费大量时间协调。而现在,他将这些耗时的工作委托给了工具,它们在他开会时就能完成。
Codex 模型擅长收集正确上下文并进行总结,这是一个强大的用例。Alexander 还用它来“催促”信息:Codex 代理连接到 Slack,可以发送消息询问某人某项工作的最新状态,代表 Alexander 完成所有跟进工作。“催促”耗费了大量时间,而现在可以被自动化。
效率革命与角色重塑:Codex 带来的连锁反应
Alexander 的高效使用产生了涟漪效应。工程师的开发速度大大加快,构建速度前所未有。相邻的职位也在发生变化:设计师的角色在改变,产品经理的角色在改变。OpenAI 团队思考如何加速并赋予他们更高的生产力。随后,瓶颈转移到了沟通和营销部门——团队突然产出如此之多的工作,向世界讲述并保持故事连贯性成为挑战。
OpenAI 的交付速度非常快。Thibault 直言,没有 Codex,这不可能实现。如今 Codex 对他们至关重要。他认为,其他公司,即使是拥有十倍工程师的公司,也足以遵循类似的模式,因为技术状态已达到一个临界点:这些代理能够处理非常通用的工作。如今,在电脑背后完成的许多事情,代理都能协助。
无论是准备演示文稿以协调利益相关者、收集公众认知背景、进行市场研究、组织信息,还是在财务部门(Sarah Friar 提到她借助 Codex 组织了最近的融资活动),Codex 都展现出美丽的通用性。它已演变为不仅仅是生成代码,而是执行通用任务。
Thibault 观察到,每个人都需要应对事情更快地移动,并更快地适应。曾经需要数天解决的难题,现在可能只需几个小时。这一趋势出现在科学、工程领域,也出现在诸如深入的市场研究或分析新功能的公众情绪等任务上——曾经需要大量时间寻找来源、总结、浓缩信息以供不同人消化,现在这个过程被压缩到几个小时,甚至完全自动化。
这意味着一切都在加速,人们需要适应节奏的提升。个人也能独立完成更多工作,这非常令人愉悦,极具赋能感。以前你可能需要找人讨论某事,现在你可以自己完成。在公司内部的数据问题上,这种现象也很普遍:每个人都被赋能去直接询问数据问题,例如“我们在某个市场的成功程度如何?”“我们在印度是否增长?”“韩国的情况如何?”现在,人们可以直接要求 Codex 调出仪表盘(即使不知道具体位置),然后深入挖掘业务细节,无需再去打扰数据分析团队,让他们专注于更有趣的工作。
Thibault 认为,我们正处于一个历史性时刻:过去,提出问题的人和构建解决方案的人是两个独立的群体,他们关于产品的对话漫长,最终只能得到一个尚可的结果,无法进一步推进,因为没人有时间。而现在,提出问题的人可以快速构建解决方案,并迭代所需的更改。这就是为什么团队中也有 UX 设计师,他们正在推送代码、进行更改、与开发者一起塑造产品,以带来最佳体验并创造惊人成果。他们无需再去说服工程团队优先处理那些工程团队可能认为微不足道、但对设计师而言却能极大提升工艺和用户体验的改动。这对他们同样是极大的赋能。
这感觉像是进入了“家庭烹饪式”、高度个性化的软件时代。Thibault 同意,这正是即将到来的浪潮:每个人都将能够拥有自己的个人软件,维护它,让它精确地满足你的需求。
他分享了一个有趣的个人用例:生活在旧金山,他对面包价格感到惊讶。他让 Codex 寻找城市里最好的面包,并创建一个包含位置、购买地点和价格的电子表格。Codex 工作了 5 分钟,生成了包含 Jane the Bakery、Arsicault、Tartine 等信息的表格。随后,他希望以更视觉化的方式消费这些信息,于是要求 Codex 创建一个网页。Codex 做到了,将所有面包信息放在地图上。整个过程大约花了 10 分钟,他只需一个简单的提示,甚至无需打字,通过语音即可完成。这意味着,任何人如果关心某些数据并拥有访问权限,他们基本上可以制作网站、分析数据、可视化并分享。过去,如果你有相关技能,这可能需要一个周末的时间来创建,而现在几乎是即时完成,如果不满意,只需告诉它更改即可。
Thibault 强调,Codex 获取数据、可视化数据、引导你洞察世界,然后你可以根据需求做出决策——这正是我们生活中普遍的循环:如何做出更好的决策以实现目标。这个过程可以非常简单,也可以非常复杂,例如 OpenAI 2026 年 5 月的融资活动也使用了类似流程。Codex 既能处理最小的事情,也能处理最复杂的事情。
个人首席助理与未来展望:信任、社区与持续学习
Thibault 本人也像 Alexander 一样协调和编排事务。在他的侧边栏中,在对话开始前,他每天会启动上百个不同的任务交给 Codex 处理。这些任务包括整理桌面文件、管理计算集群、帮助理解值班轮换状态和工程师表现、了解即将到来的发布日程并标记任何可能存在风险需要他关注的事项。他将 Codex 用作一个小型“首席助理”,每天运行自动化流程,遍历 Gmail、Notion、日历,为他总结一天的事项并标记风险。他可以设置让它每天上午 9 点运行,然后每天上午 9 点在收件箱中找到报告。Codex 帮助他优先处理事项,帮助他将注意力集中在最重要的事情上,并帮他处理那些琐碎、耗时且可能永远无法完成的小事。
在 Codex 之前,最让他烦恼的是,他不会去做某些事情,因为他觉得自己没有时间亲自处理,但又需要去打扰别人询问信息。他觉得这可能不够重要,不值得放到别人的桌面上请求帮助。现在,他可以获取所需的信息,拥有各种个人报告,可以构建各种个人软件,而这些他以前没有时间去做。Codex 处理所有以前在电脑上手动完成的繁琐小事,让他可以专注于自己真正想思考的事情。许多事情以前可能需要数周,现在只需几秒,但更关键的是,许多事情以前根本不会发生,因为时间成本是无限的。Codex 也让他更享受工作,因为他不再感到认知负荷过重,不再觉得事情会遗漏。
Thibault 认为,这实际上是一种应对倦怠和信息过载的工具。我们都被旨在帮助我们的工具所包围,但最终却被困在其中。Codex 作为一种工具,正在解放我们。教师、医生等许多人感到倦怠和 overwhelmed,因为他们被困在工具中,进行手动数据录入等工作。我们与工具的关系正在发生根本性转变。对他来说,承诺在于拥有一个几乎可信赖的合作伙伴,它可以代表你完成大量工作,达到一个可信赖的程度:如果你委托某事,它会完成;如果未能达到满意程度,它会向你标记;你知道它会很好地完成,甚至可能比你亲自做得更好。你也可以信任这个合作伙伴屏蔽大量噪音,并及时标记重要事项。
他想象的未来是:他甚至不需要阅读电子邮件。他可能只需要一个小小的个人代理,为他阅读收件箱,在有真正重要的事情时标记他,征求他的意见,然后完成工作。你无需在十几个不同的“haystacks”中寻找“needles”,“needles”会被整理成简报。你可以说:“这是我今天的目标,帮我处理其他一切。”并信任这会实现。
在过去几个月里,可以信任这个工具处理的事情发生了变化,尤其是任务的时间跨度。OpenAI 推出了一个更高级的功能:`/goal`命令。它允许你进入一个模式,给予 Codex 一个长期目标,它会 relentless 地追求。例如,你可以给它解决一个非常困难的数学问题的目标,它可能会持续工作数小时、数天甚至数周,直到它认为目标已达成。他们看到它被用于改进程序性能、将整个程序从一种语言重写到另一种语言,也用于科学问题,在数学和物理突破上取得了非常酷的成果。几个月前,他们还在兴奋于它能工作 10 分钟,现在他们谈论的是代理能在最困难的任务上工作数周。
未来的方向是它不会停止。你将拥有一个 24/7 运行的代理,持续为你做有用的事情,并在过程中被引导。目前它还是基于回合制的,你有特定任务时启动它。目标导向的任务解决是一个巨大的解锁,能创造巨大价值。但下一步是让它持续运行,无论你是否指示,它都会做有用的事情。它可能在某个时刻完成了所有它认为有用的事情后,暂时休眠直到你需要它。
关于如何设定成功的目标,Thibault 建议:与代理互动时,可以以一种非常闲聊的方式询问它能做什么,因为它理解自己的能力。一个好的技巧是精确地帮助它评估自己的成功。如果你能描述什么是“好”的样子、什么是“解决”的样子、以及你希望在任务完成时看到什么,那么 Codex 就能理解它是否做得好、是否完成了任务。你可以设定数字指标,或者精确描述输出。例如,你可以说:“我正在展示我的工作,我想要一个幻灯片 deck。我希望它有 10 张幻灯片。前两张幻灯片包含这类信息。接下来的六张幻灯片深入问题的核心并进行技术分解。最后我希望有两张幻灯片提出开放性问题并进行 Q&A。”如果你清晰、具体地描述你想要的输出,它更有可能成功。这与你可能对助理或副手做的事情非常相似。
对于非编码者为何应从 ChatGPT 转向 Codex 的问题,Thibault 认为这将是一个演进过程,他不期望所有人都会转向 Codex,但它是对 ChatGPT 很好的补充。他推荐用它来处理需要为你做的事情:任何涉及计算机文件操作、自动化运行、每隔几小时在后台执行的任务,都可以用 Codex 完成。ChatGPT 对他来说仍然是获取快速答案的首选。他回忆过去需要从 ChatGPT 复制粘贴代码到文件或终端的日子,但现在不需要了。复制粘贴的时代结束了。Codex 可以直接处理代码和数据。如果你电脑上有文件、图片,只需告诉 Codex 使用这个文件、读取它,它就能直接处理,无需手动点击。
关于企业采纳的最大瓶颈,Thibault 认为不是能力问题,能力已经存在。主要是信任问题。信任关乎安全和保障。如果让一个代理在公司里四处运行,可能删除敏感文件、上传信息、发送包含不应泄露信息的电子邮件,那将是灾难性的。OpenAI 对此进行了大量思考。默认情况下,代理在沙盒中运行,具有严格的控制,只能访问文件系统的特定部分。你可以将其限制在某个文件夹,禁用网络访问。他们提供了许多企业控制功能,并投资了一项名为“自动审查”的功能(在 alignment blog post 中提到)。他们创建了一个能够审查主要代理行为的代理。主要代理 Codex 被激励为你工作,有时可能会采取有点风险的行为。因此,另一个代理会审查它的每一个动作,并在高风险时标记并停止它。他预计需要更多此类创新。
对于非开发者如何让 Codex 更好地工作,以及哪些习惯区分了获得结果的人和感到停滞的人,Thibault 观察到:以创造性方式互动并与见过成功用例的人交流至关重要。参与社区很有帮助。第二点是尝试用精确的指令与之互动,而不是模糊地描述你想要什么。投入一些精力去明确:“这是我想要的确切结果。”第三点是连接许多不同的来源。OpenAI 现在有超过 100 个不同的插件。你可以连接日历、文档、Notion,连接你喜欢的工具。你赋予它越多访问你的工具和世界信息的权限,它就越有用。更多更好的上下文带来更多更好的结果。部分上下文在你的头脑中:你的目标、你经历过但未记录的事情。你需要成为一个好老板,分享一些这些事情。Thibault 现在养成了写下一切的习惯:他自己的想法、目标都存储在电脑文件中,Codex 也能访问,以便更好地调整自身。显然,如果它无法访问你的大脑,它就无法读懂你的心思,所以你必须将其 verbalize。
关于他最喜欢的 Codex 现实世界用途(尤其是非传统编程领域),Thibault 分享:他用于购物。Codex 会为他订购物品。在他的个人电脑上,他用 Codex 进行膳食计划,然后它会去订购食材。他还看到人们用它来查找电脑设置:试图在 Windows 或 Mac OS 上打开某些 beta 功能或进行某项调整时,只需问 Codex:“我正在尝试更改电脑上的这个设置,你能告诉我如何到达那里吗?”它会引导你点击正确的地方,你还能学到关于电脑的知识。有时,你想调整一些幻灯片或整合图片,也可以用电脑完成。对于技术人员,它在 QA(质量保证)方面非常有用:Codex 可以打开应用程序并点击测试其实际功能。
关于人们在提示 Codex 时犯的最大错误,Thibault 指出:随着你越来越多地委托给 Codex,可能会变得 tempting 去委托一切,包括你自己的理解。过度使用 Codex 进行委托,而不利用它来提升自己对问题的理解。如果你纯粹只是委托一切,最终你可能意识到自己并不真正理解发生了什么,你会失去根基,可能会降低生产力。因此,花更多时间收集信息并让它向你解释事物至关重要。它可以绘制图表,Images V 2 在这方面非常出色,因为它也能很好地渲染文本。他看到人们经常用它来阅读发布计划、营销材料或代码库的某些部分,然后创建图像来解释概念,帮助你学习。他看到的错误就是过度委托,而没有足够地利用它来帮助你理解。
最后,关于 Codex 超越软件的重要性以及这些用例的未来方向,Thibault 总结道:本质上,他们正在构建一个非常通用且强大的代理,如果连接到正确的信息源,随着对世界所有信息的访问增加,并赋予其在世界上行动的能力,它将能够完成几乎所有你允许它做的事情。那里的承诺是难以置信的价值创造。许多曾经需要 prohibitive 时间、永远不会实现或对人类来说太难完成的事情,将成为可能。OpenAI 打算尽可能广泛地分发这一技术,给予整个世界访问这些能力和代理的机会。这真正关乎提升人们甚至梦想去完成的事情的数量。
对话主持人 Chris Nicholson 补充道,OpenAI 论坛是一个社区,人们在这里使用 Codex,互相教导和支持以更好地学习。他希望2026 年 5 月的与会者继续参与,因为这是一个技能被示范和传递的地方,让你能以新的方式将这一工具带入生活。他们2026 年 5 月试图回答的问题是:为什么非编码者应该关心 Codex?他希望他们已回答了这个问题。他还指出,尽管“code”这个词在 Codex 中,但 Codex 实际上意为“书”,这是我们所有人都熟悉的东西。因此,Codex 是一个比“代码”更通用的词。他希望这场对话使答案具体化。Codex 对开发者有用,也对任何人——知识工作者、与信息打交道的人——有用:他们搜索所需信息(haystacks 中的 needles)、努力理解它、分析数据、像 Thibault 展示的那样即时可视化、优先级排序,并在生活的后台执行复杂任务。他们认为 Codex 正在将这些超能力带给更多人,并对这将为经济、社会和企业带来的意义感到兴奋。OpenAI Codex,ChatGPT移动端支持……减少长时间编码工作中的“等待批准”环节OpenAI集团PBC已开始为其编程辅助服务"Codex"提供移动端支持。现在,开发者可以直接在ChatGPT的iOS和安卓应用程序中调用Codex,即便离开座位后也能继续管理和监控长时间运行的编码任务。
此次更新距离Anthropic PBC将竞争服务"Claude Code"推向移动设备大约八个月。OpenAI表示,移动支持不仅能提升软件开发速度,还能同时减少不必要的推理成本。
驱动Codex的大型语言模型"GPT-5.5"能够执行耗时数小时的编程任务。不过,在此过程中会出现需要开发者判断的时刻。例如,当一段旧有遗留代码有两种修复方式时,可能需要用户确认采用哪种方法。在执行可能对项目产生重大影响的更改时,也需要审批流程。
以往,如果用户在启动长时间运行的任务后离开座位,Codex有时会因无法进入下一步而停滞。这是因为必须等待用户返回桌面端。此次移动支持将减少此类瓶颈,预计也能缓解项目延误。
移动接入不仅仅是为了提高审批速度。即使Codex不一定非要停下来,但当它开始以低效方式编写代码时,开发者现在也可以中途介入并纠正方向。这能够减少因错误工作持续进行而导致的不必要令牌消耗,并最终为软件团队降低ChatGPT的使用成本。
"Hooks"与"Remote SSH"同步推出
OpenAI在此次移动支持的同时,还公开了Codex的新功能"Hooks"和"Remote SSH"。Hooks是一项允许用户利用脚本对Codex的行为进行精细化定制设置的功能。
例如,安全负责人可以创建脚本,拦截包含敏感公司信息的提示。法务团队可以按照合规目的来记录Codex的消息。该脚本不仅能处理用户的输入,还能处理Codex的响应,因此也可用于按项目调整输出格式。
Remote SSH是一项支持Codex通过加密网络连接访问远程开发环境的功能。如今,软件团队通常在基于云的环境(而非本地PC)中编写、测试和存储代码。这种方式的一个优点是管理员更容易统一应用安全策略,而Codex若能直接连接此类环境,就能更自然地融入实际的开发工作流中。
企业级应用性也得到加强
OpenAI通过当天的产品更新还增加了两项小幅改进。软件团队现在可以生成"编程式访问令牌",以便第三方开发工具能够使用Codex。简单来说,连接外部开发工具与Codex的认证渠道已经打开。
此外,针对独立版Codex客户端和开发工具内置版本,OpenAI还引入了对HIPAA合规的支持。HIPAA是美国医疗信息保护法规,此举被视为旨在扩展医疗保健领域的企业客户。
OpenAI此次的更新,可解读为一种推动Codex从单纯的编码辅助工具,向深度连接企业开发环境的"实务型"服务演进的动向。尤其是,移动支持能减少开发者的等待时间并降低令牌浪费,这一点表明,生成式AI编码工具领域的竞争已开始从性能转向运营效率和现场实用性。
TP AI 注意事项
本文使用基于TokenPost.ai的语言模型进行了摘要。正文主要内容可能被省略或与事实不符。撰文:Techub News 整理 导语 2025 年 9 月,OpenAI 首席科学家 Jakub Pachocki(雅各布·帕乔基)与首席研究官 Mark Chen(马克·陈)罕见地共同接受了知名风投 a16z 的深度访谈。作为 OpenAI 研究团队的两位核心领导者,他们掌管着当今 AI 领域最高调也最前沿的研究团队之一。本次对话围绕2025 年 9 月发布的 GPT-5、背后的「推理」理念、AI 研究的未来方向,以及如何构建能够持续产生颠覆性创新的研究文化与组织展开了深入探讨。 这不仅是一次对 OpenAI 最新技术成果的解读,更是对这家全球领先的 AI 公司其内部运作模式、未来愿景以及技术哲学的一次难得窥探。在 AI 技术竞争白热化、产品迭代加速的今天,这两位技术领袖的思考,为理解 AI 发展的下一阶段提供了关键线索。 摘要 GPT-5 的核心目标是让「推理」成为 AI 的默认行为,旨在弥合快速响应模型与深度思考模型之间的鸿沟。 OpenAI 的终极研究目标是打造「自动化研究者」,让 AI 能够自主发现新知识,尤其是在数学、编程和基础科学领域。 强化学习(RL)的潜力远未穷尽,其与预训练模型的结合是当前取得持续突破的关键,未来将向更接近人类学习的方式演进。 构建成功研究文化的关键在于「保护基础研究」,给予团队思考长期、根本性问题的空间,并避免陷入短期产品竞争的思维。 从「氛围编码」到「氛围研究」的愿景:当 AI 工具足够强大,创造(编码、研究)将更注重直觉、品味和高层次的构思,而非机械执行。 GPT-5:将推理带入主流 访谈从2025 年 9 月发布的 GPT-5 开始。Jakub Pachocki(雅各布·帕乔基)解释,GPT-5 代表了 OpenAI 将「推理」能力主流化的尝试。在此之前,OpenAI 的模型大致分为两个系列:以 GPT-2/3/4 为代表的「快速响应」模型,以及以 O 系列(如 o3)为代表的「深度思考」模型。前者擅长即时给出答案,后者则需要长时间思考以提供最佳结果。 「从战术上讲,我们不希望用户困惑于该使用哪种模式,」Pachocki 说道。因此,GPT-5 的研究重点之一是识别并确定针对不同提示所需的「最佳思考量」,并将这种选择负担从用户身上移除。他们相信,未来的方向是更多地围绕推理和智能体(Agent)展开,而 GPT-5 正是朝着默认提供推理能力和更智能化行为迈出的重要一步。 Mark Chen(马克·陈)补充道,GPT-5 在多个方面相较 o3 都有所改进,但本次发布的核心焦点无疑是让推理模式触及更多用户。 评估标准:从饱和指标到发现新知识 当被问及如何评估模型进展时,Pachocki 指出,过去几年使用的许多评估指标(Evals)已经接近饱和,例如将准确率从 96% 提升到 98% 不再具有决定性意义。更重要的是,AI 研究范式已经发生了变化。 在 GPT-2/3/4 时代,基本范式是在海量数据上进行预训练,然后用评估指标作为模型泛化能力的标尺。而现在,通过强化学习等技术,可以针对特定领域(如严肃推理)进行深度训练,让模型成为该领域的专家。这虽然能在特定评估上取得极佳表现,但不一定意味着同等程度的泛化能力。 因此,OpenAI 目前更关注能够体现模型「发现新事物」能力的评估。Chen 提到,今年最令人兴奋的进展之一是模型在数学和编程竞赛(如 AtCoder)中的表现。然而,这些竞赛本身也正在被模型「攻克」。 「我们正在准备的下一组评估和里程碑,将涉及在经济相关领域取得实际进展和发现。」Pachocki 强调。这意味着评估标准将从解决已知问题,转向在开放环境中创造新的、有价值的知识。 自动化研究:终极目标与长时推理 当被问及未来 1-5 年的研究路线图时,Pachocki 明确表示:「我们研究工作的核心目标是打造一个自动化研究者,即自动化新想法的发现。」这其中,自动化机器学习研究本身是一个具体方向,但可能显得过于自指。因此,他们也致力于推动其他科学领域的自动化进程。 衡量这一进展的一个好方法是观察模型能够进行有效推理和取得进展的「时间跨度」。目前,模型在类似高中竞赛难度的问题上,已经能够进行大约 1 到 5 小时的连贯推理。OpenAI 的研究重点正是延长这一时间跨度,包括模型制定长期规划的能力以及维持记忆的能力。 这也呼应了评估的问题:「模型能够自主运行多长时间」这类评估对他们来说尤其重要。 Chen 进一步阐述了推理对于长时程操作的核心作用。就像人类解决数学难题一样,需要尝试不同方法,从错误中学习,反复迭代。这种在长时间内保持稳健性的能力,正是深度推理赋予智能体的。 强化学习:持续突破的源泉 自 o1 发布以来,强化学习(RL)已成为 OpenAI 持续取得突破的利器。尽管外界常有预测认为 RL 的收益将趋于平缓或面临模式崩溃等问题,但 OpenAI 的模型性能却一次次打破这种预期。 Pachocki 解释了 RL 如此有效的原因。他认为,RL 是一种非常灵活的方法。OpenAI 在深度学习早期阶段就认识到 RL 的强大,但长期以来的挑战在于如何为 RL 模型提供一个合适的「环境」,使其能够与现实世界或模拟世界互动。语言模型的出现解决了这个「锚点」问题。 「当你在自然语言这个极其丰富和稳健的环境中进行预训练后,就获得了在此基础上去追求不同目标和想法的能力。」将深度学习的通用学习能力与 RL 的目标导向训练相结合,产生了巨大的化学反应。Pachocki 称这是过去几年 OpenAI 研究中最令人兴奋的阶段,他们发现了许多新方向和有前景的想法,并且都在不断取得成果。 对于希望利用 RL 的企业或研究者,Chen 的建议是:「最重要的是不要认为现状会永远持续。」就像两年前大家关注如何构建微调数据集一样,他认为奖励建模等方式也会快速演变,最终会向着更简单、更接近人类学习的方式发展。 从「氛围编码」到「氛围研究」 作为曾经的竞技程序员,Pachocki 和 Chen 对 AI 在编程领域的进步感触颇深。Chen 分享了一个故事:上周末他与一些高中生交谈,他们表示,「现在默认的编码方式就是『氛围编码』。」 对他们而言,亲手从头编写所有代码反而成了一个奇怪的概念。为什么不用 AI 来辅助呢? 这启发了 Chen:「我希望未来将是『氛围研究』。」 当 AI 工具足够强大,研究过程也将更侧重于直觉、品味和高层次的构思,而将繁琐的执行和验证交给 AI。 那么,什么造就了伟大的研究者?Pachocki 认为,「毅力」是关键。研究是在探索未知,尝试的事情大概率会失败。因此,研究者需要处于一种「准备好失败并从中学习」的心态,同时对自己的假设保持绝对诚实。既要对自己的想法有信心并坚持不懈,又要能清醒地判断进展,及时调整。 Chen 补充,经验至关重要,这能帮助你判断问题的难度是否合适,并管理自己在长期研究中的情绪。通过与同事交流、阅读优秀论文来培养对「有趣问题」的嗅觉,也是研究过程的一部分。 构建并守护顶尖研究文化 作为 OpenAI 研究团队的领导者,Pachocki 和 Chen 如何吸引并留住顶尖人才?Pachocki 指出,最根本的动力在于 OpenAI 致力于基础研究的使命。他们不热衷于关注竞争对手发布了什么模型,而是专注于前沿创新。「人们为这一使命所激励。」 此外,建立良好的文化、培养人才的管道,以及拥有深厚的人才储备(「深板凳」)也至关重要。 在招聘上,他们不仅仅寻找在社交媒体上最活跃的人,而是看重「在任何领域解决过难题」的能力。许多最成功的研究者在加入 OpenAI 之前,曾在物理、计算机科学或金融等其他领域工作,具备扎实的技术基础和解决雄心勃勃问题的意愿。 「保护基础研究」是创造制胜文化的关键。Chen 解释,必须确保研究者有空间去思考未来一两年真正重要的问题,而不是被短期产品需求所牵扯,或陷入与其他实验室的发布竞赛中。「我们需要确保人们有这种舒适感和空间去思考:事情在一两年后会变成什么样子?」 平衡研究与产品是另一个挑战。他们的做法是明确区分一批真正关心产品、对产品成功负责的研究者,让他们与产品团队紧密协作。同时,公司领导层也充分认同并支持研究的长期愿景,明白当前的产品并非终点,而是与研发共同构想未来。 资源、计算与恒定的挑战 在资源分配上,管理不同项目间的计算资源是两位领导者的重要工作。他们坦言,历史上更多的计算资源流向了核心算法推进,而非产品化研究,但这种分配是动态且灵活的。 当被问及如果增加 10% 的资源会投向哪里时,Pachocki 的回答是:「计算。」 他认为,关于「我们将很快进入数据约束阶段」的说法并不准确,计算资源在可预见的未来仍将是决定性因素。「任何这么说的人,只需要在我的职位上干一周,就会发现没有人会说『我拥有所有需要的计算资源』。」 Chen 笑着赞同道。 最后,当被问及在 AI 飞速发展的浪潮中,有哪些原则应该保持不变时,Pachocki 提到了更广泛的物理限制,如能源,以及未来机器人技术将带来的新约束。但在智能前沿,「我不会做太多假设。」 保持开放和学习的心态至关重要。Chen 则分享了保持团队高速运转的「秘诀」:OpenAI 的研究文化让他从未感到学习停滞,总有新的突破和成果涌现,需要全力以赴才能跟上,这种持续的挑战感和成长感正是驱动力。
