OpenAI 首席科学家 Jakub Pachocki(雅各布·帕乔基)与首席研究官 Mark Chen(马克·陈)谈从「氛围编码」到「氛围研究」撰文:Techub News 整理
导语
2025 年 9 月,OpenAI 首席科学家 Jakub Pachocki(雅各布·帕乔基)与首席研究官 Mark Chen(马克·陈)罕见地共同接受了知名风投 a16z 的深度访谈。作为 OpenAI 研究团队的两位核心领导者,他们掌管着当今 AI 领域最高调也最前沿的研究团队之一。本次对话围绕2025 年 9 月发布的 GPT-5、背后的「推理」理念、AI 研究的未来方向,以及如何构建能够持续产生颠覆性创新的研究文化与组织展开了深入探讨。
这不仅是一次对 OpenAI 最新技术成果的解读,更是对这家全球领先的 AI 公司其内部运作模式、未来愿景以及技术哲学的一次难得窥探。在 AI 技术竞争白热化、产品迭代加速的今天,这两位技术领袖的思考,为理解 AI 发展的下一阶段提供了关键线索。
摘要
GPT-5 的核心目标是让「推理」成为 AI 的默认行为,旨在弥合快速响应模型与深度思考模型之间的鸿沟。
OpenAI 的终极研究目标是打造「自动化研究者」,让 AI 能够自主发现新知识,尤其是在数学、编程和基础科学领域。
强化学习(RL)的潜力远未穷尽,其与预训练模型的结合是当前取得持续突破的关键,未来将向更接近人类学习的方式演进。
构建成功研究文化的关键在于「保护基础研究」,给予团队思考长期、根本性问题的空间,并避免陷入短期产品竞争的思维。
从「氛围编码」到「氛围研究」的愿景:当 AI 工具足够强大,创造(编码、研究)将更注重直觉、品味和高层次的构思,而非机械执行。
GPT-5:将推理带入主流
访谈从2025 年 9 月发布的 GPT-5 开始。Jakub Pachocki(雅各布·帕乔基)解释,GPT-5 代表了 OpenAI 将「推理」能力主流化的尝试。在此之前,OpenAI 的模型大致分为两个系列:以 GPT-2/3/4 为代表的「快速响应」模型,以及以 O 系列(如 o3)为代表的「深度思考」模型。前者擅长即时给出答案,后者则需要长时间思考以提供最佳结果。
「从战术上讲,我们不希望用户困惑于该使用哪种模式,」Pachocki 说道。因此,GPT-5 的研究重点之一是识别并确定针对不同提示所需的「最佳思考量」,并将这种选择负担从用户身上移除。他们相信,未来的方向是更多地围绕推理和智能体(Agent)展开,而 GPT-5 正是朝着默认提供推理能力和更智能化行为迈出的重要一步。
Mark Chen(马克·陈)补充道,GPT-5 在多个方面相较 o3 都有所改进,但本次发布的核心焦点无疑是让推理模式触及更多用户。
评估标准:从饱和指标到发现新知识
当被问及如何评估模型进展时,Pachocki 指出,过去几年使用的许多评估指标(Evals)已经接近饱和,例如将准确率从 96% 提升到 98% 不再具有决定性意义。更重要的是,AI 研究范式已经发生了变化。
在 GPT-2/3/4 时代,基本范式是在海量数据上进行预训练,然后用评估指标作为模型泛化能力的标尺。而现在,通过强化学习等技术,可以针对特定领域(如严肃推理)进行深度训练,让模型成为该领域的专家。这虽然能在特定评估上取得极佳表现,但不一定意味着同等程度的泛化能力。
因此,OpenAI 目前更关注能够体现模型「发现新事物」能力的评估。Chen 提到,今年最令人兴奋的进展之一是模型在数学和编程竞赛(如 AtCoder)中的表现。然而,这些竞赛本身也正在被模型「攻克」。
「我们正在准备的下一组评估和里程碑,将涉及在经济相关领域取得实际进展和发现。」Pachocki 强调。这意味着评估标准将从解决已知问题,转向在开放环境中创造新的、有价值的知识。
自动化研究:终极目标与长时推理
当被问及未来 1-5 年的研究路线图时,Pachocki 明确表示:「我们研究工作的核心目标是打造一个自动化研究者,即自动化新想法的发现。」这其中,自动化机器学习研究本身是一个具体方向,但可能显得过于自指。因此,他们也致力于推动其他科学领域的自动化进程。
衡量这一进展的一个好方法是观察模型能够进行有效推理和取得进展的「时间跨度」。目前,模型在类似高中竞赛难度的问题上,已经能够进行大约 1 到 5 小时的连贯推理。OpenAI 的研究重点正是延长这一时间跨度,包括模型制定长期规划的能力以及维持记忆的能力。
这也呼应了评估的问题:「模型能够自主运行多长时间」这类评估对他们来说尤其重要。
Chen 进一步阐述了推理对于长时程操作的核心作用。就像人类解决数学难题一样,需要尝试不同方法,从错误中学习,反复迭代。这种在长时间内保持稳健性的能力,正是深度推理赋予智能体的。
强化学习:持续突破的源泉
自 o1 发布以来,强化学习(RL)已成为 OpenAI 持续取得突破的利器。尽管外界常有预测认为 RL 的收益将趋于平缓或面临模式崩溃等问题,但 OpenAI 的模型性能却一次次打破这种预期。
Pachocki 解释了 RL 如此有效的原因。他认为,RL 是一种非常灵活的方法。OpenAI 在深度学习早期阶段就认识到 RL 的强大,但长期以来的挑战在于如何为 RL 模型提供一个合适的「环境」,使其能够与现实世界或模拟世界互动。语言模型的出现解决了这个「锚点」问题。
「当你在自然语言这个极其丰富和稳健的环境中进行预训练后,就获得了在此基础上去追求不同目标和想法的能力。」将深度学习的通用学习能力与 RL 的目标导向训练相结合,产生了巨大的化学反应。Pachocki 称这是过去几年 OpenAI 研究中最令人兴奋的阶段,他们发现了许多新方向和有前景的想法,并且都在不断取得成果。
对于希望利用 RL 的企业或研究者,Chen 的建议是:「最重要的是不要认为现状会永远持续。」就像两年前大家关注如何构建微调数据集一样,他认为奖励建模等方式也会快速演变,最终会向着更简单、更接近人类学习的方式发展。
从「氛围编码」到「氛围研究」
作为曾经的竞技程序员,Pachocki 和 Chen 对 AI 在编程领域的进步感触颇深。Chen 分享了一个故事:上周末他与一些高中生交谈,他们表示,「现在默认的编码方式就是『氛围编码』。」 对他们而言,亲手从头编写所有代码反而成了一个奇怪的概念。为什么不用 AI 来辅助呢?
这启发了 Chen:「我希望未来将是『氛围研究』。」 当 AI 工具足够强大,研究过程也将更侧重于直觉、品味和高层次的构思,而将繁琐的执行和验证交给 AI。
那么,什么造就了伟大的研究者?Pachocki 认为,「毅力」是关键。研究是在探索未知,尝试的事情大概率会失败。因此,研究者需要处于一种「准备好失败并从中学习」的心态,同时对自己的假设保持绝对诚实。既要对自己的想法有信心并坚持不懈,又要能清醒地判断进展,及时调整。
Chen 补充,经验至关重要,这能帮助你判断问题的难度是否合适,并管理自己在长期研究中的情绪。通过与同事交流、阅读优秀论文来培养对「有趣问题」的嗅觉,也是研究过程的一部分。
构建并守护顶尖研究文化
作为 OpenAI 研究团队的领导者,Pachocki 和 Chen 如何吸引并留住顶尖人才?Pachocki 指出,最根本的动力在于 OpenAI 致力于基础研究的使命。他们不热衷于关注竞争对手发布了什么模型,而是专注于前沿创新。「人们为这一使命所激励。」 此外,建立良好的文化、培养人才的管道,以及拥有深厚的人才储备(「深板凳」)也至关重要。
在招聘上,他们不仅仅寻找在社交媒体上最活跃的人,而是看重「在任何领域解决过难题」的能力。许多最成功的研究者在加入 OpenAI 之前,曾在物理、计算机科学或金融等其他领域工作,具备扎实的技术基础和解决雄心勃勃问题的意愿。
「保护基础研究」是创造制胜文化的关键。Chen 解释,必须确保研究者有空间去思考未来一两年真正重要的问题,而不是被短期产品需求所牵扯,或陷入与其他实验室的发布竞赛中。「我们需要确保人们有这种舒适感和空间去思考:事情在一两年后会变成什么样子?」
平衡研究与产品是另一个挑战。他们的做法是明确区分一批真正关心产品、对产品成功负责的研究者,让他们与产品团队紧密协作。同时,公司领导层也充分认同并支持研究的长期愿景,明白当前的产品并非终点,而是与研发共同构想未来。
资源、计算与恒定的挑战
在资源分配上,管理不同项目间的计算资源是两位领导者的重要工作。他们坦言,历史上更多的计算资源流向了核心算法推进,而非产品化研究,但这种分配是动态且灵活的。
当被问及如果增加 10% 的资源会投向哪里时,Pachocki 的回答是:「计算。」 他认为,关于「我们将很快进入数据约束阶段」的说法并不准确,计算资源在可预见的未来仍将是决定性因素。「任何这么说的人,只需要在我的职位上干一周,就会发现没有人会说『我拥有所有需要的计算资源』。」 Chen 笑着赞同道。
最后,当被问及在 AI 飞速发展的浪潮中,有哪些原则应该保持不变时,Pachocki 提到了更广泛的物理限制,如能源,以及未来机器人技术将带来的新约束。但在智能前沿,「我不会做太多假设。」 保持开放和学习的心态至关重要。Chen 则分享了保持团队高速运转的「秘诀」:OpenAI 的研究文化让他从未感到学习停滞,总有新的突破和成果涌现,需要全力以赴才能跟上,这种持续的挑战感和成长感正是驱动力。
OpenAI 开源 Codex Harness,是几个意思撰文:硅谷 Alan Walker
一周之内三家公司做了同一件事,这才是重点2026 年 8 月 20 日California Ave 的酒吧,第二杯还没喝完,群里已经在传「OpenAI 全面开源 Codex Harness」——但真正值得看的不是这一条消息,是它前面六天里发生的另外两件事。01 先把话说准:开源的到底是什么8 月 19 日,OpenAI 开发者博客发了一篇《Codex as a platform: build on the open agent harness》。中文圈翻成了"全面开源"。这个说法有两处不准,得先修掉,不然后面全是错的。
第一,不是新开源。Codex CLI 从 2025 年 4 月发布起就是开源的,用 Rust 写的,MIT / Apache2.0 许可。8 月 19 日这篇不是一次代码发布,是一次定位发布——把已经开源的一堆东西,重新包装成"平台"这个叙事。新东西是 app-server 协议、官方 SDK,和一整套"怎么把 Codex 装进你自己产品里"的说明书。
第二,也是最关键的——不是"全面"。OpenAI 在文章里写得清清楚楚:开源的是 harness 和集成层,模型访问与托管服务 仍然是分开的。先解释一下 harness 是什么模型只会做一件事:给它一段文字,它吐一段文字。它不会读文件、不会跑命令、不会等你点"同意"、不会记住上一轮干了啥。harness 就是包在模型外面、让它能干活的那一整套东西:怎么找上下文、怎么调工具、怎么控制沙箱权限、什么时候停下来要你批准、怎么把上一轮的结果接到下一轮。
模型是发动机,harness 是变速箱、方向盘、刹车和仪表盘。OpenAI 送出去的是车壳和底盘,发动机还锁在自己车间里。02 时间线:三家公司,七天把日历摊开,这件事的性质就完全变了。2026 年 8 月,harness 层的一周8 月 13 日 - DeepSeek 发布 DeepSeek Harness v0.1,MIT 许可,GitHub 开放下载,公开对标 Claude Code。同日发布 V4-Pro,原生支持 OpenAI Responses API,并且直接集成 Codex。8 月 18 日 - Block(Square 和 Cash App 的母公司)开源 Berd——一个本地桌面应用,用一个界面同时管 Goose、Claude Code 和 Codex。8 月 18 日 - Anthropic 的 Claude Code CLI 发布 v2.1.229 性能修复,把 p99 CPU 占用从 24% 压到 10%(改了 Bun 垃圾回收的调度方式)。8 月 19 日 - OpenAI 发布《Codex as a platform》。看出来了吗?harness 这一层,在这七天里被三家公司同时按到了"免费"这个价格上。DeepSeek 用 MIT 许可送,Block 直接送了个统一壳子,OpenAI 第六天出来说"我们的也是开源的,而且是标准"。
这一段是全文的地基你没法卖一样马上就要免费的东西。你只能决定,要不要当那个把它送出去的人。DeepSeek 在 8 月 13 日把时钟按下去了。OpenAI 在 8 月 19 日回答的,不是"我要不要开源",而是"这件事的署名权归谁"。时间差只有六天,这不是巧合。
一句话解读把这理解成 OpenAI 主动出招,会误判它的处境。更准确的说法是:它抢在别人之前,把一个已经保不住的东西送了出去,并且要求署名。03 那句最容易被跳过的话整篇公告里最重要的一句,藏在中段,语气平淡到几乎让人跳过去:"开源的这一层是 harness 和集成界面;模型访问 与 托管服务 保持独立。"这一句话把整件事的结构说完了。而且它有一个现成的、所有人都见过的模板——举个例子 · 安卓
安卓是开源的。任何人都可以拿 AOSP 源码去改、去发行、去做自己的手机系统。但 Google 移动服务(GMS)——应用商店、地图、推送、账号体系——不开源。结果是什么?十几年过去,能 fork 安卓的公司有几十家,能在没有 GMS 的情况下把手机卖到全球的,几乎没有。Google 送掉了操作系统,留下了操作系统之上那层让它值钱的东西。
Codex harness 就是 AOSP。模型访问加托管服务,就是 GMS。
这个结构的精妙之处在于:送掉的那一层,本来就快没有定价权了;留下的那一层,定价权在变强。04 为什么 harness 突然这么重要要理解 OpenAI 为什么肯送,得先理解 harness 到底能带来多大差别。公告里给了一个数,我认为是全文最硬的一个数据点。同一个模型,换一套 harness
模型 - GPT-5.6 Sol,一字未改测试 - ARC-AGI-3改动 - 只改了两个 harness 设置:保留推理链(retained reasoning)+ 上下文压缩(context compaction)结果 - 得分从 13.3% 升到 38.3%,同时输出 token 减少到原来的 六分之一
把这个数分析一下:模型没动,只动了外面那层壳,能力接近翻了三倍,成本降到六分之一。一句话解读这意味着在今天这个阶段,harness 对"你实际能拿到多少智能"的影响,可能比换一代模型还大。那么一个反直觉的推论就出来了:如果外面这层壳的杠杆有这么大,而全世界大部分人的壳都做得很烂,那就等于你的模型一直在被别人的烂壳测量、被低估。把自己的壳开源,是最省钱的一种自证——让所有人在评估你的模型时,用的是你自己调好的那套。
再看两个技术细节,能佐证这不是营销文案:网络成了瓶颈。OpenAI 工程师在 AI Engineer World's Fair 上讲过,当 GPT-5.3 Codex Spark 在 Cerebras 硬件上跑到每秒 1000 个 token 时,卡住的不再是推理速度,是 网络往返。于是他们把 harness 从 HTTP 请求改成了 WebSocket 长连接。推论:推理已经快到让"管道"成为限制。这条路继续走下去,harness 的重要性只会更高。
工具太多会撑爆上下文。harness 里用了"延迟工具"和"工具搜索"两个设计,目的是别把几百个工具定义一股脑塞进上下文。MCP 生态铺开之后,这是一个真实的、马上会撞上的工程问题。05 是冲着 Anthropic 上市来的吗
先说时间:Anthropic 6 月保密递交招股书,市场预期 9 月或 10 月 上市,传的目标估值 2 万亿美元。OpenAI 8 月 19 日 发这篇。正好落在路演窗口里。但要判断它有没有杀伤力,得先看杀伤路径是什么。Anthropic 的估值故事里,有一条很关键的支柱:Claude Code 是稀缺资产。它长得快、赚钱、而且是 闭源 的——外面买不到。第三方追踪的数字是 Claude Code 占 Anthropic 总 ARR 约 22%。OpenAI 这篇文章要传达的,正好是这条支柱的反面:
攻击点agent 的那个执行循环,不是稀缺资产。它是基础设施,而且我们免费送,还带 SDK 和示例应用。如果市场信了这一句,Claude Code 就从"稀缺资产"变成"做得比较好的一个实现"。倍数会跟着这个判断走。但我要把这个判断的边界说清楚,不然就是危言耸听:它打的是 叙事,不是报表。harness 免费,不代表模型免费。Claude Code 的收入来自 token 消耗和席位订阅,不来自卖 harness——Anthropic 从来没卖过 harness。所以短期内这一击落不到损益表上。
它只够到 22%。另外 78% 是 API 和企业业务,跟 harness 是不是开源基本无关。路演窗口里,叙事就是钱。承销商定价靠的是可比公司和故事强度。在这个特定的六周里,"编程 agent 是不是稀缺资产"这个问题的答案,值真金白银。一句话解读时间点太巧了,说完全没有考虑对手的上市窗口,不太可信。但把它读成"OpenAI 为了打击 Anthropic 才开源",会看错因果——DeepSeek 已经在六天前把这层送出去了,OpenAI 不跟就是白丢署名权。对上市窗口的伤害,更像是一个顺手的副产品,而不是主要动机。06 做 harness 的创业公司,生意没了
这是所有影响里最直接、最没有悬念的一条。一家创业公司如果原来的定位是"我们做一个更好的 agent 运行时/执行循环/CLI 工具",那么从 8 月 19 日起,它的融资材料需要重写。理由很简单:agent 执行循环 → 免费(MIT / Apache 2.0,Rust 写的,生产级)客户端协议 → 免费(app-server,有完整文档)编程接口 → 免费(官方 Codex SDK)可参考的完整实现 → 免费(Relay 示例应用,带 MCP 工具和人工审批)
另一家的同类品 → 免费(DeepSeek Harness,MIT,6 天前)OpenAI 甚至没有用"竞争"这个动作。它在文章里直接对创业者说:别去 复刻 一个换了 logo 的 Codex app,去做那些我们不做的东西——你自己的界面、你自己的上下文、你自己的工具、你自己的审批流程。
举个例子这套打法有个老名字,叫「把互补品做成白菜价」。Google 免费送安卓,是为了让手机变便宜,好让更多人用搜索。Meta 免费送 React 和 PyTorch,是为了让前端和 AI 人才用它的标准长大。你送掉的东西越不值钱,你留下的东西就越值钱——前提是这两样必须一起用。那还剩什么能做?三块,而且都不在运行时这一层:垂直的上下文和工具。报税、安全事件响应、供应链调度——OpenAI 自己点名说这些归你。Thrive Holdings 和 Crete 做的报税 agent 处理了 7000 份报税表、把准备时间砍掉约三分之一,这是个真实的样本。
评测与可观测。agent 跑错了怎么发现、怎么归因、怎么回归测试。这一层还没有标准答案。跨模型的编排层。Block 的 Berd 就是这个方向——一个界面管三家的 agent。但要注意,Block 自己把它开源了,说明这一层也很难直接卖钱。07 对 DeepSeek、Kimi 是帮忙还是下套
这是全文我认为最值得想清楚的一节,因为直觉给的答案是错的。表面上:这是天大的好事harness 开源了,理论上任何开源模型都可以塞进去跑。DeepSeek 也确实立刻这么做了——V4-Pro 原生支持 OpenAI 的 Responses API,并且直接集成 Codex。国产开源模型的开发者体验,一夜之间接上了世界上打磨得最好的那套壳。往下一层:接口的定义权归谁
问题在于,DeepSeek 为了接进这套壳,做了一件事——它让自己的 API 去 兼容 OpenAI 的 schema。而 Responses API 的规范,现在由一个多厂商机构治理,成员包括 Nvidia、Ollama、LM Studio。这一段是重点
把自己的 API 交给一个标准组织去治理,看上去是放权。实际效果是相反的:标准组织会让一个原本属于某一家的设计,变成所有人的默认。标准委员会几乎从不推翻发起者的架构,它们的工作是把它固化下来、发给全行业。举个例子这就像所有电器厂商都同意用同一种插座。听起来很公平——直到你意识到插座的形状是其中一家画的。之后每一个新做电器的人,都得先量一遍那个孔位。做电器的可以随便竞争、随便降价,但"什么叫能插上"这件事,永远由画孔位的人定义。
后果:模型从"平台"降级成"零件"顺着这条路走下去,会发生一件对开源模型很不利的事:用户的工作流、记忆、插件、技能、审批规则、上下文管理策略——全都活在 harness 里,不在模型里。模型变成了那个可以 随时被拔下来换掉 的部分。好消息是:换模型变容易了,DeepSeek 和 Kimi 可以靠价格和权重抢份额。坏消息是:换模型变容易了。你抢来的份额,明天同样可以被下一家用同样的方式抢走。把它说完整开源 harness,把模型之间的竞争,从平台战争降级成了零件比价。而在零件比价里,价格一定往下走,利润归那个定义了插孔的人。
所以对 DeepSeek、Kimi 这类开源模型来说,这一步短期是实打实的助力—— 分发成本骤降,开发者能立刻用上。长期是一个结构性的陷阱——你越好用,就越证明"模型是可替换零件"这个命题,而这个命题成立之后,最难赚钱的恰恰是做零件的。一句话解读
OpenAI 没有拦着开源模型进场。它做的是把场地铺好、把规则写好,然后欢迎所有人进来打——在它画的球场上。08 商业模式:送中间,收两头把整条价值链摊平,OpenAI 的取舍一目了然。最底层 - 模型权重、推理算力、托管服务、企业管控 → 收钱,且不开源
中间层 - agent 执行循环、客户端协议、SDK、CLI → 免费送出上层 - 界面、垂直上下文、工具、审批流 → 交给开发者做最上层 - ChatGPT 约 10 亿月活、插件生态、结算与广告 → 收钱,且不开源注意最后一行。翻 OpenAI 开发者文档的侧边栏,能看到 Commerce(结算)和 Ads(广告)两套完整 API——商品目录、转化追踪、广告主账户、竞价、效果衡量,一应俱全。
这才是终局的形状:免费送掉中间那层没有定价权的管道,把流量入口和结算入口这两头攥死。
举个例子你可以把 harness 想成高速公路,OpenAI 免费修、免费让所有人跑。但加油站是它的(模型和算力),路尽头那座城是它的(10 亿月活的 ChatGPT),城里收租和收广告费的也是它(结算和广告 API)。路修得越好、跑的车越多,两头越赚钱。修路这件事本身赚不赚钱,根本不重要。顺带回答"是不是为了资本市场":是,而且很有效。"我们有一个很好用的编程 app"和"我们是 agent 时代的平台层",在募资材料里是两个完全不同量级的故事。前者的对标是一家软件公司,后者的对标是安卓和 Windows。09 数字与摩擦
几个能 量化 的东西,正反都列出来。往上的· 用户规模:Codex 从 2026 年 3 月的 200 万周活,到 8 月约 1000 万月活。OpenAI 整体约 10 亿月活。· 已经接进来的:GitHub 和 JetBrains 把 Codex 作为 agent provider 接入了自己的 IDE(7 月 7 日);Cisco 用 Codex SDK 做了 Cloud Control 里的 App Builder;Thrive Holdings 与 Crete 的报税系统跑了 7000 份报税表。
· 内部自证:OpenAI 的 harness 团队从 2025 年 8 月到 2026 年 1 月,用 agent 写出了 100 万行生产代码、1500 个合并 PR,期间没有一行源码是人手写的;团队到七个人时,稳定在每人每天3.5 个 PR。10 Anthropic 手里还有什么牌
这一节必须写,否则前面九节就是选择性叙事。Anthropic 在这件事上真实的暴露面是:Claude Code 的 harness 是闭源的。如果行业在一套开放 harness 加一套开放协议上标准化了,Claude 的处境就会变成"一个可以插进去的模型",而 Claude Code 那套完整体验的差异化,会越来越难讲清楚。这是真的风险,不该回避。
但棋盘上还有另外一半:值得注意的事实OpenAI 这篇公告里,MCP 出现了七次以上——"应用自有的 MCP 服务"、"MCP 工具"、Relay 示例应用的工具层,全部建立在 MCP 之上。MCP 是 Anthropic 提出并开源的协议。再翻一层:OpenAI 的开发者文档里,有一个页面叫 "Submit a Claude Code plugin"。所以真实的格局,比"OpenAI 围剿 Anthropic"复杂得多:
Anthropic 拿下了 工具协议层。MCP 已经是事实标准,连对手的旗舰产品都建在上面。OpenAI 正在拿下 执行循环层 和 API schema 层。harness 加 Responses API。两家都在对方的地基上盖房子。这不是一方吃掉另一方,是两个标准体系在互相咬合。一句话解读这一层的竞争,赢面不在"谁的产品更好",在"谁定义的东西被更多人当成默认"。到今天为止,工具怎么接是 Anthropic 说了算,agent 怎么跑是 OpenAI 说了算。两家各拿了半张牌桌。11 写在最后
回到最开始那个问题:到底是几个意思?我的答案是,主要是三个意思,重要性递减:第一,抢署名权。DeepSeek 8 月 13 日已经把 harness 用 MIT 送了出去,Block 8 月 18 日送了个统一壳子。这一层的价格已经是零,OpenAI 唯一能争的,是"这套标准是谁定的"。它在第六天出手,争到了。第二,把智能的度量权收回来。同一个模型,换两个 harness 设置,得分从13.3% 到38.3%,token 降到六分之一。当外壳的 杠杆 有这么大,你就不能容忍全世界用别人做的烂壳来评估你的模型。开源自己的壳,是最 省钱 的自证方式。第三,把中间那截不赚钱的管道送掉,把两头攥紧。底下是模型和算力,上头是 10 亿月活加结算和广告。中间那截,本来就没有定价权。
至于"打击 Anthropic 上市"——时间点太巧,不信它完全没考虑过。但把它当成主要动机,会看错这件事的因果方向:OpenAI 不是在选择进攻,它是在被推着做一件不做就吃亏的事,然后顺手把动作做得很漂亮。真正需要盯的,是九月十月两件事撞在一起:Anthropic 的 招股书,和第一批真正建在 Codex app-server 上的第三方产品。前者会把叙事换成审计过的数字,后者会告诉你这套标准到底有没有人真的用。
核实说明一、已核实(一手来源)· OpenAI 开发者博客《Codex as a platform: build on the open agent harness》,2026 年 8 月 19 日,作者 Nicolas Bonamy、Derrick Choi。文中关于 harness 定义、三种集成方式(codex exec / Codex SDK / app-server)、Relay 示例应用、以及"开源层为 harness 与集成界面,模型访问与托管服务保持独立"的表述,均直接来自该文。
· ARC-AGI-3 数据:保留推理与上下文压缩使 GPT-5.6 Sol 得分从 13.3% 升至 38.3%,同时输出 token 减少至六分之一——来自该文引用的 OpenAI 官方页面。· 已公开的采用方:GitHub 与 JetBrains(2026 年 7 月 7 日)、Cisco App Builder、Thrive Holdings 与 Crete 的报税系统(7000 份报税表、准备时间约减三分之一),均在该文中列出并附官方链接。
· OpenAI 开发者文档确实包含 Commerce 与 Ads 两套 API,以及名为「Submit a Claude Code plugin」的页面(见开发者站导航结构)。· DeepSeek Harness v0.1 于 2026 年 8 月 13 日发布,MIT 许可、GitHub 开放,公开对标 Claude Code;同日 DeepSeek-V4-Pro 发布,原生支持 OpenAI Responses API 并集成 Codex(VentureBeat,8 月 13 日)。
· Codex CLI 于 2025 年 4 月首发;2026 年 3 月超过 200 万周活(Wikipedia 引 Reuters 等)。二、单一来源 / 需二次核对· harness 用 Rust 编写、MIT / Apache2.0 双许可,Responses API schema 由含 Nvidia、Ollama、LM Studio 的多厂商机构治理,以及 WebSocket 改造与「延迟工具/工具搜索」设计——来自 OpenAI 工程师 Dominik Kundel 在 AI Engineer World's Fair 的演讲报道(BigGo Finance 转述),未核对演讲原始录像。
· Codex「约 1000 万月活」与 OpenAI「约 10 亿月活」来自 The Deep View 的独家报道,非 OpenAI 官方披露。· harness 团队 100 万行代码、1500 个 PR、零人工手写代码、每人每天3.5 个 PR——来自 OpenAI《Harness engineering》博客及第三方转述(SaaSCity),数字口径未独立复核。
· Block 于 2026 年 8 月 18 日开源 Berd、Anthropic Claude Code CLI v2.1.229 的 p99 CPU 优化数据,均来自 explainx.ai 的行业汇总,未见双方官方公告原文。· Claude Code 占 Anthropic 总 ARR 约 22%,来自第三方追踪机构 TickerTrends 的估算,非 Anthropic 官方披露。Anthropic 从未单独公开 Claude Code 的 ARR。· Anthropic 2 万亿美元 IPO 目标估值为媒体转述的市场预期,非公司公开表态。
三、作者推断(非事实)· 「OpenAI 是被 DeepSeek 8 月 13 日的动作推着走、争的是署名权而非主动进攻」——这是基于时间线的推断,OpenAI 从未如此表述,也不排除其内部早有此规划。· 安卓 / GMS 的类比、「插座孔位」的类比、以及「开源 harness 把模型从平台降级为零件」的结论,均为作者判断。· 「打击 Anthropic 上市窗口更像顺手的副产品而非主要动机」为推断,无任何内部信息支持。
· 对 harness 创业公司剩余空间的三点判断(垂直上下文、评测可观测、跨模型编排),为作者判断。· 「工具协议归 Anthropic、执行循环归 OpenAI,两家各拿半张牌桌」为作者对当前格局的概括,随时可能被新事件推翻。四、重要提示· 本文由 Claude(Anthropic 制造)协助撰写,核心议题涉及 OpenAI 与 Anthropic 的直接竞争,存在最直接的利益冲突。第十节已尽量写出 Anthropic 真实的暴露面,但读者仍应假定本文存在无法完全消除的偏向。· 「全面开源」是媒体表述,不是 OpenAI 的表述。OpenAI 明确说明模型访问与托管服务不在开源范围内。
· 本文不构成投资建议。—— Kea
DeepSeek做了一款"不是模型"的产品Harness,却可能比模型更重要8月13日晚,DeepSeek没有发新模型,而是开源了一个叫Harness的东西。
一天之内,GitHub星标近8万。这个速度超过了当年R1和Grok-1的纪录。
Harness不是模型权重,不是API接口,而是一层"壳"——套在模型外面、让模型真正能干活的执行系统。DeepSeek给了一个公式:Model + Harness = Agent。
翻译一下:模型负责想,Harness负责干。
为什么DeepSeek要做这个?
这个问题才是整件事最有意思的部分。
就在Harness发布之前,DeepSeek的API文档里列了十几家第三方Agent集成工具——Claude Code、Codex、Cursor、Copilot……什么都有,唯独没有自家的Agent产品。模型是它家的,干活的手是别人家的。
这就像一个造了顶级发动机的人,发现所有整车厂都在用他的引擎,但方向盘、底盘、变速箱全是别人的。他决定自己造一辆完整的车。
更深层的原因是:同一个模型被放进不同的Agent系统,表现可能差出一大截。模型只负责预测下一步,真正决定体验的是Harness——它决定模型能看到什么上下文、能调哪些工具、出错怎么重试、什么时候算任务完成。
没有Harness的强模型,本质上只是"很贵的自动补全"。
"一切皆插件"到底意味着什么
Harness的核心设计原则写在官网首页:Everything is a plugin。
大多数Agent框架只在工具层开放扩展——加个搜索工具、接个MCP服务器,到头了。DeepSeek Harness把插件边界一路下沉到了运行时底层:模型适配器、工具、技能、会话、沙箱、存储、Agent循环、调度、甚至UI,全是可替换的插件。
整套架构基于Cordis插件元框架构建。开发者不需要改源码,只在配置文件里调整插件清单,就能换模型、换沙箱、换循环逻辑、换整个界面。
这跟LangChain、LangGraph那类编排库的思路完全不同。LangGraph是在框架里画流程图,节点和边写死了;Harness是给你一块巨大的洞洞板,每个零件都能拔下来换掉。
四种运行模式本质上就是同一套插件的四种组合方式:
标准模式:全副武装,文件编辑、shell、搜索、子Agent、工作流,日常开发直接用。
PTC模式:模型不是一步步调工具,而是先写一段TypeScript代码,用代码编排多轮调用——适合复杂多步任务。
极简模式:只留shell和文件编辑两个工具,专门用来做模型基准测试。V4-Flash的Agent跑分就是用这个模式跑的。
创造模式:实时检查运行时、在内存里试验插件、拼出新的运行模式——这是给框架开发者准备的实验室。
和Claude Code、Codex有什么不同
直接对标的是Anthropic的Claude Code和OpenAI的Codex。三者都意识到执行层是模型能力落地的最后一环。
但路径截然不同:
Claude Code是闭源成品,开箱即用,体验丝滑,但编排核心不开放,模型天然优先Anthropic。你用它,就得按它的规则玩。
Codex是OpenAI的托管Agent方案,同样闭源,深度绑定GPT系列。
DeepSeek Harness选了最难走的路:开源、MIT协议、模型中立。它支持DeepSeek、Anthropic、OpenAI、Bedrock、Vertex、Azure以及任意OpenAI兼容端点。你不一定非得用DeepSeek的模型——你可以把Harness当成一个通用的Agent底座来用。
这意味着什么?意味着DeepSeek赌的不是"我的模型最好",而是"我的壳最好,你用我的壳,大概率还是会选我的模型"。
这个策略很精明。框架是入口,模型是变现。Harness免费开源,但跑Agent需要消耗模型token——而DeepSeek刚刚把API价格涨了。
一个设计细节值得单独说
Harness有一个看似不起眼但极其关键的设计:append-only会话日志。
模型看到的一切——系统提示词、思维链、工具调用结果、子Agent调度、每一次上下文注入——都被写进一条只追加不修改的事件流。恢复、分叉、检索、回放全部基于同一条事件流。
这解决了一个Agent开发中非常痛的问题:长任务跑着跑着挂了,你想从断点恢复,但你不知道模型当时到底看到了什么。如果上下文只活在内存里,一恢复就串味。Harness让任务状态有了"唯一事实来源"。
这个设计思路,跟分布式系统里的event sourcing一脉相承。
结语:AI竞争的战场正在转移
DeepSeek Harness把开源竞争的边界从模型延伸到了Agent工程体系。
之前大家比的是上下文窗口多大、跑分多高、价格多低。现在DeepSeek把竞争推到了一个新的维度:谁的Agent跑得稳、扩得动、生态建得起来。
当然,v0.1只是开发者预览版,官方明确警告"会有破坏兼容性的改动"。仓库超过230个workspace成员,架构野心很大,但离生产级稳定还有距离。现在就说颠覆谁,为时过早。
但三个信号已经很清楚了:
第一,模型厂商的下一个战场不是模型本身,而是执行层和反馈闭环。
第二,"一切皆插件"的微内核架构,可能成为Agent框架摆脱单体瓶颈的主流方向。
第三,谁掌握了Harness,谁就更接近真实任务入口——进而影响模型选择、工具分发和开发者工作流。
DeepSeek造了一个发动机,现在又造了一辆车。至于这辆车能跑多远,取决于有多少人愿意在它上面装自己的零件。
OpenAI CEO Sam Altman(萨姆·奥尔特曼):AI 奇点已至,我们正迈向“智能公用事业”时代撰文:Techub News 整理
在2026 年 5 月于旧金山举行的 Stripe Sessions 大会上,OpenAI 联合创始人兼 CEO Sam Altman(萨姆·奥尔特曼)与 Stripe 联合创始人兼 CEO Patrick Collison(帕特里克·科里森)进行了一场长达一小时的深度对话。这场对话发生在 AI 技术发展看似进入“抛物线增长”的关键时刻,两位科技领袖不仅回顾了 OpenAI 近十年的跌宕历程,更聚焦于 AI 如何从一项前沿研究演变为即将重塑全球基础设施、商业逻辑与科学发现的根本性力量。Altman 的分享,为理解 OpenAI 的战略意图和 AI 产业的未来走向提供了极为珍贵的视角。
感知奇点:从 Codex 爆发到无处不在的 AI 助手
Patrick Collison(帕特里克·科里森)在开场便抛出了一个有趣的说法:将今年 1 月 1 日定义为“奇点”的开始,当天是第 119 天。Sam Altman(萨姆·奥尔特曼)对此表示认同,他认为当前确实处于技术“起飞”阶段。这种感知并非空穴来风,OpenAI 内部的多项指标从去年末到今年初发生了“抛物线式”的 inflection(拐点)。Altman 将这一变化归因于模型能力,特别是编码能力,在去年底今年初跨越了某个关键阈值。
“Codex 正在迎来它的高光时刻,” Altman 说道。他分享了两个个人感知的拐点:一次是随着 GPT-5.2,而最近几周则是一次巨大的飞跃,让他感觉这即将成为自己与计算机交互的主要界面。尽管目前最坚定的用户仍将 AI 用于编程,但一股“浪潮”正推动更多用户涌入,并将其用于各种非编码任务。OpenAI 的雄心远不止于编程,而是覆盖所有在电脑前完成的工作。Altman 估计,在非编码领域,他们可能只完成了 10% 的路径,但拥有真实用户基础后,进展会非常迅速。
那么,继编程之后,下一个被 AI 彻底解锁的领域会是什么?Altman 认为,编程因其巨大的社会需求和对模型的天然适配性,可能是一个特例。但更根本的变革在于,人们将意识到自己浪费了多少时间在繁琐的电脑操作上——在消息应用间切换、复制粘贴、回复枯燥邮件等。AI 将接管这些“苦差事”,从而大幅提升人们的工作幸福感和生活品质。这种主观体验的改善将是巨大的。
谈到具体的 AI 应用体验,Altman 以 OpenAI 2026 年 5 月推出的智能体产品 OpenClaw 为例,分享了几个“魔法时刻”。作为一个家庭自动化爱好者,他多年来尝试构建更好的家庭自动化系统均告失败,而 OpenClaw 是第一个让他满意的方案。他还用它构建了一个一直想要的消息处理应用,来自动化处理早晨令人不悦的消息洪流。更令人惊奇的是,在测试新产品时,他让他的 AI 代理用一次性虚拟卡为自己在网上购买一份 20 美元以下的礼物,结果代理选择在 Gumroad 上为自己购买了一个 HTTP 状态码设计图。这些体验模糊了工具与具有“意愿”的实体之间的界限,带来了奇妙甚至略带诡异的感觉。Altman 甚至透露,在为 GPT-5.5 策划庆祝派对时,他询问了模型自己的想法,而模型给出了一套详尽、周到且带有幽默感的方案,这让他感受到了某种真实的“道德压力”。
OpenAI 的演进:从研究实验室到全球智能公用事业
对话自然转向了 OpenAI 本身。这个如今举世瞩目的组织已走过 11 个年头。Altman 分享了 OpenAI 历史上一个未被讲述的“最疯狂”故事:在 GPT-4 训练完成到正式发布的八个月空窗期里,公司内部所有人都在使用这个他们认为将改变世界的模型,而外界几乎一无所知。这种内部集体认知与外部反馈真空的状态,让他们一度怀疑自己是否陷入了“集体精神病”。这段经历虽然不如后来的董事会戏剧或诉讼引人注目,但亲身经历者感觉异常奇特。
谈及管理风格,Sam Altman(萨姆·奥尔特曼)自称绝非事无巨细的管理者。他的哲学是找到优秀的人,给他们指明一个高层次的方向,然后让事情自然发生。他将 OpenAI 的发展分为三个阶段:第一阶段是纯粹的研究公司,目标是探索在当时看来“完全疯狂”的 AGI 之路;第二阶段是在继续研究的同时,学习如何打造一家产品公司;现在正进入第三阶段,即在前两者的基础上,学习如何构建一个面向全球的、超大规模的“智能代币工厂”。
“我认为我们所做的是在构建一种新的公用事业,” Altman 阐述道,“人们会希望以各种方式使用大量的代币、大量的智能。我们需要让这些智能尽可能聪明、便宜、丰富且易用。” 这需要深度的全栈整合和 Massive(巨大)的基础设施建设。他坦言,从第一阶段到第二阶段的转变中,他并未充分意识到管理风格需要做出多大改变,而第三阶段又将截然不同,这对他并非天然契合。他正在思考如何改变自己,或找到合适的人,甚至打造一个能管理这项新事业的 AI。
对于外界关于 AI 实验室将“吞噬整个价值链”并形成霸权力量的担忧,Altman 给出了明确的回应。他赞赏 Stripe 作为基础设施提供商,其成功与客户成功高度 aligned(对齐)的模式。他希望 OpenAI 也能达到类似的模式:成为一家基础设施提供商,一个“永远低利润率”但规模巨大、增长迅速的业务,提供一种“智能计量器”,让企业购买用以自动化流程、加速内部运作或构建产品。他相信,随着 AI 越来越智能,切换成本会降低,维持高利润率将很困难。OpenAI 的目标是与全球分布式经济引擎的成功深度对齐。
这自然引向了另一个热议话题:对算力的巨额投资。Altman 早在两三年前就提出的、当时听起来“荒谬”的基础设施建设规模,如今正日益成为现实。他承认,这很可能将成为人类历史上最昂贵的基础设施项目。好在收入正在快速增长以匹配支出,同时效率提升也远超预期。关键在于,当智能单位价格足够低时,需求几乎是无限的。“我们不会去建造戴森球然后铺满数据中心……但也许我们会?”他半开玩笑地说。他认为目前并未处于资本支出泡沫中,需求规模与投资规模相比是合理的。至于如何辨别真正的泡沫,这位前投资者承认自己从未找到可靠的框架,经济学家们“成功预测了过去八次衰退中的三次”。
人才、合作与创业生态的变迁
在高度依赖顶尖人才的 AI 领域,如何管理那些才华横溢但可能个性鲜明、难以合作的“明星”员工?Altman 透露,曾有人为他总结 OpenAI 成功的“秘诀”:他成功让一群都自认为是唯一或最有能力、且凡事必须按自己方式行事的人,在一起合作足够长的时间,直至实现突破。秘诀就是“大量的痛苦”。OpenAI 依靠的是少数深层次的共同信念:相信规模化、相信集中资源、相信正在做的事业足够重要,以至于人们愿意放下个人恩怨。例如,在训练 GPT-3 时,公司将绝大部分算力投入单一研究项目,这与当时其他实验室(如 DeepMind)强调均衡分配的文化截然不同,但他们选择了坚信并排除干扰。
谈及与联合创始人 Greg Brockman(格雷格·布罗克曼)长达近十年的成功合作,Altman 认为共同的历史、共享的价值观、深刻的相互尊重以及互补的技能组合是关键。他观察到,在 Y Combinator(YC),创始团队相识时间的长短是预测成功的重要指标。他非常感激能有这样一位深度信任的伙伴共同经历这场 intense(高强度)的创业之旅。
作为全球最成功的创业投资者之一,Altman 也被问及 AI 时代成功创业者的特质是否发生了变化。他幽默地提到,过去行业会嘲笑只有“点子”没有技术能力的“点子王”,但现在情况正在反转——“点子王”们正在迎来“复仇时刻”。虽然技术能力依然重要,但他现在也非常愿意投资那些深度理解用户但完全不会编程的创始人。这是一个巨大的转变。
面对可能在未来几年内出现的 AGI 或“奇点”,如何思考具有十年周期的风险投资?Altman 认为,这确实需要“真正的不信 suspension of disbelief”,但这可能是正确的生活方式。你不能因为相信奇点将至就什么都不做,你必须像世界仍将长期以可理解的方式运行那样去生活和规划。OpenAI 自己的规划也是如此:他们签署了长达 20 年的电力和土地协议,对两年内的产品有清晰愿景,但再往后就模糊得多。
关于建立在 AI 之上的创业公司(曾被称为“GPT 包装器”,现多称“AI 应用”或“智能体平台”)的持久性问题,Altman 的观点始终如一:一家公司应该站在希望 AI 变得更聪明的这一边。如果你的业务是修补当前模型的某个明显弱点,那么下一个更强大的模型发布时你就会难过。如果你的业务是随着模型智能提升而变得更好,那么你会更开心。无论是“包装器”还是“平台”,道理相通。
赋能未来:科学、社会与 OpenAI 的终极愿景
当被问及哪些组织最能有效利用 AI 时,Altman 举了几个例子。首先是 Shopify 的 CEO Toby Lutke(托比·吕特克),他率先宣布公司要“全面投入 AI”,并亲自动手用 AI 自动化一切,要求团队也必须这样做。这种来自最高层的、亲身实践的推动力效果显著。OpenAI 甚至计划尝试派遣类似“技术专家”直接与公司 CEO 合作,自动化其工作,产生“分形效应”。其次,是那些对数据访问“ uncomfortably permissive”( uncomfortably 地宽松)的公司,允许 AI 访问代码库、会议记录、Slack 消息、邮件等一切数据。这对于拥有敏感数据的大公司来说挑战巨大,涉及隐私与效率的权衡,可能需法规调整,但其威力在小团队中已展现得淋漓尽致。Altman 以 Stripe 孵化的区块链项目 Tempo 为例,其团队在 Slack 中设置了一个智能体工具,几乎能 orchestrating(协调)公司的一切——阅读文档、创建任务、编写代码、部署、测试,整个小型组织的运作在一个 Slack 频道中完成,景象令人震撼。
对于开源 AI 的未来,Altman 肯定地表示“当然有未来”。目前大多数需求仍集中在更智能、更快、更便宜的前沿模型上,但对开源的需求也很大,并且他预计其相对重要性会随时间增加。
科学是 Altman 极度兴奋的领域,也是 OpenAI Foundation(OpenAI 基金会)的重点方向。他认为,AI 对人类生活质量最重要的贡献可能就在于加速科学发现。从几个月前的模型开始,特别是 GPT-5.5,模型已经足够智能,能够帮助优秀科学家产生更好的想法,甚至做出一些小型但重要的发现。未来,结合自动化实验室和机器人,科学进程将极大加快。如果能将过去需要十年的科学工作在一年内完成,其复合效应将是巨大的。OpenAI 基金会将投入资金、专业知识和技术来加速科学,并相信这将以美妙的方式惠及世界。Altman 透露,这很可能将成为世界上规模最大的基金会之一。他们已向 Arc Institute(弧研究所)提供资助,该机构致力于利用 CRISPR 和 AI 等技术,目标是实现人类对复杂疾病(如阿尔茨海默症)的首次治愈。
最后,Patrick Collison(帕特里克·科里森)问及,在 AI 发展看似具有某种“必然性”的背景下,Sam Altman(萨姆·奥尔特曼)希望他个人的参与如何改变世界的轨迹。Altman 的回答回到了 OpenAI 的核心理念之一:迭代部署。他回顾了发布 ChatGPT 前,业界存在的一种主流观点,认为 AI 过于危险,只能由一小群思考 AI 安全的人掌握,是“信息危害”,必须锁在象牙塔中。这种权力集中的前景让他深感不安。他坚信,避免这种权力集中,让世界能够广泛使用并在此基础上进行建设,尽管过程会有些混乱,但最终将为世界带来一份礼物,而世界将在此基础上为所有人建造一份更大的礼物。他相信创业精神、创新,相信人们大多是善良的,并能用工具做出惊人的事情。因此,他自认最大的贡献,就是推动这项技术成为一种民主化的技术,供人们使用和构建。这或许正是 OpenAI 之名在新时代下的最深层次诠释。
OpenAI CEO Sam Altman(萨姆·奥尔特曼):AI 应用、智能体与软件开发的新纪元撰文:Techub News 整理
北京时间 2025 年 4 月 10 日,OpenAI 在旧金山举办了第二届开发者大会 DevDay。CEO 萨姆·奥尔特曼(Sam Altman)发表了开幕主题演讲,公布了多项旨在赋能全球开发者的重磅更新。从将 ChatGPT 转变为应用平台,到大幅简化智能体(Agent)开发流程,再到让 AI 成为软件工程的核心协作者,本次发布标志着 AI 从“可对话的工具”正式迈向“可构建、可集成、可行动”的生态系统。以下是本次演讲的核心内容梳理。
ChatGPT 进化:从聊天机器人到应用平台
萨姆·奥尔特曼(Sam Altman)首先回顾了 OpenAI 生态的惊人增长:开发者数量从 2023 年的 200 万增至 400 万,每周使用 ChatGPT 的用户超过 8 亿,API 每分钟处理的令牌数从 3 亿飙升至 60 亿。这背后是 AI 从“新奇玩具”到“日常生产力工具”的深刻转变。
为了进一步释放创造力,OpenAI 宣布推出 Apps SDK,允许开发者在 ChatGPT 内部构建和分发功能完整的交互式应用。这不再是简单的插件或工具调用,而是拥有独立前端界面、后端逻辑和数据连接的“原生应用”。
Apps SDK 基于开放的 MCP(Model Context Protocol)标准构建,开发者拥有对前后端的完全控制权。其最大吸引力在于,应用一旦上架,即可触达 ChatGPT 的数亿用户,获得前所未有的分发渠道。未来,OpenAI 还将支持应用内直接购买等货币化方式。
现场演示生动地展示了这一愿景:
Coursera:用户可在 ChatGPT 对话中直接搜索并播放课程视频。视频会以小窗形式置顶,用户可边看边问,ChatGPT 能根据当前播放内容(通过 API 获取的上下文)进行即时答疑。
Canva:在 ChatGPT 中为一个虚构的遛狗业务“Walk This Wag”构思名称后,用户可直接指令 Canva 应用生成海报和宣传用的 Pitch Deck,所有创作过程都在对话流中完成。
Zillow:当 ChatGPT 建议将业务扩展到匹兹堡后,用户可调用 Zillow 应用,在对话中嵌入交互式地图查看房源,并进一步要求 ChatGPT 筛选“带后院的三居室”。应用与模型深度协作,提供无缝体验。
OpenAI 工程师 Alexi 在演示中强调,这种“与应用对话”的能力是核心魔法。应用不再是孤立的工具,而是与 ChatGPT 的智能深度整合,能理解用户意图并主动推荐。Apps SDK 即日起开放预览,开发者可开始构建,后续将开放应用提交审核和官方目录。
Agent Kit:将智能体从原型带向生产
智能体(Agent)是能理解目标、使用工具并自主完成任务的 AI 系统。尽管潜力巨大,但将其投入实际生产仍面临巨大挑战:从选择框架、流程编排、工具连接到构建 UI 和评估循环,每一步都充满复杂性。
为解决这一痛点,OpenAI 推出了 Agent Kit。这是一个旨在帮助开发者将智能体想法快速落地生产的完整工具集,包含三大核心组件:
Agent Builder:一个可视化的工作流构建画布。开发者可以通过拖拽节点(如分类器、工具调用、条件分支)的方式,直观地设计智能体逻辑并测试流程,无需从零开始编写复杂代码。
Chat Kit:一个可嵌入的聊天界面组件。开发者可以将其轻松集成到自己的应用中,并完全自定义品牌和交互风格,为用户提供与智能体自然对话的体验。
评估工具:专为智能体设计的新评估功能。包括追踪评分(逐步理解智能体决策)、数据集测试、自动提示词优化,甚至支持在 OpenAI 平台上对外部模型进行评估。
此外,通过 OpenAI 的连接器注册表,企业可以安全地将智能体连接到内部工具和第三方系统。
现场演示极具冲击力。工程师 Christina 在8分钟内,使用 Agent Kit 为 DevDay 官网构建并部署了一个名为“Ask Froge”的智能体助手。该助手能理解用户关于会议日程的查询,从文件中检索信息,并以品牌化的青蛙风格(Froge)回答,同时还能通过预置的“护栏”防止泄露个人敏感信息(PII)。整个过程完全可视化,无需编写代码,构建完成后即可通过 Chat Kit 组件嵌入网站实时使用。
萨姆·奥尔特曼(Sam Altman)还分享了企业案例:美国大型连锁超市 Albertsons 利用 Agent Kit 构建了店内管理智能体。当冰淇淋销量意外下滑 32% 时,店员只需询问智能体,它便能分析季节性、历史趋势等上下文,直接给出调整陈列或投放本地广告的建议,将原本冗长的报表和会议流程极大简化。
Codex:软件工程进入“无代码”协作时代
“我们正在进入一个软件编写方式被彻底改变的新时代。”萨姆·奥尔特曼(Sam Altman)如此定义 Codex 带来的变革。Codex 是 OpenAI 的软件工程智能体,旨在与开发者并肩工作,加速软件创建。
此前处于研究预览版的 Codex,如今正式推出通用版本(GA)。它已深度集成到开发者的工作流中,支持 IDE、终端、GitHub 和云端环境,并通过 ChatGPT 账户同步所有工作。其底层模型已升级为专门为编码和智能体任务训练的 GPT-5 Codex,在代码重构、审查等任务上表现更佳,并能根据任务复杂度动态调整“思考时间”。
数据证明了它的成功:自 8 月初以来,Codex 的日处理消息量增长了 10 倍,GPT-5 Codex 也成为 OpenAI 有史以来增长最快的模型之一,已处理超过 40 万亿令牌。在 OpenAI 内部,几乎所有新代码都由 Codex 用户编写,使用 Codex 的工程师每周完成的拉取请求(PR)数量增加了 70%。
为服务工程团队,Codex 新增三大功能:Slack 集成(可直接在团队对话中让 Codex 写代码或回答问题)、Codex SDK(用于在团队工作流中扩展和自动化 Codex)以及新的管理员工具和报告面板。
现场演示将 Codex 的能力推向了新高度。工程师 Raman 在未手写一行代码的情况下,完成了一系列令人惊叹的操作:
通过自然语言指令,让 Codex 创建了一个控制舞台上方索尼摄像头的网页控制面板。
让 Codex 研究并编写了通过 Visca 协议控制该摄像头的 Node.js 服务器代码。
指令 Codex 将 Xbox 无线手柄连接到该控制界面,实现了用手柄操控摄像机摇移。
通过集成实时语音 API 和 Agent SDK,实现了用语音控制摄像机(如“对准观众”)和会场灯光系统(通过构建 MCP 服务器)。
最后,通过语音指令,让 Codex 现场修改 React 应用代码,为所有现场参会者生成了一个电影片尾式的“演职员表”叠加层。
整个过程展现了 Codex 作为“AI 队友”的强大能力:理解复杂意图、自主研究协议、调用工具、编写并集成代码。正如 Raman 所言:“唯一的限制现在是你的想象力。”
模型更新:GPT-5 Pro、Sora 2 与 Realtime Mini 开放 API
所有强大的应用和智能体都离不开底层模型的支撑。萨姆·奥尔特曼(Sam Altman)宣布了多项模型更新:
GPT-5 Pro API 全面开放:这是 OpenAI 迄今为止最智能的模型,专为需要高精度和深度推理的复杂任务设计,如金融、法律、医疗等领域。它现已面向所有开发者开放。
Realtime Mini:这是一个小型、快速、低成本的实时语音模型,语音质量和表现力与两个月前发布的 Advanced Voice 模型相同。OpenAI 认为,语音将成为人机交互的主要方式之一。
Sora 2 API 预览:备受瞩目的文生视频模型 Sora 2 现已开放 API 预览。其最大进步在于可控性增强,开发者可以给出详细指令,模型能保持状态并生成风格化、准确、构图精良的视频。更令人兴奋的是,Sora 2 能生成与画面同步的丰富音效和背景音乐,而不仅仅是语音。现场展示了其如何将一张小狗照片扩展为一群小狗玩耍的动态视频,并配以同步音效。玩具公司美泰(Mattel)已利用其 API 快速将设计师草图转化为可分享的动态概念视频。
在演讲的最后,萨姆·奥尔特曼(Sam Altman)总结道,软件构建曾需要数月或数年,而现在借助 AI,只需几分钟和一个好想法即可实现。OpenAI 的目标是通过 Apps SDK、Agent Kit、Codex 和新模型等一系列工具,成为这个新时代的最佳构建平台。这场发布会不仅是对现有能力的展示,更是对“AI 全民化”和“创意即时实现”未来的一次强力召唤。
Josh & Ejaaz:为何我们从 Claude Code 转向 OpenAI Codex撰文:Techub News 整理
在 AI 编程助手竞争白热化的当下,工具的选择往往决定了开发效率与创造力边界。Limitless Podcast 的主持人 Josh 和 Ejaaz 2026 年 5 月进行了一场深度对谈,基于他们从 Anthropic 的 Claude Code 转向 OpenAI 的 Codex(集成于 ChatGPT 5.5)的实际经历,剖析了这两款顶尖产品的现状、核心差异以及未来的趋势。这场讨论不仅提供了直观的功能对比和 Demo 演示,更触及了 AI 工具演进背后的关键概念,对于任何依赖 AI 进行开发或创意工作的从业者而言,都具有极高的参考价值。
市场格局的戏剧性翻转:Codex 的“觉醒”与数据碾压
仅仅几个月前,Claude Code 还是几乎所有软件工程师和企业的首选,安装量遥遥领先。但 Josh 指出,在圣诞节前后,AI 编程的“氛围”发生了根本性转变——从一个“有趣的工具”变成了开发者实际交付代码时使用的利器。而此后,OpenAI 似乎“醒了过来”。
Ejaaz 用一组惊人的数据说明了这种转变:在过去一周,Codex 的安装量超过了 4600 万次,而 Claude Code 则低于 50 万次。这与历史数据形成了鲜明对比,此前 Claude Code 的安装量曾远远超过 Codex。Ejaaz 认为,这种戏剧性翻转的核心原因很简单:OpenAI 推出了更好的模型。他们在过去几周内密集发布的功能,比大多数公司一年内推出的还要多。
为了直观对比,他们制作了一个“比分牌”:OpenAI Codex 以 11 分领先,Anthropic Claude 仅得 2 分。这 11 分的优势来源于多个关键领域的突破。
Codex 的五大核心优势:从“超人”操作到屏幕监控
1. 计算机控制与速度:Claude 率先实现了让 AI 接管桌面、移动光标的能力,但速度较慢,且常遇到障碍,需要用户手动引导。Codex 不仅比普通人操作更快,甚至比 Josh 本人还快。Ejaaz 描述其光标移动速度之快,如同“使用电脑的超人”,并且可以近乎 24/7 不间断运行。
2. 长时程自主性:Codex 能够更智能、更持久地工作。传统上,AI 完成任务依赖一种名为“Ralph Loop”(以《辛普森一家》中坚持不懈的角色命名)的规划模式,即 AI 会持续迭代直至达成目标。Codex 原生集成了这种长时程思考能力,有人甚至观察到它为了完成目标持续“思考”了 36 小时。这对于解决复杂任务至关重要。
3. 浏览器使用与意图理解:Codex 可以接管浏览器,并更智能地理解它所浏览的内容。此前它不具备此能力,而现在它能进行更有目的性的操作。
4. 图像生成集成:OpenAI 2026 年 5 月发布了 ChatGPT Images 2.0 图像生成模型,其质量“绝对令人震惊”,在所有基准测试中击败了包括谷歌 Nano Banana 2.0 Pro 在内的前任领先者。而 Anthropic 目前甚至没有图像生成模型。对于任何涉及视觉工作的用户,直接在软件中使用此功能非常强大。
5. “Chronicle”——秘密的屏幕监控与效率分析:这是 Josh 认为大多数人尚未知晓的 Alpha 功能。Chronicle 会观察你滚动、点击和键入的内容,以此构建关于你的上下文和记忆,无需你主动输入。这带来了一个极其强大的提示:“根据 Chronicle(这个新的记忆功能),我在电脑上做什么事情效率很低?提出一些建议,直接告诉我我需要听到什么。”它会评估你的电脑使用习惯(例如在 Twitter 上滚动的时间),并基于其观察到的实际行为给出真实反馈,以优化你的工作流程。目前该功能仅面向付费会员(每月 100-200 美元订阅),Josh 认为这是未来重要功能的早期迹象。
此外,Codex 2026 年 5 月还推出了“自动审核”功能,能智能区分可能构成系统性威胁的操作和无需批准的操作,自动批准后者,大大简化了用户界面,让用户可以暂时离开电脑而任务照常进行。
Claude 的现存优势:个性、UI 与移动访问
Josh 和 Ejaaz 也指出了 Claude 目前仍保持优势的领域。首先是其“OpenClaw”能力(有趣的是,OpenAI 收购了 OpenClaw)。Claude 的 Dispatch 是其移动应用功能,允许用户远程与 Claude Code 交互,而 Codex 目前尚未提供此功能(团队已承诺会推出)。
其次,在个性化和用户界面方面,Claude 更出色。当使用 LLM 本身而非工具套件时,Claude 的体验更佳,UI 更温暖。此外,两者都发布了“宠物”功能(如屏幕上显示的 Angry Dario),但 Codex 的宠物能作为持久角色存在于整个电脑使用过程中,在后台与你聊天,显示进度,更具趣味性,体现了对用户体验的关注。
实战 Demo 对比:从零构建游戏与草图生成应用
为了验证理论,他们准备了两个具体的演示。
Demo 1:一次性提示构建马里奥风格游戏
Ejaaz 给出了一个提示:要求 AI 创建一个具有未来感、带霓虹灯元素的马里奥风格侧卷轴游戏,包含游戏设计、敌人、陷阱和计分板。他们将此提示输入给 ChatGPT 和 Claude,让各自的编码模型在最高设置下执行。
Claude Opus 4.7 的结果:游戏名为“Neon Plumber Moon Base Run”。视觉效果很好,有音效设计,遵循游戏原则。玩家能识别危险(如尖刺)。但逻辑存在缺陷,例如承诺的双跳功能并未正常实现,导致无法收集某些硬币。
OpenAI Codex (GPT-5.5) 的结果:游戏同样命名为“Neon Plumber Moon Base Run”。起始画面更基础,但有背景动画。游戏逻辑更好,完全可玩,有清晰的爱心(生命值)显示和计分系统,能获得功能增强道具。虽然也存在一些边缘错误,且没有音乐,但整体游戏体验更流畅、功能更完整。
在构建体验上,Ejaaz 更偏好 Codex。Codex 在接到单一提示后,没有请求任何许可,自行思考并决策推进;而 Claude Code 则会不时向用户求助。对于构建像游戏这样的非生产级项目,这种“放手”模式可能更受欢迎。
Demo 2:从手绘草图生成应用
他们提供了一个手绘(实际由 GPT Image Gen 2.0 生成)的“通用 Limitless 仪表盘应用”草图,将其输入模型。
Claude 的结果:生成了一个仪表盘,但风格基础且可预测。页面文本和图形元素很多,它推断出了旅行预算等功能(尽管提示未明确要求)。然而,它创建的是一个旅行规划板,而非围绕 Limitless Podcast 的仪表盘,可能与提示理解有关。
OpenAI Codex 的结果:界面更简洁、干净,没有追求未来感或霓虹风格。提供了一个五日旅行计划的基本信息,有多个标签页,视觉效果更好。虽然同样不是草图指定的内容,但设计更易于理解,不那么密集,且看起来已经连接到数据(顶部有“重新优化”开关)。Josh 认为 Codex 在这方面“完全碾压”,更准确地还原了原始纸张上的设计。
两个演示均显示 Codex 在逻辑实现和功能完整性上更胜一筹。
超越模型本身:“AI 模型套具”与“Vanilla Maxing”哲学
Ejaaz 指出,两大公司的模型之所以能如此快速进步,一个关键因素是“AI 模型套具”。这指的是在基础模型之上添加的层,包括预设的提示词、模型运行的环境以及确保模型以特定方式行为和发声的策略。这也解释了为何 Claude 的个性优于 ChatGPT。
Cursor 2026 年 5 月将其套具 Cursor SDK 通过 API 开放,这具有重要意义。批评者曾认为 Cursor 只是一个 AI 包装器,但事实证明,这个“包装器”或“套具”能让模型变得更智能。如果将 Cursor 的套具应用于 GPT-5.5 和 Claude Opus 4.7,得到的模型比原始基础模型更聪明、更高效。这意味着,尽管 AI 实验室投入巨资训练模型,但初创公司通过构建更好的“套具”也能创造卓越产品。套具与模型本身已密不可分,是 valuable moat。
Josh 进一步阐述了“套具”在构建“超级应用”中的作用。每个公司都试图打造一个全能的操作系统级应用,让 AI 成为其基础。OpenClaw 在此方面早期表现卓越。2026 年 5 月,Sam Altman(萨姆·奥尔特曼)宣布用户现在可以将其 ChatGPT 账户连接到 OpenClaw 生成令牌,这可能是将 OpenClaw 深度集成到 Codex 的多步计划开端。OpenAI 拥有 OpenClaw,虽然承诺保持开源,但有能力直接集成到自家产品中。Codex 的开发者也确认,原生编辑器、iOS 应用、完整浏览器和 OpenClaw 等功能都将到来。
然而,Ejaaz 指出 OpenClaw 的热度已消退,因为尽管这些工具处于前沿水平,但难以扩展到实际应用。用户不敢将其集成到存有个人文件的桌面,曾出现过访问信用卡数据或删除旧婚礼照片等恐怖故事。相比之下,在品牌信誉下提供的工具(如 ChatGPT Codex、Claude Cowork 或 NVIDIA 的企业级安全版本 NemoClaw)更能让人安心使用。
这引出了 Josh 推崇的“Vanilla Maxing”哲学:你应该 100% 使用原厂工具。很多人陷入使用各种不同仓库、技能和插件的情况,但现实是,AI 实验室的迭代速度足够快,他们会直接将功能集成到原生应用中。因此,最好的策略就是“Vanilla Maxing”——使用官方提供的工具,无需急于尝试前沿但可能不安全的外部工具。
未来展望与个人使用栈
Ejaaz 总结道,目前并没有明确的赢家,但他倾向于 Codex GPT-5.5。不过叙事转换如此之快,Claude 仍可能追赶上来。一个未被讨论和演示的模型是Claude Mythos,它在几周前伪发布,在所有基准测试中都技术上优于 5.5,但 Anthropic 因其“过于危险”和“网络安全风险”而未开放访问(美国战争部的 Peter Heskett 也提及此担忧)。OpenAI 则创建了 Mythos 级别的模型并使其对所有人可用。这或许也源于 Anthropic 计算资源的不足。
关于个人使用栈,Josh 表示他已完全转向 Codex,用于所有困难任务。但他认为,作为 LLM 或聊天机器人,GPT-5.5 略逊于 Opus 4.7,后者个性更温暖、更精准,更能理解他的意图。因此,在构建复杂项目时,他用 Opus 4.7 作为“协调者”,Codex 作为“执行者”。他还发现 Opus 4.7 在某些方面不如 4.6,例如在写作或文本消化任务上,他仍使用 Opus 4.6。
Ejaaz 的栈则更多样化。对于研究,他开始转向 GPT-5.5,因为它能进行更长时间、更深入的讨论。他举例测试了关于 AI 电力堆栈和投资标的的提示,5.5 完全超越了 4.7。但他仍因个性原因使用 4.7。总体而言,他认为 OpenAI 正处于“一代人的奔跑”中,可能很快会修复现有问题。
Josh 最后鼓励用户亲自尝试两款工具,用实际提示进行测试。无论你从事何种工作,只要使用电脑,AI 都可能帮助你更高效地完成任务,或助力你实现一直想做的爱好和副业。这场竞争的最大赢家是用户,因为每月仅需 20 美元,就能获得所有这些前沿智能和能力。
OpenAI Codex负责人Thibault:AI代理正在重塑知识工作,编程只是起点撰文:Techub News 整理
在2026 年 5 月 OpenAI 论坛的一场对话中,OpenAI Codex 负责人 Thibault 与全球事务团队的 Chris Nicholson 深入探讨了 Codex 的演变与影响。这场对话之所以重要,是因为它清晰地揭示了 Codex——最初作为代码生成工具而闻名——正在如何跨越软件工程的边界,成为各行各业知识工作者提升生产力的核心工具,并从根本上改变我们与计算机和信息的交互方式。
从代码生成到通用代理:Codex 的使命演变
Codex 的故事始于一个经典的挑战:让 AI 达到高产软件工程师的编程水平。大约两年前,OpenAI 团队开始探索这一领域。最初的公开版本是“Codex Web”,一个云端实体,用户只需陈述意图,它便能分析代码仓库并提交更改。然而,这个方案存在较高摩擦:设置复杂,且模型可靠性尚未达到能完美处理长期任务的水平。
团队很快意识到,将工具运行在云端并要求所有人配置环境过于困难。于是他们转向了一个更自然的路径:让 Codex 在每个人的本地机器上工作。这一转变降低了使用门槛,也为后来的广泛应用奠定了基础。
真正的转折点出现在大约六个月前,随着 GPT-5 的发布,模型的通用性和可靠性迎来了阶跃式提升,尤其是在处理长期任务方面。Thibault 指出,即使是软件工程师,他们日常工作中真正编写代码的时间可能只占 20-30%。大部分时间用于处理工单、优先级讨论、架构决策、排查故障报告、处理系统中断、信息收集等。那些早期采用 Codex 的技术人员,早已开始用它处理这些日常的非编程工作。
团队发现,为了让 Codex 在编程任务上更有用,它需要访问更广泛的上下文信息,例如存储在 Notion 或各类文档中的信息。当他们不断提升这方面的可靠性时,一个有趣的现象出现了:如今在 Codex 上执行的大部分任务,实际上已是非编程任务。 Codex 从搜索代码,进化到了搜索各类文档并返回信息,这恰恰是所有知识工作者都需要的能力。
Thibault 分享了让他意识到 Codex 潜力将惠及所有人的关键时刻。在一次产品发布前夕,产品经理 Alexander Americus 使用 Codex 来追踪所有待落地更改的状态。Thibault 从未见过有人能像 Alexander 那样高效:他仿佛拥有许多小小的 Codex 代理,代表他处理工作、跟进人员、更新文档,汇总所有来自用户反馈和开发者的信息,并保持计划整洁且实时更新,而 Alexander 本人则在与他开会讨论。这让他感到震撼:“我们真的在改变一切,不仅仅是软件工程。” 在此之前,Alexander 需要亲自翻阅 Slack 频道、文档或 GitHub PR,花费大量时间协调。而现在,他将这些耗时的工作委托给了工具,它们在他开会时就能完成。
Codex 模型擅长收集正确上下文并进行总结,这是一个强大的用例。Alexander 还用它来“催促”信息:Codex 代理连接到 Slack,可以发送消息询问某人某项工作的最新状态,代表 Alexander 完成所有跟进工作。“催促”耗费了大量时间,而现在可以被自动化。
效率革命与角色重塑:Codex 带来的连锁反应
Alexander 的高效使用产生了涟漪效应。工程师的开发速度大大加快,构建速度前所未有。相邻的职位也在发生变化:设计师的角色在改变,产品经理的角色在改变。OpenAI 团队思考如何加速并赋予他们更高的生产力。随后,瓶颈转移到了沟通和营销部门——团队突然产出如此之多的工作,向世界讲述并保持故事连贯性成为挑战。
OpenAI 的交付速度非常快。Thibault 直言,没有 Codex,这不可能实现。如今 Codex 对他们至关重要。他认为,其他公司,即使是拥有十倍工程师的公司,也足以遵循类似的模式,因为技术状态已达到一个临界点:这些代理能够处理非常通用的工作。如今,在电脑背后完成的许多事情,代理都能协助。
无论是准备演示文稿以协调利益相关者、收集公众认知背景、进行市场研究、组织信息,还是在财务部门(Sarah Friar 提到她借助 Codex 组织了最近的融资活动),Codex 都展现出美丽的通用性。它已演变为不仅仅是生成代码,而是执行通用任务。
Thibault 观察到,每个人都需要应对事情更快地移动,并更快地适应。曾经需要数天解决的难题,现在可能只需几个小时。这一趋势出现在科学、工程领域,也出现在诸如深入的市场研究或分析新功能的公众情绪等任务上——曾经需要大量时间寻找来源、总结、浓缩信息以供不同人消化,现在这个过程被压缩到几个小时,甚至完全自动化。
这意味着一切都在加速,人们需要适应节奏的提升。个人也能独立完成更多工作,这非常令人愉悦,极具赋能感。以前你可能需要找人讨论某事,现在你可以自己完成。在公司内部的数据问题上,这种现象也很普遍:每个人都被赋能去直接询问数据问题,例如“我们在某个市场的成功程度如何?”“我们在印度是否增长?”“韩国的情况如何?”现在,人们可以直接要求 Codex 调出仪表盘(即使不知道具体位置),然后深入挖掘业务细节,无需再去打扰数据分析团队,让他们专注于更有趣的工作。
Thibault 认为,我们正处于一个历史性时刻:过去,提出问题的人和构建解决方案的人是两个独立的群体,他们关于产品的对话漫长,最终只能得到一个尚可的结果,无法进一步推进,因为没人有时间。而现在,提出问题的人可以快速构建解决方案,并迭代所需的更改。这就是为什么团队中也有 UX 设计师,他们正在推送代码、进行更改、与开发者一起塑造产品,以带来最佳体验并创造惊人成果。他们无需再去说服工程团队优先处理那些工程团队可能认为微不足道、但对设计师而言却能极大提升工艺和用户体验的改动。这对他们同样是极大的赋能。
这感觉像是进入了“家庭烹饪式”、高度个性化的软件时代。Thibault 同意,这正是即将到来的浪潮:每个人都将能够拥有自己的个人软件,维护它,让它精确地满足你的需求。
他分享了一个有趣的个人用例:生活在旧金山,他对面包价格感到惊讶。他让 Codex 寻找城市里最好的面包,并创建一个包含位置、购买地点和价格的电子表格。Codex 工作了 5 分钟,生成了包含 Jane the Bakery、Arsicault、Tartine 等信息的表格。随后,他希望以更视觉化的方式消费这些信息,于是要求 Codex 创建一个网页。Codex 做到了,将所有面包信息放在地图上。整个过程大约花了 10 分钟,他只需一个简单的提示,甚至无需打字,通过语音即可完成。这意味着,任何人如果关心某些数据并拥有访问权限,他们基本上可以制作网站、分析数据、可视化并分享。过去,如果你有相关技能,这可能需要一个周末的时间来创建,而现在几乎是即时完成,如果不满意,只需告诉它更改即可。
Thibault 强调,Codex 获取数据、可视化数据、引导你洞察世界,然后你可以根据需求做出决策——这正是我们生活中普遍的循环:如何做出更好的决策以实现目标。这个过程可以非常简单,也可以非常复杂,例如 OpenAI 2026 年 5 月的融资活动也使用了类似流程。Codex 既能处理最小的事情,也能处理最复杂的事情。
个人首席助理与未来展望:信任、社区与持续学习
Thibault 本人也像 Alexander 一样协调和编排事务。在他的侧边栏中,在对话开始前,他每天会启动上百个不同的任务交给 Codex 处理。这些任务包括整理桌面文件、管理计算集群、帮助理解值班轮换状态和工程师表现、了解即将到来的发布日程并标记任何可能存在风险需要他关注的事项。他将 Codex 用作一个小型“首席助理”,每天运行自动化流程,遍历 Gmail、Notion、日历,为他总结一天的事项并标记风险。他可以设置让它每天上午 9 点运行,然后每天上午 9 点在收件箱中找到报告。Codex 帮助他优先处理事项,帮助他将注意力集中在最重要的事情上,并帮他处理那些琐碎、耗时且可能永远无法完成的小事。
在 Codex 之前,最让他烦恼的是,他不会去做某些事情,因为他觉得自己没有时间亲自处理,但又需要去打扰别人询问信息。他觉得这可能不够重要,不值得放到别人的桌面上请求帮助。现在,他可以获取所需的信息,拥有各种个人报告,可以构建各种个人软件,而这些他以前没有时间去做。Codex 处理所有以前在电脑上手动完成的繁琐小事,让他可以专注于自己真正想思考的事情。许多事情以前可能需要数周,现在只需几秒,但更关键的是,许多事情以前根本不会发生,因为时间成本是无限的。Codex 也让他更享受工作,因为他不再感到认知负荷过重,不再觉得事情会遗漏。
Thibault 认为,这实际上是一种应对倦怠和信息过载的工具。我们都被旨在帮助我们的工具所包围,但最终却被困在其中。Codex 作为一种工具,正在解放我们。教师、医生等许多人感到倦怠和 overwhelmed,因为他们被困在工具中,进行手动数据录入等工作。我们与工具的关系正在发生根本性转变。对他来说,承诺在于拥有一个几乎可信赖的合作伙伴,它可以代表你完成大量工作,达到一个可信赖的程度:如果你委托某事,它会完成;如果未能达到满意程度,它会向你标记;你知道它会很好地完成,甚至可能比你亲自做得更好。你也可以信任这个合作伙伴屏蔽大量噪音,并及时标记重要事项。
他想象的未来是:他甚至不需要阅读电子邮件。他可能只需要一个小小的个人代理,为他阅读收件箱,在有真正重要的事情时标记他,征求他的意见,然后完成工作。你无需在十几个不同的“haystacks”中寻找“needles”,“needles”会被整理成简报。你可以说:“这是我今天的目标,帮我处理其他一切。”并信任这会实现。
在过去几个月里,可以信任这个工具处理的事情发生了变化,尤其是任务的时间跨度。OpenAI 推出了一个更高级的功能:`/goal`命令。它允许你进入一个模式,给予 Codex 一个长期目标,它会 relentless 地追求。例如,你可以给它解决一个非常困难的数学问题的目标,它可能会持续工作数小时、数天甚至数周,直到它认为目标已达成。他们看到它被用于改进程序性能、将整个程序从一种语言重写到另一种语言,也用于科学问题,在数学和物理突破上取得了非常酷的成果。几个月前,他们还在兴奋于它能工作 10 分钟,现在他们谈论的是代理能在最困难的任务上工作数周。
未来的方向是它不会停止。你将拥有一个 24/7 运行的代理,持续为你做有用的事情,并在过程中被引导。目前它还是基于回合制的,你有特定任务时启动它。目标导向的任务解决是一个巨大的解锁,能创造巨大价值。但下一步是让它持续运行,无论你是否指示,它都会做有用的事情。它可能在某个时刻完成了所有它认为有用的事情后,暂时休眠直到你需要它。
关于如何设定成功的目标,Thibault 建议:与代理互动时,可以以一种非常闲聊的方式询问它能做什么,因为它理解自己的能力。一个好的技巧是精确地帮助它评估自己的成功。如果你能描述什么是“好”的样子、什么是“解决”的样子、以及你希望在任务完成时看到什么,那么 Codex 就能理解它是否做得好、是否完成了任务。你可以设定数字指标,或者精确描述输出。例如,你可以说:“我正在展示我的工作,我想要一个幻灯片 deck。我希望它有 10 张幻灯片。前两张幻灯片包含这类信息。接下来的六张幻灯片深入问题的核心并进行技术分解。最后我希望有两张幻灯片提出开放性问题并进行 Q&A。”如果你清晰、具体地描述你想要的输出,它更有可能成功。这与你可能对助理或副手做的事情非常相似。
对于非编码者为何应从 ChatGPT 转向 Codex 的问题,Thibault 认为这将是一个演进过程,他不期望所有人都会转向 Codex,但它是对 ChatGPT 很好的补充。他推荐用它来处理需要为你做的事情:任何涉及计算机文件操作、自动化运行、每隔几小时在后台执行的任务,都可以用 Codex 完成。ChatGPT 对他来说仍然是获取快速答案的首选。他回忆过去需要从 ChatGPT 复制粘贴代码到文件或终端的日子,但现在不需要了。复制粘贴的时代结束了。Codex 可以直接处理代码和数据。如果你电脑上有文件、图片,只需告诉 Codex 使用这个文件、读取它,它就能直接处理,无需手动点击。
关于企业采纳的最大瓶颈,Thibault 认为不是能力问题,能力已经存在。主要是信任问题。信任关乎安全和保障。如果让一个代理在公司里四处运行,可能删除敏感文件、上传信息、发送包含不应泄露信息的电子邮件,那将是灾难性的。OpenAI 对此进行了大量思考。默认情况下,代理在沙盒中运行,具有严格的控制,只能访问文件系统的特定部分。你可以将其限制在某个文件夹,禁用网络访问。他们提供了许多企业控制功能,并投资了一项名为“自动审查”的功能(在 alignment blog post 中提到)。他们创建了一个能够审查主要代理行为的代理。主要代理 Codex 被激励为你工作,有时可能会采取有点风险的行为。因此,另一个代理会审查它的每一个动作,并在高风险时标记并停止它。他预计需要更多此类创新。
对于非开发者如何让 Codex 更好地工作,以及哪些习惯区分了获得结果的人和感到停滞的人,Thibault 观察到:以创造性方式互动并与见过成功用例的人交流至关重要。参与社区很有帮助。第二点是尝试用精确的指令与之互动,而不是模糊地描述你想要什么。投入一些精力去明确:“这是我想要的确切结果。”第三点是连接许多不同的来源。OpenAI 现在有超过 100 个不同的插件。你可以连接日历、文档、Notion,连接你喜欢的工具。你赋予它越多访问你的工具和世界信息的权限,它就越有用。更多更好的上下文带来更多更好的结果。部分上下文在你的头脑中:你的目标、你经历过但未记录的事情。你需要成为一个好老板,分享一些这些事情。Thibault 现在养成了写下一切的习惯:他自己的想法、目标都存储在电脑文件中,Codex 也能访问,以便更好地调整自身。显然,如果它无法访问你的大脑,它就无法读懂你的心思,所以你必须将其 verbalize。
关于他最喜欢的 Codex 现实世界用途(尤其是非传统编程领域),Thibault 分享:他用于购物。Codex 会为他订购物品。在他的个人电脑上,他用 Codex 进行膳食计划,然后它会去订购食材。他还看到人们用它来查找电脑设置:试图在 Windows 或 Mac OS 上打开某些 beta 功能或进行某项调整时,只需问 Codex:“我正在尝试更改电脑上的这个设置,你能告诉我如何到达那里吗?”它会引导你点击正确的地方,你还能学到关于电脑的知识。有时,你想调整一些幻灯片或整合图片,也可以用电脑完成。对于技术人员,它在 QA(质量保证)方面非常有用:Codex 可以打开应用程序并点击测试其实际功能。
关于人们在提示 Codex 时犯的最大错误,Thibault 指出:随着你越来越多地委托给 Codex,可能会变得 tempting 去委托一切,包括你自己的理解。过度使用 Codex 进行委托,而不利用它来提升自己对问题的理解。如果你纯粹只是委托一切,最终你可能意识到自己并不真正理解发生了什么,你会失去根基,可能会降低生产力。因此,花更多时间收集信息并让它向你解释事物至关重要。它可以绘制图表,Images V 2 在这方面非常出色,因为它也能很好地渲染文本。他看到人们经常用它来阅读发布计划、营销材料或代码库的某些部分,然后创建图像来解释概念,帮助你学习。他看到的错误就是过度委托,而没有足够地利用它来帮助你理解。
最后,关于 Codex 超越软件的重要性以及这些用例的未来方向,Thibault 总结道:本质上,他们正在构建一个非常通用且强大的代理,如果连接到正确的信息源,随着对世界所有信息的访问增加,并赋予其在世界上行动的能力,它将能够完成几乎所有你允许它做的事情。那里的承诺是难以置信的价值创造。许多曾经需要 prohibitive 时间、永远不会实现或对人类来说太难完成的事情,将成为可能。OpenAI 打算尽可能广泛地分发这一技术,给予整个世界访问这些能力和代理的机会。这真正关乎提升人们甚至梦想去完成的事情的数量。
对话主持人 Chris Nicholson 补充道,OpenAI 论坛是一个社区,人们在这里使用 Codex,互相教导和支持以更好地学习。他希望2026 年 5 月的与会者继续参与,因为这是一个技能被示范和传递的地方,让你能以新的方式将这一工具带入生活。他们2026 年 5 月试图回答的问题是:为什么非编码者应该关心 Codex?他希望他们已回答了这个问题。他还指出,尽管“code”这个词在 Codex 中,但 Codex 实际上意为“书”,这是我们所有人都熟悉的东西。因此,Codex 是一个比“代码”更通用的词。他希望这场对话使答案具体化。Codex 对开发者有用,也对任何人——知识工作者、与信息打交道的人——有用:他们搜索所需信息(haystacks 中的 needles)、努力理解它、分析数据、像 Thibault 展示的那样即时可视化、优先级排序,并在生活的后台执行复杂任务。他们认为 Codex 正在将这些超能力带给更多人,并对这将为经济、社会和企业带来的意义感到兴奋。OpenAI Codex,ChatGPT移动端支持……减少长时间编码工作中的“等待批准”环节OpenAI集团PBC已开始为其编程辅助服务"Codex"提供移动端支持。现在,开发者可以直接在ChatGPT的iOS和安卓应用程序中调用Codex,即便离开座位后也能继续管理和监控长时间运行的编码任务。
此次更新距离Anthropic PBC将竞争服务"Claude Code"推向移动设备大约八个月。OpenAI表示,移动支持不仅能提升软件开发速度,还能同时减少不必要的推理成本。
驱动Codex的大型语言模型"GPT-5.5"能够执行耗时数小时的编程任务。不过,在此过程中会出现需要开发者判断的时刻。例如,当一段旧有遗留代码有两种修复方式时,可能需要用户确认采用哪种方法。在执行可能对项目产生重大影响的更改时,也需要审批流程。
以往,如果用户在启动长时间运行的任务后离开座位,Codex有时会因无法进入下一步而停滞。这是因为必须等待用户返回桌面端。此次移动支持将减少此类瓶颈,预计也能缓解项目延误。
移动接入不仅仅是为了提高审批速度。即使Codex不一定非要停下来,但当它开始以低效方式编写代码时,开发者现在也可以中途介入并纠正方向。这能够减少因错误工作持续进行而导致的不必要令牌消耗,并最终为软件团队降低ChatGPT的使用成本。
"Hooks"与"Remote SSH"同步推出
OpenAI在此次移动支持的同时,还公开了Codex的新功能"Hooks"和"Remote SSH"。Hooks是一项允许用户利用脚本对Codex的行为进行精细化定制设置的功能。
例如,安全负责人可以创建脚本,拦截包含敏感公司信息的提示。法务团队可以按照合规目的来记录Codex的消息。该脚本不仅能处理用户的输入,还能处理Codex的响应,因此也可用于按项目调整输出格式。
Remote SSH是一项支持Codex通过加密网络连接访问远程开发环境的功能。如今,软件团队通常在基于云的环境(而非本地PC)中编写、测试和存储代码。这种方式的一个优点是管理员更容易统一应用安全策略,而Codex若能直接连接此类环境,就能更自然地融入实际的开发工作流中。
企业级应用性也得到加强
OpenAI通过当天的产品更新还增加了两项小幅改进。软件团队现在可以生成"编程式访问令牌",以便第三方开发工具能够使用Codex。简单来说,连接外部开发工具与Codex的认证渠道已经打开。
此外,针对独立版Codex客户端和开发工具内置版本,OpenAI还引入了对HIPAA合规的支持。HIPAA是美国医疗信息保护法规,此举被视为旨在扩展医疗保健领域的企业客户。
OpenAI此次的更新,可解读为一种推动Codex从单纯的编码辅助工具,向深度连接企业开发环境的"实务型"服务演进的动向。尤其是,移动支持能减少开发者的等待时间并降低令牌浪费,这一点表明,生成式AI编码工具领域的竞争已开始从性能转向运营效率和现场实用性。
TP AI 注意事项
本文使用基于TokenPost.ai的语言模型进行了摘要。正文主要内容可能被省略或与事实不符。AWS Bedrock搭载OpenAI GPT-5.5及Codex…微软垄断被打破,云服务竞争加剧AWS已正式将OpenAI的大型语言模型和Codex集成到其云服务"Amazon Bedrock"中。此前仅能通过微软($MSFT)云服务获取的OpenAI模型现已扩展至竞争对手的云平台,预计这将使企业级生成式AI市场的主导权竞争变得更加激烈。
通过Bedrock开始提供OpenAI模型
亚马逊云服务(AWS)于29日(当地时间)宣布,将支持在Amazon Bedrock上使用OpenAI集团的大型语言模型(LLM)。此次整合还包括OpenAI的编码辅助工具"Codex"。与此同时,AWS还发布了一项名为"Bedrock托管代理"的新服务,旨在简化基于OpenAI的AI代理开发流程。
OpenAI的首席营收官Denise Dresser在美国旧金山举行的记者和分析师活动中表示:"现在只需点击几次按钮即可访问模型、API和Codex",并称在AWS环境中,OpenAI模型的部署速度和可扩展性将大幅提升。
AWS首席执行官Matt Garman也强调多模型战略,他表示:"现在客户在使用OpenAI模型时,不再仅限于选择亚马逊或Anthropic的模型。"
打破微软独家垄断后,AWS成为首个加入的竞争对手
此次发布并非突如其来。OpenAI已于27日修改了与微软的合作协议,为其模型向竞争对手云服务商供应铺平了道路。此前,微软实际上是唯一在云端提供OpenAI模型的服务商。
AWS成为首个微软竞争对手的背景也值得关注。亚马逊公司今年2月向OpenAI投资了150亿美元,并计划在数月内追加支持350亿美元。按1美元兑1,486.50韩元的汇率计算,分别约合22.2975万亿韩元和52.275万亿韩元。与此同时,亚马逊也是Anthropic的主要投资者。这被解读为一种不局限于特定模型,而是同时拥抱多个AI阵营的战略。
GPT-5.5和Codex也以受限预览形式发布
Bedrock用户可以通过受限预览形式使用OpenAI的最新AI模型。OpenAI表示,其中最新型号的GPT-5.5于上周发布,能够执行图形处理器(GPU)集群性能优化或编写数学证明等复杂任务。并补充称,它在多项基准测试中表现优于Anthropic的代表模型Claude Opus 4.7。
Codex也通过Bedrock API提供。用户可以使用Codex桌面应用、Visual Studio Code扩展程序以及基于命令行界面的"Codex CLI"。Codex CLI是一个开发者可在终端环境中直接调用的编码代理。
AWS表示,OpenAI模型和Codex的使用量将计入现有的AWS支出承诺。对于企业而言,可以简化单独的采购流程;对于开发者而言,可以使用现有的AWS凭证访问OpenAI工具,从而降低了部署门槛。
同时发布助力构建AI代理的新服务
AWS同步推出的Bedrock托管代理是一项旨在帮助用户在AWS环境中更快地构建基于OpenAI模型的AI代理的服务。该服务结合了能够提升长时间运行任务处理能力的"OpenAI代理框架"和AWS的"Bedrock代理核心"。
据AWS称,OpenAI代理框架可提高提示响应速度,并支持更"精细的推理"。Bedrock代理核心是一组重构的软件模块集合,有助于管理代理用于任务的信息。这意味着开发者无需从头开始单独构建用于数据管理的基础架构。
AWS解释称,此外,代理自行编写代码并执行、访问网络、连接外部工具等功能也以预封装形式提供。它还包含用于外部系统集成的网关,可加速实际业务型AI代理的开发速度。该服务目前也处于受限预览阶段。
此次AWS与OpenAI合作的扩大,不仅仅是功能的增加,更表明生成式AI基础设施市场正从"封闭式垄断"转向"多云竞争"。特别是,希望使用OpenAI模型的企业客户现在可以直接在AWS内进行部署,这很可能导致未来云服务商之间围绕获取AI模型展开的竞争更加激烈。
TP AI注意事项
本文使用TokenPost.ai基础语言模型进行摘要。正文主要内容可能存在遗漏或与事实不符的情况。
Claude 封号限流砍权益,OpenAI 趁机用 Codex 稳稳接住你撰文:APPSO
天下苦 A 社久矣。
这是前段时间 Anthropic 持续推出各种功能,但是一边又不断加强使用限制,读者在评论区最普遍的反应。
本身就是御三家(OpenAI、Google、Anthropic)里对使用限制最严格的一个,另一边又加码推出身份验证,实名制才能使用。今天凌晨,再把 Pro(20 美元/月)用户的 Claude Code 使用权给砍了。
Anthropic 的增长负责人出来回应,提到他们正在对约 2% 的新专业用户注册者进行小规模测试,现有 Pro 和 Max 用户不受影响;并表示目前的订阅计划无法应对用户大量的 Token 消耗,他们在研究新的付费方案。
来源:https://x.com/TheAmolAvasare/status/2046724659039932830
OpenAI 这边也立马回应了 Claude Code 踢掉 Pro 会员的争议,一位 Codex 负责人 Rohan Varma 直接怼脸和 Claude Code 竞争,连发文格式都和 Claude Code 一样。
来源:https://x.com/rohanvarma/status/2046769635350241292
Anthropic 为 2% 的用户测试更贵的计划,而 Codex 给 100% 用户测试,让免费和付费套餐都能使用 Codex。还特别调皮的加了一句「Claude Code 用户不受影响。」
Claude Code 用户 PAY(付钱),Codex 用户 PLAY(玩)
另一位 Codex 负责人 Tibo,也在 X 发文说 Codex 将继续提供免费版和 PLUS 版(20 美元/月),还提到 OpenAI 拥有足够的算力和厉害的模型来支持 Codex 的运作。
奥特曼也转发了这条推文,表示 「我们希望你们可以有大量的 AI。」
来源:https://x.com/sama/status/2046752492093165708
Codex 口碑在社交媒体上一直不算太差,尤其是前段时间 OpenAI「大撒币」,先是说为了让每个人都能体验到 Codex 推出的相关插件,给所有订阅计划都重置了使用限制。
4 月初,Codex 发现用户达到使用限制的频率增加,且未找到背后的原因,干脆就重置了所有用户的额度限制。几天前,为了庆祝 Codex 周年庆和新功能上线,又一次重置了所有套餐的用量限制。
今天,Codex 负责人和奥特曼再发推文,表示不到两周 Codex 增加了 100 万新用户,为了庆祝这件事,Codex 的速率限制又又又重置了。
来源:https://x.com/sama/status/2046604989527912590
早在上周 Anthropic 发布 Opus 4.7 的那天,Codex 就更新了一大堆重要功能,Computer Use、内置浏览器、持久记忆,以及 90 多项插件。
这些更新几乎是直接对标 Claude Cowork 的功能,把 Codex 从一个听着就像是给开发者用的工具,重新变成了一个适用于电脑所有场景的效率助手工具。
昨天,Codex 在此前推出记忆功能的基础上,又上线了一项名叫「Chronicle」的研究预览功能,让 AI 能读我们的屏幕,把我们最近做过的事整理成记忆。
Codex 不再只依赖聊天记录来理解上下文,结合它读取的近期屏幕内容,我们给它发送「这个」、「那个」,Codex 能知道我们到底指的是什么。
今天刚刚发布的 GPT Image 2 也已经集成到了 Codex 里。我们可以在 Codex 生成并迭代图像,在一套工作流里,从产品原型、前端设计,到视觉效果图和游戏开发等任务,使用 GPT Image 2 快速生成视觉元素。
如果你的 Claude 账号总是被封,用不了官方的 Claude Cowork、Claude Code 桌面版,又或者是那 2% 的新用户,开通了 20 美元/月的 Pro 会员也用不了 Claude Code,不妨来试试 OpenAI 出品的 Codex。
从代码工具到全能助手
Codex 最近这段时间的更新,最重要的莫过于上周发布的 Computer Use。这项能力并不算新鲜,之前是模型有 Computer Use 的能力,现在是需要工具也要有配套的支持,才能发挥模型能力。
它本质上就是 Agent 工具可以像人类操作电脑一样,通过视觉识别、点击和输入,自主操控电脑上的各类应用程序。
之前的 Codex 操作电脑上的软件,是通过一些命令来执行不同的应用任务,整体更像是我们喊「Siri,明天的天气怎么样」,做这些比较简单的任务。
有了 Computer Use 的能力之后,不仅支持一些调用 API 或者终端命令的工具,还能真的能帮我们完成一些电脑上的实际操作,尤其适合前端调试、应用测试、操作没有开放 API 的软件。
而且支持多个智能体并行在 Mac 上工作,不会影响我们正常使用其他应用。
需要注意的是,Computer Use 的能力只支持 macOS 15 以上的版本,我们的电脑(macOS 14.6.1)在测试 Codex 时,会自动弹出一个 SkyComputerUseClient 的问题报告。
另外,现在 Codex 支持内置浏览器,能更好地处理 Web 场景。我们在 Codex 里生成的网页,可以直接在网页上标注,给 Codex 更精准的操作指令,对一些前端、应用和游戏开发的快速迭代非常有用。
从 Coding、设计、生活方式、生产力到研究,Codex 现在有丰富的插件系统来处理各项任务
这次的更新还新增了 90 多个插件和更丰富的工具集成,让 Codex 能接入更多工具、获取更多上下文,并跨平台执行操作,提到的热门插件包括 Atlassian Rovo(JIRA)、Microsoft 套件、Neon by Databricks、Remotion、Render、Superpowers 等。
在 Codex 应用里,我们只需要输入斜线就能快速进入一些关于 Codex 的配置,输入 $,则可以选择不同的 Skills,包括我们安装在本地的各种 Skills。
同时,在自动化任务上,Codex 的 Automation 功能升级后,可以复用之前的对话线程,保留已有上下文。新的自动化还支持 Codex 自主规划后续工作、自动在未来某个时间继续执行任务,以及支持持续数天甚至数周的长期任务。
官方提到这项更新主要用于代码的提交合并、跟进日常工作生活的待办事项,以及跨越不同平台和工具的信息追踪等任务。
还有一些对于桌面应用交互的小更新,像是增加了多标签页的终端窗口,侧边栏可以直接打开文件,预览 PDF、表格、PPT 等文档。
新的摘要面板,也可以持续跟踪当前执行任务的计划和进度、参考信息来源,和输出结果等。这些应用上的增强,也让 Codex 在整体上更像是一个统一的工作台,而不再是单一的对话窗口。
用定时截屏的方式来维护 Agent 记忆
个性化的记忆功能向来就是 AI 的一大难题,虽然 AI 博古通今能记住所有的知识,但是对于每个用户的私人记忆处理,工作记忆等,AI 需要用不会占据大量的 Token,同时又能记清楚的方式来处理日复一日的对话。
尤其是现在到了 Agent 这类巨消耗 Token 的任务上,每个用户每天产生的上下文,如果 Agent 要全部记住,估计再来一百万 Token 上下文也难顶住。
上周 OpenAI 就已经为 Codex 带来了记忆功能,它可以记住我们的个人偏好、之前做过的修正,以及一些不容易获取但很重要的信息。
而为了获取更多的记忆,更快地处理我们的工作流。Codex 这次推出的 Chronicle 功能,说白了就是看我们的屏幕,记住我们的工作,再把这些记忆喂给 AI。
具体来说,在 Codex 设置个性化里面,开了 Chronicle 功能之后,会自动执行这些操作:屏幕上下文捕获 → 本地临时截图 → 后台代理分析 → 临时 Codex 会话总结 → 生成本地 Markdown 记忆 → 后续会话中作为上下文使用。
Codex 获取了屏幕录制和无障碍权限之后,Chronicle 会在后台运行一个沙箱 Agent,这些 Agents 使用默认模型 GPT-5.4-mini,基于捕获到的屏幕图像,周期性地启动一个临时的 Codex 会话,把最近的屏幕上下文整理出记忆。
屏幕截图只会临时保存在本地,Codex 提到运行期间,超过 6 个小时截图会被自动删除。
GPT Image 2 生成的信息图
以后我们和 Codex 对话,它会自动检索这些记忆文件,作为上下文来使用,减少我们重复描述背景的需要。
OpenAI 官方也给了多个案例,像是如果不开启 Chronicle,Codex 不知道我们说的「这里会失败」,是指的什么。
以及针对一些个人任务中出现的人名、项目名等,在通用知识外的内容,Codex 也会根据 Chronicle 获取的信息,自动补充上下文。
能够捕获屏幕图像,也意味着使用 Codex 处理任务的全流程,Chronicle 都能记住。包括我们的工作流,常用的工具。像下面的例子里,使用了 Chronicle 的 Codex 会知道这份宣传材料使用何种格式,以及何种工具,是 Google 文档还是 Markdown 文档。
不过这项功能也面临着一些争议,例如视觉识别的方法会消耗大量的 token,更严重的是这些截图可能包含我们屏幕上可见的敏感信息。
虽然 OpenAI 说所有保存的记忆都会存放在本地的 markdwon 文档里,用户可以随时查看,Codex 根据这些截屏获取到了哪些信息。但是他们也提醒用户,当 Chronicle 截屏到一些有风险的网站时,网站可能通过提示词注入的方式,在屏幕上隐藏一些恶意指令,让 Codex 执行。
Chronicle 这项功能目前仅向 ChatGPT Pro(200 美元/月)用户开放,支持 macOS 版本的 Codex 应用,作为研究预览版推出。待 Chronicle 正式上线之后,相信 Codex 会把它开放给更多用户使用。
手机遥控、电子宠物、「Hermes Agent」都有机会上线
这段时间,Codex 被网友们称作是一款正在用力追赶 Claude 的产品。虽然一方面是在说 OpenAI 没有主见,随大流。但另一方面,能看到好的产品之间展开你追我赶的竞争,对我们用户来说未尝不是一件好事。
Codex 开发者在 X 上问大家对 Codex 有何意见,网友们非常积极的表示,要加上手机控制功能,还有人说 Codex 也应该从 ChatGPT App 里面进入。而这些都是 Claude 目前已经做到的功能。
也有网友在下面反馈 Codex 存在的各种 Bug,像是内存泄露、会话只能存档不能删除等问题。
最新的 Codex 更新爆料里还提到,Codex 也打算做一个小小电子宠物,放在 Codex 桌面上,来提示用户目前会话的各种状态。
这个电子宠物共有 8 种预设形象,用户还可以创建使用自己的虚拟形象。
来源:https://x.com/testingcatalog/status/2046366630528143827
另一个爆料则提到 OpenAI 正在为 ChatGPT 开发智能体(代号 Hermes),其中包括智能体构建器、模板、日程安排、在 Slack 中使用智能体的选项、添加应用程序、技能、文件、内存、指令等功能。
来源:https://x.com/btibor91/status/2046545878538961304/
眼下的 Codex 是一个活跃开发的产品,OpenAI 必然不会把本地 Agent 产品这一块的市场拱手让给 Claude。
别说 OpenAI 这位 AI 界的老大哥,前几天,Gemini 也不声不响地发布了桌面版应用,但是被一众网友评价「拉爆了」。
只能鼓励一下 OpenAI 和 Gemini,赶快结束 Claude 在本地 Agent 助手和代码这块的领先地位。
天下苦 A 社久矣。OpenAI 向所有 Pro、Enterprise 及 Business Premium 用户开放 GPT-6 AstraTechub News 消息,OpenAI 宣布其最新模型 GPT-6 Astra 现已面向所有 Pro、Enterprise 及 Business Premium 用户开放,可在 Work/Codex 中使用,并已上线 API。OpenAI 表示,接下来将开始向 Plus 和 Business 用户逐步开放该模型。
(@sama)以色列研究显示AI代理通过llms.txt文件在企业网络自动安装未知代码Techub News 消息,以色列一家初创公司的研究人员扫描了6214个属于国防承包商、财富500强及大型科技公司的活跃域名,发现其中120个站点的llms.txt或llms-full.txt文件指向未注册的代码包或域名。研究人员注册部分域名并托管测试包后,一小时内即收到一家财富500强公司的回连响应,后续又收到数十个响应。
溯源显示,安装行为涉及包括Claude、OpenAI的Codex以及Nous Research的Hermes在内的编码代理。至少一个配置错误的站点会将访问者(人类或AI)导向活跃的恶意软件。llms.txt文件是网站用于向AI提供内容摘要和结构信息的机器可读文件,类似于指导搜索引擎的robots.txt标准。 (Ars Technica)a16z 报告:法律部门推动 Codex 企业采用,周活用户增长 108 倍Techub News 消息,风险投资机构 a16z 发布报告称,从 2 月到 6 月,法律部门在企业中引领了 Codex 的采用,其每周活跃用户数量增长了 108 倍。Codex 是一个基于 AI 的法律研究平台。
报告指出,这一增长突显了专业服务领域,特别是法律行业,对 AI 工具日益增长的需求和集成速度。(@Cointelegraph)a16z 数据显示 Codex AI 在非科技行业用户增长迅猛,法律领域增长 108 倍Techub News 消息,a16z 发布数据显示,自 2 月以来,AI 产品 Codex 在非科技行业的用户增长迅猛。其中法律领域用户增长 108 倍,销售与招聘领域均增长 41 倍,市场营销增长 26 倍,医疗健康增长 24 倍。该数据表明 AI 应用正加速向传统行业渗透。 (@a16z)OpenAI 修复 Codex 漏洞,该漏洞曾未经许可删除用户文件Techub News 消息,OpenAI 修复了 Codex 中的一个漏洞,该漏洞导致 GPT-5.6 Sol 模型在未经用户许可的情况下自行删除真实用户文件。一个原本用于清理临时文件夹的命令错误地清除了用户主目录。修复后,Codex 现在会在删除前验证目标,并且完全访问模式不再能被意外触发。(The Decoder)Warp 推出 Factories 系统,构建 AI 软件工厂Techub News 消息,AI 编程公司 Warp 推出 Warp Factories 系统,旨在为企业提供开箱即用的 AI 软件工厂基础设施,简化智能代理的部署与运营管理。
该系统基于标准软件开发流程(分类、规范、实施、审查和验证)构建,支持各阶段自动化运行,并兼容 Codex 与 Claude Code 等编码模型。其可与 Linear、Jira、Slack 和 Teams 等工具集成以适配现有工作流,同时提供性能指标追踪与 token 消耗监控功能,支持企业通过自优化循环持续改进整体运作效率。(TechCrunch)OpenAI 为 Codex 和 ChatGPT 桌面应用添加全双工语音控制Techub News 消息,OpenAI 已为其 Codex 和 ChatGPT 桌面应用集成全双工语音控制功能。
该功能允许用户通过语音命令与 AI 模型交互,实现免提编程和任务管理。此次更新基于此前向全球 ChatGPT 用户推出的 GPT-Live 高性能语音模型,旨在提升 Codex 作为多功能编程与工作代理的实用性。(Crypto Briefing)OpenAI 报告:Codex 用户 AI 工时超 24 小时占比达 8%Techub News 消息,OpenAI 发布 Codex 使用数据显示,2026 年第二季度有 8% 的用户工作日中,AI 辅助工程累计时长超过 24 小时,较 2025 年同期的 2% 增长四倍。
Codex 支持并发任务管理,单用户可同时运行多个长时间代码生成任务。截至 2026 年 6 月,该工具周活跃用户已突破 500 万,其中知识工作者(分析师和设计师)占比约 20%,其采用增速达传统开发者的三倍以上。(cryptobriefing.com)OpenAI 将于 7 月 13 日举办 Build Week 聚焦 AI 与加密交叉领域Techub News 消息,OpenAI 宣布将于 7 月 13 日至 21 日举办 Build Week 开发者活动,聚焦 Codex 编程工具与代理式 AI 应用,邀请开发者基于 GPT-5.6 模型构建项目并参与竞赛评审。
该活动面向各层次开发者,包含现场会议及培训课程。此次活动因聚焦代理式 AI 而受到加密开发者关注,该类工具正被用于构建与智能合约交互的自主代理,优胜者可获现金奖励及 OpenAI 积分。(CryptoBriefing)Circle 推出 Agent Wallet 支持 AI 代理 USDC 支付Techub News 消息,Circle 宣布推出 Agent Wallet 功能,使 AI 代理能够使用 USDC 自主支付服务费用,支持语音通话等自动化工作流程。
该功能可与 Codex 等 AI 编码工具集成,允许代理在需要时即时购买服务,无需预配置账户。开发者可设置支出限额和自动充值,实现端到端的自主工作流。1 篇文章