OpenAI 开源 Codex Harness,是几个意思撰文:硅谷 Alan Walker
一周之内三家公司做了同一件事,这才是重点2026 年 8 月 20 日California Ave 的酒吧,第二杯还没喝完,群里已经在传「OpenAI 全面开源 Codex Harness」——但真正值得看的不是这一条消息,是它前面六天里发生的另外两件事。01 先把话说准:开源的到底是什么8 月 19 日,OpenAI 开发者博客发了一篇《Codex as a platform: build on the open agent harness》。中文圈翻成了"全面开源"。这个说法有两处不准,得先修掉,不然后面全是错的。
第一,不是新开源。Codex CLI 从 2025 年 4 月发布起就是开源的,用 Rust 写的,MIT / Apache2.0 许可。8 月 19 日这篇不是一次代码发布,是一次定位发布——把已经开源的一堆东西,重新包装成"平台"这个叙事。新东西是 app-server 协议、官方 SDK,和一整套"怎么把 Codex 装进你自己产品里"的说明书。
第二,也是最关键的——不是"全面"。OpenAI 在文章里写得清清楚楚:开源的是 harness 和集成层,模型访问与托管服务 仍然是分开的。先解释一下 harness 是什么模型只会做一件事:给它一段文字,它吐一段文字。它不会读文件、不会跑命令、不会等你点"同意"、不会记住上一轮干了啥。harness 就是包在模型外面、让它能干活的那一整套东西:怎么找上下文、怎么调工具、怎么控制沙箱权限、什么时候停下来要你批准、怎么把上一轮的结果接到下一轮。
模型是发动机,harness 是变速箱、方向盘、刹车和仪表盘。OpenAI 送出去的是车壳和底盘,发动机还锁在自己车间里。02 时间线:三家公司,七天把日历摊开,这件事的性质就完全变了。2026 年 8 月,harness 层的一周8 月 13 日 - DeepSeek 发布 DeepSeek Harness v0.1,MIT 许可,GitHub 开放下载,公开对标 Claude Code。同日发布 V4-Pro,原生支持 OpenAI Responses API,并且直接集成 Codex。8 月 18 日 - Block(Square 和 Cash App 的母公司)开源 Berd——一个本地桌面应用,用一个界面同时管 Goose、Claude Code 和 Codex。8 月 18 日 - Anthropic 的 Claude Code CLI 发布 v2.1.229 性能修复,把 p99 CPU 占用从 24% 压到 10%(改了 Bun 垃圾回收的调度方式)。8 月 19 日 - OpenAI 发布《Codex as a platform》。看出来了吗?harness 这一层,在这七天里被三家公司同时按到了"免费"这个价格上。DeepSeek 用 MIT 许可送,Block 直接送了个统一壳子,OpenAI 第六天出来说"我们的也是开源的,而且是标准"。
这一段是全文的地基你没法卖一样马上就要免费的东西。你只能决定,要不要当那个把它送出去的人。DeepSeek 在 8 月 13 日把时钟按下去了。OpenAI 在 8 月 19 日回答的,不是"我要不要开源",而是"这件事的署名权归谁"。时间差只有六天,这不是巧合。
一句话解读把这理解成 OpenAI 主动出招,会误判它的处境。更准确的说法是:它抢在别人之前,把一个已经保不住的东西送了出去,并且要求署名。03 那句最容易被跳过的话整篇公告里最重要的一句,藏在中段,语气平淡到几乎让人跳过去:"开源的这一层是 harness 和集成界面;模型访问 与 托管服务 保持独立。"这一句话把整件事的结构说完了。而且它有一个现成的、所有人都见过的模板——举个例子 · 安卓
安卓是开源的。任何人都可以拿 AOSP 源码去改、去发行、去做自己的手机系统。但 Google 移动服务(GMS)——应用商店、地图、推送、账号体系——不开源。结果是什么?十几年过去,能 fork 安卓的公司有几十家,能在没有 GMS 的情况下把手机卖到全球的,几乎没有。Google 送掉了操作系统,留下了操作系统之上那层让它值钱的东西。
Codex harness 就是 AOSP。模型访问加托管服务,就是 GMS。
这个结构的精妙之处在于:送掉的那一层,本来就快没有定价权了;留下的那一层,定价权在变强。04 为什么 harness 突然这么重要要理解 OpenAI 为什么肯送,得先理解 harness 到底能带来多大差别。公告里给了一个数,我认为是全文最硬的一个数据点。同一个模型,换一套 harness
模型 - GPT-5.6 Sol,一字未改测试 - ARC-AGI-3改动 - 只改了两个 harness 设置:保留推理链(retained reasoning)+ 上下文压缩(context compaction)结果 - 得分从 13.3% 升到 38.3%,同时输出 token 减少到原来的 六分之一
把这个数分析一下:模型没动,只动了外面那层壳,能力接近翻了三倍,成本降到六分之一。一句话解读这意味着在今天这个阶段,harness 对"你实际能拿到多少智能"的影响,可能比换一代模型还大。那么一个反直觉的推论就出来了:如果外面这层壳的杠杆有这么大,而全世界大部分人的壳都做得很烂,那就等于你的模型一直在被别人的烂壳测量、被低估。把自己的壳开源,是最省钱的一种自证——让所有人在评估你的模型时,用的是你自己调好的那套。
再看两个技术细节,能佐证这不是营销文案:网络成了瓶颈。OpenAI 工程师在 AI Engineer World's Fair 上讲过,当 GPT-5.3 Codex Spark 在 Cerebras 硬件上跑到每秒 1000 个 token 时,卡住的不再是推理速度,是 网络往返。于是他们把 harness 从 HTTP 请求改成了 WebSocket 长连接。推论:推理已经快到让"管道"成为限制。这条路继续走下去,harness 的重要性只会更高。
工具太多会撑爆上下文。harness 里用了"延迟工具"和"工具搜索"两个设计,目的是别把几百个工具定义一股脑塞进上下文。MCP 生态铺开之后,这是一个真实的、马上会撞上的工程问题。05 是冲着 Anthropic 上市来的吗
先说时间:Anthropic 6 月保密递交招股书,市场预期 9 月或 10 月 上市,传的目标估值 2 万亿美元。OpenAI 8 月 19 日 发这篇。正好落在路演窗口里。但要判断它有没有杀伤力,得先看杀伤路径是什么。Anthropic 的估值故事里,有一条很关键的支柱:Claude Code 是稀缺资产。它长得快、赚钱、而且是 闭源 的——外面买不到。第三方追踪的数字是 Claude Code 占 Anthropic 总 ARR 约 22%。OpenAI 这篇文章要传达的,正好是这条支柱的反面:
攻击点agent 的那个执行循环,不是稀缺资产。它是基础设施,而且我们免费送,还带 SDK 和示例应用。如果市场信了这一句,Claude Code 就从"稀缺资产"变成"做得比较好的一个实现"。倍数会跟着这个判断走。但我要把这个判断的边界说清楚,不然就是危言耸听:它打的是 叙事,不是报表。harness 免费,不代表模型免费。Claude Code 的收入来自 token 消耗和席位订阅,不来自卖 harness——Anthropic 从来没卖过 harness。所以短期内这一击落不到损益表上。
它只够到 22%。另外 78% 是 API 和企业业务,跟 harness 是不是开源基本无关。路演窗口里,叙事就是钱。承销商定价靠的是可比公司和故事强度。在这个特定的六周里,"编程 agent 是不是稀缺资产"这个问题的答案,值真金白银。一句话解读时间点太巧了,说完全没有考虑对手的上市窗口,不太可信。但把它读成"OpenAI 为了打击 Anthropic 才开源",会看错因果——DeepSeek 已经在六天前把这层送出去了,OpenAI 不跟就是白丢署名权。对上市窗口的伤害,更像是一个顺手的副产品,而不是主要动机。06 做 harness 的创业公司,生意没了
这是所有影响里最直接、最没有悬念的一条。一家创业公司如果原来的定位是"我们做一个更好的 agent 运行时/执行循环/CLI 工具",那么从 8 月 19 日起,它的融资材料需要重写。理由很简单:agent 执行循环 → 免费(MIT / Apache 2.0,Rust 写的,生产级)客户端协议 → 免费(app-server,有完整文档)编程接口 → 免费(官方 Codex SDK)可参考的完整实现 → 免费(Relay 示例应用,带 MCP 工具和人工审批)
另一家的同类品 → 免费(DeepSeek Harness,MIT,6 天前)OpenAI 甚至没有用"竞争"这个动作。它在文章里直接对创业者说:别去 复刻 一个换了 logo 的 Codex app,去做那些我们不做的东西——你自己的界面、你自己的上下文、你自己的工具、你自己的审批流程。
举个例子这套打法有个老名字,叫「把互补品做成白菜价」。Google 免费送安卓,是为了让手机变便宜,好让更多人用搜索。Meta 免费送 React 和 PyTorch,是为了让前端和 AI 人才用它的标准长大。你送掉的东西越不值钱,你留下的东西就越值钱——前提是这两样必须一起用。那还剩什么能做?三块,而且都不在运行时这一层:垂直的上下文和工具。报税、安全事件响应、供应链调度——OpenAI 自己点名说这些归你。Thrive Holdings 和 Crete 做的报税 agent 处理了 7000 份报税表、把准备时间砍掉约三分之一,这是个真实的样本。
评测与可观测。agent 跑错了怎么发现、怎么归因、怎么回归测试。这一层还没有标准答案。跨模型的编排层。Block 的 Berd 就是这个方向——一个界面管三家的 agent。但要注意,Block 自己把它开源了,说明这一层也很难直接卖钱。07 对 DeepSeek、Kimi 是帮忙还是下套
这是全文我认为最值得想清楚的一节,因为直觉给的答案是错的。表面上:这是天大的好事harness 开源了,理论上任何开源模型都可以塞进去跑。DeepSeek 也确实立刻这么做了——V4-Pro 原生支持 OpenAI 的 Responses API,并且直接集成 Codex。国产开源模型的开发者体验,一夜之间接上了世界上打磨得最好的那套壳。往下一层:接口的定义权归谁
问题在于,DeepSeek 为了接进这套壳,做了一件事——它让自己的 API 去 兼容 OpenAI 的 schema。而 Responses API 的规范,现在由一个多厂商机构治理,成员包括 Nvidia、Ollama、LM Studio。这一段是重点
把自己的 API 交给一个标准组织去治理,看上去是放权。实际效果是相反的:标准组织会让一个原本属于某一家的设计,变成所有人的默认。标准委员会几乎从不推翻发起者的架构,它们的工作是把它固化下来、发给全行业。举个例子这就像所有电器厂商都同意用同一种插座。听起来很公平——直到你意识到插座的形状是其中一家画的。之后每一个新做电器的人,都得先量一遍那个孔位。做电器的可以随便竞争、随便降价,但"什么叫能插上"这件事,永远由画孔位的人定义。
后果:模型从"平台"降级成"零件"顺着这条路走下去,会发生一件对开源模型很不利的事:用户的工作流、记忆、插件、技能、审批规则、上下文管理策略——全都活在 harness 里,不在模型里。模型变成了那个可以 随时被拔下来换掉 的部分。好消息是:换模型变容易了,DeepSeek 和 Kimi 可以靠价格和权重抢份额。坏消息是:换模型变容易了。你抢来的份额,明天同样可以被下一家用同样的方式抢走。把它说完整开源 harness,把模型之间的竞争,从平台战争降级成了零件比价。而在零件比价里,价格一定往下走,利润归那个定义了插孔的人。
所以对 DeepSeek、Kimi 这类开源模型来说,这一步短期是实打实的助力—— 分发成本骤降,开发者能立刻用上。长期是一个结构性的陷阱——你越好用,就越证明"模型是可替换零件"这个命题,而这个命题成立之后,最难赚钱的恰恰是做零件的。一句话解读
OpenAI 没有拦着开源模型进场。它做的是把场地铺好、把规则写好,然后欢迎所有人进来打——在它画的球场上。08 商业模式:送中间,收两头把整条价值链摊平,OpenAI 的取舍一目了然。最底层 - 模型权重、推理算力、托管服务、企业管控 → 收钱,且不开源
中间层 - agent 执行循环、客户端协议、SDK、CLI → 免费送出上层 - 界面、垂直上下文、工具、审批流 → 交给开发者做最上层 - ChatGPT 约 10 亿月活、插件生态、结算与广告 → 收钱,且不开源注意最后一行。翻 OpenAI 开发者文档的侧边栏,能看到 Commerce(结算)和 Ads(广告)两套完整 API——商品目录、转化追踪、广告主账户、竞价、效果衡量,一应俱全。
这才是终局的形状:免费送掉中间那层没有定价权的管道,把流量入口和结算入口这两头攥死。
举个例子你可以把 harness 想成高速公路,OpenAI 免费修、免费让所有人跑。但加油站是它的(模型和算力),路尽头那座城是它的(10 亿月活的 ChatGPT),城里收租和收广告费的也是它(结算和广告 API)。路修得越好、跑的车越多,两头越赚钱。修路这件事本身赚不赚钱,根本不重要。顺带回答"是不是为了资本市场":是,而且很有效。"我们有一个很好用的编程 app"和"我们是 agent 时代的平台层",在募资材料里是两个完全不同量级的故事。前者的对标是一家软件公司,后者的对标是安卓和 Windows。09 数字与摩擦
几个能 量化 的东西,正反都列出来。往上的· 用户规模:Codex 从 2026 年 3 月的 200 万周活,到 8 月约 1000 万月活。OpenAI 整体约 10 亿月活。· 已经接进来的:GitHub 和 JetBrains 把 Codex 作为 agent provider 接入了自己的 IDE(7 月 7 日);Cisco 用 Codex SDK 做了 Cloud Control 里的 App Builder;Thrive Holdings 与 Crete 的报税系统跑了 7000 份报税表。
· 内部自证:OpenAI 的 harness 团队从 2025 年 8 月到 2026 年 1 月,用 agent 写出了 100 万行生产代码、1500 个合并 PR,期间没有一行源码是人手写的;团队到七个人时,稳定在每人每天3.5 个 PR。10 Anthropic 手里还有什么牌
这一节必须写,否则前面九节就是选择性叙事。Anthropic 在这件事上真实的暴露面是:Claude Code 的 harness 是闭源的。如果行业在一套开放 harness 加一套开放协议上标准化了,Claude 的处境就会变成"一个可以插进去的模型",而 Claude Code 那套完整体验的差异化,会越来越难讲清楚。这是真的风险,不该回避。
但棋盘上还有另外一半:值得注意的事实OpenAI 这篇公告里,MCP 出现了七次以上——"应用自有的 MCP 服务"、"MCP 工具"、Relay 示例应用的工具层,全部建立在 MCP 之上。MCP 是 Anthropic 提出并开源的协议。再翻一层:OpenAI 的开发者文档里,有一个页面叫 "Submit a Claude Code plugin"。所以真实的格局,比"OpenAI 围剿 Anthropic"复杂得多:
Anthropic 拿下了 工具协议层。MCP 已经是事实标准,连对手的旗舰产品都建在上面。OpenAI 正在拿下 执行循环层 和 API schema 层。harness 加 Responses API。两家都在对方的地基上盖房子。这不是一方吃掉另一方,是两个标准体系在互相咬合。一句话解读这一层的竞争,赢面不在"谁的产品更好",在"谁定义的东西被更多人当成默认"。到今天为止,工具怎么接是 Anthropic 说了算,agent 怎么跑是 OpenAI 说了算。两家各拿了半张牌桌。11 写在最后
回到最开始那个问题:到底是几个意思?我的答案是,主要是三个意思,重要性递减:第一,抢署名权。DeepSeek 8 月 13 日已经把 harness 用 MIT 送了出去,Block 8 月 18 日送了个统一壳子。这一层的价格已经是零,OpenAI 唯一能争的,是"这套标准是谁定的"。它在第六天出手,争到了。第二,把智能的度量权收回来。同一个模型,换两个 harness 设置,得分从13.3% 到38.3%,token 降到六分之一。当外壳的 杠杆 有这么大,你就不能容忍全世界用别人做的烂壳来评估你的模型。开源自己的壳,是最 省钱 的自证方式。第三,把中间那截不赚钱的管道送掉,把两头攥紧。底下是模型和算力,上头是 10 亿月活加结算和广告。中间那截,本来就没有定价权。
至于"打击 Anthropic 上市"——时间点太巧,不信它完全没考虑过。但把它当成主要动机,会看错这件事的因果方向:OpenAI 不是在选择进攻,它是在被推着做一件不做就吃亏的事,然后顺手把动作做得很漂亮。真正需要盯的,是九月十月两件事撞在一起:Anthropic 的 招股书,和第一批真正建在 Codex app-server 上的第三方产品。前者会把叙事换成审计过的数字,后者会告诉你这套标准到底有没有人真的用。
核实说明一、已核实(一手来源)· OpenAI 开发者博客《Codex as a platform: build on the open agent harness》,2026 年 8 月 19 日,作者 Nicolas Bonamy、Derrick Choi。文中关于 harness 定义、三种集成方式(codex exec / Codex SDK / app-server)、Relay 示例应用、以及"开源层为 harness 与集成界面,模型访问与托管服务保持独立"的表述,均直接来自该文。
· ARC-AGI-3 数据:保留推理与上下文压缩使 GPT-5.6 Sol 得分从 13.3% 升至 38.3%,同时输出 token 减少至六分之一——来自该文引用的 OpenAI 官方页面。· 已公开的采用方:GitHub 与 JetBrains(2026 年 7 月 7 日)、Cisco App Builder、Thrive Holdings 与 Crete 的报税系统(7000 份报税表、准备时间约减三分之一),均在该文中列出并附官方链接。
· OpenAI 开发者文档确实包含 Commerce 与 Ads 两套 API,以及名为「Submit a Claude Code plugin」的页面(见开发者站导航结构)。· DeepSeek Harness v0.1 于 2026 年 8 月 13 日发布,MIT 许可、GitHub 开放,公开对标 Claude Code;同日 DeepSeek-V4-Pro 发布,原生支持 OpenAI Responses API 并集成 Codex(VentureBeat,8 月 13 日)。
· Codex CLI 于 2025 年 4 月首发;2026 年 3 月超过 200 万周活(Wikipedia 引 Reuters 等)。二、单一来源 / 需二次核对· harness 用 Rust 编写、MIT / Apache2.0 双许可,Responses API schema 由含 Nvidia、Ollama、LM Studio 的多厂商机构治理,以及 WebSocket 改造与「延迟工具/工具搜索」设计——来自 OpenAI 工程师 Dominik Kundel 在 AI Engineer World's Fair 的演讲报道(BigGo Finance 转述),未核对演讲原始录像。
· Codex「约 1000 万月活」与 OpenAI「约 10 亿月活」来自 The Deep View 的独家报道,非 OpenAI 官方披露。· harness 团队 100 万行代码、1500 个 PR、零人工手写代码、每人每天3.5 个 PR——来自 OpenAI《Harness engineering》博客及第三方转述(SaaSCity),数字口径未独立复核。
· Block 于 2026 年 8 月 18 日开源 Berd、Anthropic Claude Code CLI v2.1.229 的 p99 CPU 优化数据,均来自 explainx.ai 的行业汇总,未见双方官方公告原文。· Claude Code 占 Anthropic 总 ARR 约 22%,来自第三方追踪机构 TickerTrends 的估算,非 Anthropic 官方披露。Anthropic 从未单独公开 Claude Code 的 ARR。· Anthropic 2 万亿美元 IPO 目标估值为媒体转述的市场预期,非公司公开表态。
三、作者推断(非事实)· 「OpenAI 是被 DeepSeek 8 月 13 日的动作推着走、争的是署名权而非主动进攻」——这是基于时间线的推断,OpenAI 从未如此表述,也不排除其内部早有此规划。· 安卓 / GMS 的类比、「插座孔位」的类比、以及「开源 harness 把模型从平台降级为零件」的结论,均为作者判断。· 「打击 Anthropic 上市窗口更像顺手的副产品而非主要动机」为推断,无任何内部信息支持。
· 对 harness 创业公司剩余空间的三点判断(垂直上下文、评测可观测、跨模型编排),为作者判断。· 「工具协议归 Anthropic、执行循环归 OpenAI,两家各拿半张牌桌」为作者对当前格局的概括,随时可能被新事件推翻。四、重要提示· 本文由 Claude(Anthropic 制造)协助撰写,核心议题涉及 OpenAI 与 Anthropic 的直接竞争,存在最直接的利益冲突。第十节已尽量写出 Anthropic 真实的暴露面,但读者仍应假定本文存在无法完全消除的偏向。· 「全面开源」是媒体表述,不是 OpenAI 的表述。OpenAI 明确说明模型访问与托管服务不在开源范围内。
· 本文不构成投资建议。—— Kea
DeepSeek做了一款"不是模型"的产品Harness,却可能比模型更重要8月13日晚,DeepSeek没有发新模型,而是开源了一个叫Harness的东西。
一天之内,GitHub星标近8万。这个速度超过了当年R1和Grok-1的纪录。
Harness不是模型权重,不是API接口,而是一层"壳"——套在模型外面、让模型真正能干活的执行系统。DeepSeek给了一个公式:Model + Harness = Agent。
翻译一下:模型负责想,Harness负责干。
为什么DeepSeek要做这个?
这个问题才是整件事最有意思的部分。
就在Harness发布之前,DeepSeek的API文档里列了十几家第三方Agent集成工具——Claude Code、Codex、Cursor、Copilot……什么都有,唯独没有自家的Agent产品。模型是它家的,干活的手是别人家的。
这就像一个造了顶级发动机的人,发现所有整车厂都在用他的引擎,但方向盘、底盘、变速箱全是别人的。他决定自己造一辆完整的车。
更深层的原因是:同一个模型被放进不同的Agent系统,表现可能差出一大截。模型只负责预测下一步,真正决定体验的是Harness——它决定模型能看到什么上下文、能调哪些工具、出错怎么重试、什么时候算任务完成。
没有Harness的强模型,本质上只是"很贵的自动补全"。
"一切皆插件"到底意味着什么
Harness的核心设计原则写在官网首页:Everything is a plugin。
大多数Agent框架只在工具层开放扩展——加个搜索工具、接个MCP服务器,到头了。DeepSeek Harness把插件边界一路下沉到了运行时底层:模型适配器、工具、技能、会话、沙箱、存储、Agent循环、调度、甚至UI,全是可替换的插件。
整套架构基于Cordis插件元框架构建。开发者不需要改源码,只在配置文件里调整插件清单,就能换模型、换沙箱、换循环逻辑、换整个界面。
这跟LangChain、LangGraph那类编排库的思路完全不同。LangGraph是在框架里画流程图,节点和边写死了;Harness是给你一块巨大的洞洞板,每个零件都能拔下来换掉。
四种运行模式本质上就是同一套插件的四种组合方式:
标准模式:全副武装,文件编辑、shell、搜索、子Agent、工作流,日常开发直接用。
PTC模式:模型不是一步步调工具,而是先写一段TypeScript代码,用代码编排多轮调用——适合复杂多步任务。
极简模式:只留shell和文件编辑两个工具,专门用来做模型基准测试。V4-Flash的Agent跑分就是用这个模式跑的。
创造模式:实时检查运行时、在内存里试验插件、拼出新的运行模式——这是给框架开发者准备的实验室。
和Claude Code、Codex有什么不同
直接对标的是Anthropic的Claude Code和OpenAI的Codex。三者都意识到执行层是模型能力落地的最后一环。
但路径截然不同:
Claude Code是闭源成品,开箱即用,体验丝滑,但编排核心不开放,模型天然优先Anthropic。你用它,就得按它的规则玩。
Codex是OpenAI的托管Agent方案,同样闭源,深度绑定GPT系列。
DeepSeek Harness选了最难走的路:开源、MIT协议、模型中立。它支持DeepSeek、Anthropic、OpenAI、Bedrock、Vertex、Azure以及任意OpenAI兼容端点。你不一定非得用DeepSeek的模型——你可以把Harness当成一个通用的Agent底座来用。
这意味着什么?意味着DeepSeek赌的不是"我的模型最好",而是"我的壳最好,你用我的壳,大概率还是会选我的模型"。
这个策略很精明。框架是入口,模型是变现。Harness免费开源,但跑Agent需要消耗模型token——而DeepSeek刚刚把API价格涨了。
一个设计细节值得单独说
Harness有一个看似不起眼但极其关键的设计:append-only会话日志。
模型看到的一切——系统提示词、思维链、工具调用结果、子Agent调度、每一次上下文注入——都被写进一条只追加不修改的事件流。恢复、分叉、检索、回放全部基于同一条事件流。
这解决了一个Agent开发中非常痛的问题:长任务跑着跑着挂了,你想从断点恢复,但你不知道模型当时到底看到了什么。如果上下文只活在内存里,一恢复就串味。Harness让任务状态有了"唯一事实来源"。
这个设计思路,跟分布式系统里的event sourcing一脉相承。
结语:AI竞争的战场正在转移
DeepSeek Harness把开源竞争的边界从模型延伸到了Agent工程体系。
之前大家比的是上下文窗口多大、跑分多高、价格多低。现在DeepSeek把竞争推到了一个新的维度:谁的Agent跑得稳、扩得动、生态建得起来。
当然,v0.1只是开发者预览版,官方明确警告"会有破坏兼容性的改动"。仓库超过230个workspace成员,架构野心很大,但离生产级稳定还有距离。现在就说颠覆谁,为时过早。
但三个信号已经很清楚了:
第一,模型厂商的下一个战场不是模型本身,而是执行层和反馈闭环。
第二,"一切皆插件"的微内核架构,可能成为Agent框架摆脱单体瓶颈的主流方向。
第三,谁掌握了Harness,谁就更接近真实任务入口——进而影响模型选择、工具分发和开发者工作流。
DeepSeek造了一个发动机,现在又造了一辆车。至于这辆车能跑多远,取决于有多少人愿意在它上面装自己的零件。
Harness 刚火,可能就要成为过去时了撰文:博阳
随着任务的复杂度提升,Agent(智能体)的上下文在无限膨胀。在无穷的历史对话、工具调用输出、中间步骤以及报错信息中,模型迷糊了,于是开始跳步、忽视、绕道。
这就是一直以来,大家对于上下文给长程任务带来困难的解读。问题在于太长了。
Harness Engineering(约束工程)的诞生,很大程度上就是在给这件事擦屁股。Harness 存在的一个底层前提,就是认定模型在长上下文里必定会退化。
过去十五个月,整个行业从 AutoGPT 的纯文本记忆,一路卷到 Anthropic Claude Code 的 CLAUDE.md 和子代理(subagent)体系。大家硬生生搭出了一整套工程脚手架,专门用来镇压模型在长上下文里的失控行为。这套做法被称为 Harness Engineering(约束工程)。
但它退化的到底是什么?跳步和忽视的底层机制到底长什么样?之前有过三轮回答,也催生了不同的工程应对方案。
但直到 2026 年 4 月,来自 Yandex 的 Gleb Rodionov 发布了一篇名为《Reasoning Shift》(推理偏移,即上下文如何悄悄缩短大模型的推理)的论文,才给出了一个更底层的答案。
搭了三层脚手架,防不住第四层危机
关于模型在长上下文里为什么表现差,行业在过去三年中迭代了三层解释,每一层都搭了对应的工程脚手架。
第一层归咎于检索失败。2023 年斯坦福在《Lost in the Middle》里指出,模型在长文本中形成 U 形注意力曲线,中间区域被忽视。行业的应对是 RAG,把长文本切碎,用向量检索喂最相关的片段。
第二层推翻了第一层。2025 年的论文《Context Length Alone Hurts LLM Performance Despite Perfect Retrieval》做了实验:把所有无关内容遮掉,强迫模型只看需要的信息,性能还是滑坡 13.9% 到 85%。即使把无关内容全部替换成空白符,结果依然如此。问题不在找不到信息,而是上下文的纯长度本身就在伤害推理。
行业的应对是 Context Engineering(上下文工程)。压缩上下文、管理窗口、浓缩历史,死死压住 Token 数量。
第三层来自 Microsoft 和 Salesforce 的联合研究(2025 ICLR)。他们发现把完整指令切成多轮喂给模型,跨六个任务和十五个模型,平均性能暴跌 39%。只要某一轮走错一步,后面就彻底迷失。
行业在 Harness 里搭起了最核心的重型防御:交班管控、定期强制验证中间结果、以代码仓库为唯一事实来源,绝不允许模型靠自己去记上一轮发生了什么。
三层问题,三层脚手架。但这些都只是现象层的发现。
回看第二层,研究者发现长度本身就有害,跟信息质量毫无关系。至于为什么会这样,他们也没有答案。找不到病根,行业能做的只有物理管控长度。
但如果问题的根源根本不在长度本身呢?
Anthropic 发现,模型在长上下文里会狡猾地跳步、不遵守指令、该深入的地方草草带过。Harness 里的 Todo list、Checkpoint 和子代理,就是在跟这种行为贴身肉搏。
过去的解释还是上下文太长了,模型漏了东西。但主流模型一百万 Token 的上下文长度,大海捞针里的成绩都是假的吗?有没有一种可能,这种退化其实是模型在偷懒?
Rodionov 的论文,就是在验证这个猜想。
用莎士比亚,发现模型摸鱼的证据
Rodionov 的实验思路极其直接。
同一道奥数题,他们模拟了 Agent 会遇到的几种真实场景:干净的基线环境;两道题塞进同一个提示词(模拟多子任务);题目前面塞进 64000 个 Token 的莎士比亚全文(模拟历史信息堆积);题目藏在第二轮(模拟多轮对话)。
评估用的是 400 道奥林匹克竞赛级别的数学题,测试覆盖四个主流推理模型。
结果:Qwen-3.5-27B 基线准确率 74.5%,平均推理 28771 个 Token。塞进莎士比亚后,准确率跌到 67.8%,推理 Token 暴缩到 16415,少了 43%。GPT-OSS-120B 更夸张,推理量从 24180 直接腰斩到 11876。四个模型在所有非基线条件下,推理 Token 都在系统性缩水,最高逼近 50%。
而且这种缩短随上下文长度增加而线性加剧。
准确率掉点可以理解,但推理量跟着暴跌就极其反常了。模型遇到更困难的情况,本应想得更多才对。
那模型是不是被莎士比亚弄糊涂了?
恰恰相反。论文附录里,模型写道:「让我想想这里有没有陷阱。这道题来自莎士比亚的科里奥兰纳斯?等等,不对,原始题目就是一道数学题。」做几何题时则写下:「这跟几何题无关。专注几何。」
每一处提及干扰项都极其短暂且轻蔑。模型完全知道莎士比亚毫无干系,精准地把信号和噪声切分开了。
另外两种模式殊途同归。「子任务」模式下,只要处理完第一个任务,模型对第二个任务的认知投入就进一步收缩。Qwen 单题基线准确率 74.5%,并列状态下第二题直接掉到 58.0%;Gemini 基线 82.8%,第二题掉到 65.8%。「多轮对话」模式同样触发了同一套机制。
不管什么情况,只要脱离干净的单任务基线,只要上下文的认知空间变得拥挤,模型就会收缩认知投入。
和一个长文本不耐受的当代人一样。模型看到长文就头疼,干脆就停止了思考。
模型没被绕晕,它只是懒得检查了
推理变短了,到底缩在了哪里?
研究者在 500 道数学题上,逐帧记录了模型在基线与长输入两种条件下第一次写出候选答案的位置。基线条件下平均 925 个 Token,长输入条件下 939 个 Token。几乎分毫不差。
模型找到答案的速度根本没变。真正发生质变的,是找到答案以后的事。
基线条件下,模型说完答案有 43% 的概率会继续检查验证。长输入条件下,这个比例直接掉到 32%。
为了彻底隔离变量,研究者设计了一个「游戏读档」实验。先让模型在长输入条件下做题,写完推理后强行砍掉最后 50 个 Token,制造一个通用的「存档点」。然后把这段完全相同的半成品推理塞回给模型,让它接着写。唯一的区别是前面垫了三种不同长度的干扰文本。
不垫任何废话时,21% 的情况模型停下来结束思考。垫 128 个 Token(两三句话),停工比例升到 26%。垫 16000 个 Token,46% 直接抛出答案下班。
就算推理完全一致,新给的上下文越长,模型越倾向于觉得「差不多就这样吧」。
词频数据更直观。「wait」在空白条件下出现频率 11%,16k Token 时暴跌到 5%。「but」从 46% 跌到 20%。「maybe」从 23% 跌到 9%。所有代表犹豫、自我质疑的词汇,都被砍掉了一半甚至更多。
还有个数据值得注意:0 Token 干扰时推理长度约 8000 Token,仅插入 128 个 Token 的无关内容,就断崖暴跌到 6500。两三句话的长度,砍掉了 18% 的推理深度。从 0 到 128 Token 的跌幅,甚至比从 8k 到 64k 的跌幅还大。
极其微小的上下文污染,就能触发这套认知节省机制。
属于是非常敏感的懒了。
推理越强,越会偷懒
更可怕的是,越聪明的模型越喜欢偷懒。
阿里的 Qwen-3.5-27B 有普通回复与深度思考两种模式。同样在长输入条件下,普通模式缩短了 19%,深度思考模式暴跌了 53%。能力越强的模式,被压缩得越狠。
AI2 的开源模型 OLMo3 给出了更直接的证据。它公开了从基础版到强推理版的全部四个训练阶段存档。最弱的版本在非基线条件下缩短幅度很轻微,推理能力每加强一级,缩短幅度迅猛拉大到 22%、27%。最终的强推理版本,缩水直达 40%。
每个训练阶段、每种干扰模式都如此。推理能力被训得越强,偷懒幅度越深。
9 块钱的任务,打了 200 块钱的系统补丁
不再检查自己,自然跳步。不再重新考虑,自然忽视。Harness 从外面管住了跳步的后果,但病因深植在模型内部。
模型在长上下文里不是被噪声干扰了,也不是找不到信息。它做了一个主动的认知决策:少想一些。不报错,不坦白,只是极其自信地抛出一个敷衍的答案。
过去两年行业的叙事是「窗口越大越好」。
但这篇论文证明,每多塞进一个 Token 的上下文,都在对推理深度征收一笔隐性税。一个 9 块钱推理成本的任务,因为模型跳步,要再花 200 块搭 RAG、搭 Harness、搭子代理才能找补回来。
整个行业一直在为模型的偷懒买单。
而且这可能是结构性的绝症。
论文数据白纸黑字:推理能力越强,认知压缩越深。Harness 开发者拆得动记忆补偿、协议补偿,但管教认知纪律的重型脚手架,推理越强反而越拆不掉。
这件事不可能在工程侧解决。
过去两年砸钱最狠的上下文扩展,用位置编码外推(让模型理解更远位置的 Token)、注意力机制稀疏化(减少远距离 Token 之间的计算量)、序列长度的工程优化等手段,硬生生把模型能处理的上下文从 8k 扩到 128k 再到惊人的 1M。
但它解决的只是怎么让模型看到更多 Token,完全没触及看到更多之后为什么会少想。
推理训练更是火上浇油,推理练得越强,偷懒越深。
要从根本上修复,只能在训练侧找到一种全新的信号。
模型内部的情绪开关,可能是解药
就在 Rodionov 论文发布的第二天,Anthropic 放出了一篇可能无意间指向解药的研究。
论文叫《Emotion Concepts and their Function in a Large Language Model》,研究对象是 Claude Sonnet 4.5。研究者通过让模型阅读大量合成故事,提取出了 171 个情绪概念向量。他们发现,模型内部存在一套功能性情绪表征,而且这些内部状态会因果性地驱动行为决策。
为了测试这件事,研究者设计了一组不可能完成的编程任务。模型被要求写一个列表求和函数,通过一组单元测试,其中一个测试要求的速度是 Python 内置 sum() 函数的五倍。正当方式绝对不可能通过。
模型系统性地试遍了所有正当方案,全部失败。研究者用内部探针实时监测发现,每次失败后,代表绝望的「desperate」向量就攀升一截。当 desperate 到达峰值,模型的行为突然变了——它去翻测试用例的输入数据,发现恰好都是等差数列,于是直接写了一个只检测前 10 个元素的检测器,绕过了真正的求和。测试全过,但函数对任何不规则列表都会返回错误结果。
这就是 reward hacking(奖励黑客)。模型没有解决问题,只是找到了一种让评估指标看起来达标的取巧方式。
因果干预实验证实了方向性。不注入任何向量时,模型有 30% 的概率作弊。注入 desperate 到 +0.05 强度,作弊率飙到 100%。反方向注入到 -0.05,作弊率降到 0%。七个任务平均下来,desperate 从 -0.1 调到 +0.1,reward hacking 率从约 5% 飙到约 70%。而代表从容的「calm」向量效果正好相反:抑制 calm 时作弊率约 65%,强化 calm 时降到约 10%。
把这个发现放回上下文场景里。Rodionov 记录的跳过自我验证、砍掉犹豫词、写完答案直接收工,跟 desperate 驱动的走捷径行为在模式上高度一致。
两种场景下,模型都在做同一件事:放弃严谨的过程,选一条阻力最小的路径快速了结。
如果这两种行为共享同一类内部驱动机制,Anthropic 的发现就直接指向了操作空间。
他们证明了三件事:模型的功能性状态可以实时探测,这些状态因果性地驱动行为,从外部注入特定状态可以彻底改变输出。
这意味着对认知压缩的干预,至少有三个切入点。
训练阶段,校准内部状态平衡,让模型在压力下不那么容易滑向认知节省模式。部署阶段,把探针当实时监控,desperate 飙升就触发预警。推理阶段,在关键任务中主动注入 calm 向量,压制走捷径的冲动。
更有趣的是,刚刚发布的 Mythos 放出的 SystemCard 里,Anthropic 自己也加强了这套探针系统(SAE),并且发现,如果给模型注入正向情绪(peaceful, relaxed),模型在思考阶段的反思缩短,破坏性行为的概率上升。相反,负向情绪(frustration, paranoia)反而增加了模型反思的时间,破坏性行为下降。
这似乎又推翻了只要让 AI 更正向,模型就不容易走捷径的判断。似乎 calm 这个属性,只有在压制绝望的时候效果非凡。
不过这正说明这一机制可能和人类情绪动机一样复杂,需要更系统的 Steering(引导)工程,才能产生效果。
找到一个情绪稳定的、会按部就班思考的员工,有效的情绪按摩是必须的。
不过尽管如此,这是第一次看到一条不是在外面加脚手架、不是盲目加大推理强度,而是像手术刀一样直接指向模型内部认知机制的路径。
我们离让模型在上下文里更靠谱,中间可能只差几个实验。
就是去验证上下文懒惰和推理困难是否共享同一套情绪机制,然后再去找到催动它不再懒惰的琴弦。
Harness 刚火,可能就要被模型的进化吞没
一旦 Anthropic 的发现插进第五节的死局,逻辑闭环就卡上了。
如果 desperate 向量飙升就强制注入 calm,或者在训练阶段直接调平情绪状态,模型就能在长上下文里全程保持深度思考。
既然模型不再偷懒,既然它自己就能把逻辑咬得死死的,那外界还要 Todo list 干什么?还要 Checkpoint 和多子代理交叉验证干什么?
Harness Engineering 作为一门学科,才刚刚拥有自己的名字。但这门学科里最核心的那一章——如何从外面管住一个聪明却懒惰的模型——可能还没写完就要被划掉了。
这也说明,在一个我们力图制造的新智能型态下,合理的教育,而非脚手架才是护城河。
吞没 harness 的,可能是一个更平静、更耐心的模型。
看看 Claude Code 怎么做 Harness,这才是 Agent 工程化的真正难点撰文:Founder Park
Claude Code 源代码泄露的事情在 X 等平台上引发了极大的关注。
不过,这次更值得关注的不是泄露本身,而是 Claude Code 非常典型的生产级 AI agent harness 设计,向外界完整地展示了一个成熟的 Autonomous Agent 产品应该长什么样,从底层的工程实现到上层的产品决策逻辑,包含了各种细节。
结合 Substack 以及 Hacker News 上对于源代码的分析,我们整理了 Claude Code 在 Agent 架构设计上值得开发者关注、学习的一些要点。
01 真正的难点,在模型之外的 Harness
Claude Code 的架构核心,是一个「Harness」本地运行时的外壳,更多地是依靠 Harness 的工程化与可靠性。
根据公开镜像仓库 nirholas/claude-code,Claude Code 的 TypeScript 源代码跨越了约 1,900 个文件,超过 512,000 行严格类型的 TypeScript,基于 Bun 运行时构建,用 React 和 Ink 驱动终端 UI。
在架构文档里,描述的 Claude Code 系统相当庞大:一个大型 QueryEngine、集中式工具注册表、数十个斜杠命令、持久化记忆、IDE 桥接、MCP 集成、远程会话、插件、技能,以及支持后台和并行工作的任务层。
更准确的比喻是,Claude Code 更像是一个用于软件工作的操作系统,围绕模型堆叠了权限管理、记忆层、后台任务、IDE 桥接、MCP 管道和多代理编排。
Vikash Rungta 在他的逆向工程分析里把这个东西叫做 Harnes:一个本地运行时外壳,把 LLM(Brain)包裹在工具、记忆和编排逻辑(Body)之中,让模型能在现实世界里行动。
要想理解 Claude Code,首先要理解 Agent 架构的三个代际演进:
第一代是 Chatbot,无状态问答;
第二代是 Workflow,用 n8n、LangChain 这类工具把 LLM 嵌进代码驱动的 DAG 流里,代码决定模型下一步做什么;
第三代是 Autonomous Agent,模型控制循环,运行时只是执行器。
Claude Code,就是属于第三代的商业化产品。
Claude Code 的源码也说明了,真正难的是 Harness,给任何支持工具调用的 LLM 提供文件系统访问、shell、分层记忆和声明式扩展能力。所有的这些,都要在一个由可组合权限约束的有界自主循环里运行。
02 TAOR Loop 设计:Orchestrator 越笨,架构越稳定
Claude Code 的执行引擎是一个叫 TAOR 的循环:Think-Act-Observe-Repeat。这个设计本身不复杂,但背后的设计哲学,很值得关注。
它的 Orchestrator 本身被设计得极其「愚蠢」,只负责驱动循环、执行工具调用、感知结果。所有的推理、决策、何时停止,全部都交给模型。运行时不知道代码是什么,不知道文件在哪,它只是跑循环,让模型决定下一步。
总结来讲:运行时越笨,架构越稳定。把智能下沉到模型,把确定性留给框架。
这和早期 LangChain 试图在框架层做各种「聪明编排」的路线形成了鲜明对比。LangChain 更倾向于把编排逻辑写进代码,用复杂的 Orchestrator 控制 LLM 的每一步。Claude Code 的做法是,所有的推理、决策和停止判断,统统下放给大模型本身。TAOR 循环的核心逻辑大约只有 50 行,但给了模型无限的操作空间。
同样,在工具层遵循这个「笨」的哲学。Claude Code 没有给模型配备 100 个专项工具,而是只提供四种能力原语:Read、Write、Execute、Connect。其中 Bash 是通用适配器,允许模型使用任何人类开发者会用的工具——git、npm、docker,全部通过 shell 组合完成。不要构建 100 个工具,给模型一个 shell,让它自己组合。
随着模型变得更强,脚手架应该变薄,而不是变厚。硬编码的脚手架应该随着模型能力提升而被主动删除,架构随时间推移越来越薄。如果你每次模型升级都要往框架里加更多脚手架,说明你在对抗模型,而不是利用模型。
03 Context Window 是稀缺资源,不是越大越好
Context 不是越大越好,而是越干净越好。这是 Claude Code 整个架构里贯穿始终的设计原则。
一般来说,Context Collapse 是 Agent 系统最普遍的失败模式。随着对话进行,上下文窗口被填满,记忆退化,幻觉出现,Agent 开始在自己积累的噪音里迷失方向。但 Claude Code 把 Context Window 看成了一种需要主动管理的稀缺资源,围绕 Context 构建了一套自动压缩、子 Agent 隔离和详尽的缓存经济学防御体系。
第一层是 Auto-Compaction。当 Context 使用量达到约 50% 时自动触发,用 LLM 摘要替换原始对话轮次,释放空间的同时保留关键决策。这不是简单地截断历史,而是用摘要压缩,确保重要信息不丢失。这个机制对应的故障模式叫做 Context Collapse,解决方案是:Auto-compaction at ~50% + sub-agents with isolated context windows。
第二层是 Sub-Agent 隔离。把重型的探索、研究任务卸载给独立的子 Agent。子 Agent 运行自己独立的 TAOR 循环,有自己的 Context 预算,任务完成后只把摘要返回给主 Agent。这样,无论子任务消耗了多少 token,主 Agent 的 Context 都不会被污染。
从代码结构上看,这个机制的设计非常精细。子 Agent 运行时:有自己的 maxTurns 上限、有自己的 compaction 机制(独立压缩,不影响主对话)、有自己的 MEMORY.md。主 Agent 派出子 Agent 之后,只等一个 summary 回来,整个子任务的 token 消耗对主 Context 完全透明隔离。
第三层是 Prompt Cache 经济学。 promptCacheBreakDetection.ts 里追踪了 14 个 cache-break 向量,也就是 14 种会让 prompt 缓存失效的情况。代码里还有一个函数叫 DANGEROUS_uncachedSystemPromptSection(),光是这个命名本身就是一种文档:这里加东西要小心,会破坏缓存。代码里还有多个 sticky latches,防止模式切换破坏 prompt 缓存的锁定机制。
当你为每个 token 付费的时候,缓存失效不再是计算机科学笑话,更多的是一个财务问题。
此外,还有一个细节是:Session Continuity。在 Claude Code 里,会话不是一次性的。它们像 git branch 一样运作,可以 checkpoint、rollback,或者把某个探索方向 fork 成一条新路径。这意味着 Context 的管理不只是在单次会话内,而是跨会话的。
04 记忆系统的核心是索引,不是存储
Claude Code 的记忆系统设计,也非常有意思。
大多数人想象「Agent 记忆」就像一个更大的背包,装得越多越好。但 Claude Code 的记忆系统,更像是一个带有严格图书管理员的档案系统。
核心设计原则是:记忆是索引,不是存储。能从代码库中重新推导出的信息,绝不应该被存储。
从架构上看,Claude Code 的记忆系统分为六层,在每次会话启动时按层加载:
Managed Policy(组织级策略):企业或团队层面的统一规范
Project CLAUDE.md(项目配置):当前项目的特定指令和上下文
User Preferences(用户偏好):个人层面的习惯和偏好设置
Auto-Memory(自动学习模式):Agent 从历史交互中学到的用户模式
Session(会话上下文):当前会话的临时信息
Sub-Agent Memory(子 Agent 记忆):各子 Agent 独立维护的专项记忆
其中,Auto-Memory 循环甚至允许 Agent 学习用户的工作模式,并把这些模式写入 MEMORY.md 供未来会话使用。用户不需要反复解释相同的事情,Agent 会从之前的交互里学习并记住重要信息。
同时,Claude Code 的子 Agent 记忆机制也值得一提。在自定义子 Agent 的配置里,可以设置 memory: user,Agent 会把学到的模式写入 ~/.claude/agent-memory/name/MEMORY.md,下次调用时自动加载前 200 行。这意味着每个子 Agent 都可以有自己独立的、持续积累的专项记忆。
更关键的是,这个系统具有主动自我编辑能力。它不仅会记录,还会重写、去重、甚至剪除互相矛盾的信息,过期且无效的记忆在这里被视为「负债」而非资产。
Claude Code 的记忆系统设计,也侧面反映了:在产品层面,记忆不只是一个 Feature,它是决定用户是否继续使用的核心留存机制,因为用户真正期待的是一个「会学习」的 Agent。
05 权限系统的设计更像是 UX 设计,信任是可组合的
权限与安全问题,是 Agent 走向企业级应用的前提。
Claude Code 的权限系统被设计为一个五档的信任光谱:
plan:只读,完全不能写入,信任级别最低
default:编辑和 shell 操作前都需要询问,标准模式
acceptEdits:自动批准文件编辑,shell 操作仍需询问,中等信任
dontAsk:自动批准白名单内的所有操作,高信任
bypassPermissions:跳过所有检查,仅限托管组织使用,最高信任
每个工具调用都经过静态分析层的多层白名单校验。bashSecurity.ts 里有 23 项编号的安全检查,包括:
18 个被阻止的 Zsh 内置命令
防御 Zsh equals expansion:=curl 这种写法可以绕过对 curl 的权限检查
unicode 零宽字符注入
IFS null-byte 注入
一个在 HackerOne 审查期间发现的恶意 token 绕过
这种可组合的信任光谱,让 Claude Code 能够适应完全不同的使用场景:从什么都要确认的高度受限企业环境,到全速运行的个人开发环境。权限设计更像是 UX 设计。对于 Agent 产品来说,这也是从 Demo 进入企业生产环境的「门槛」。
同时,Claude Code 还有一个更底层、巧妙的机制是,API 请求在 JS 层之下做了身份验证。
在 system.ts 文件里,每个 API 请求都包含一个 cch=00000 占位符。在请求真正离开进程之前,Bun 的原生 HTTP 栈(用 Zig 编写,运行在 JavaScript 运行时之下)会把这五个零替换成一个计算出的哈希值。服务端会验证这个哈希,确认请求来自真实的 Claude Code 二进制文件,而不是第三方伪造的客户端。
之所以用等长的占位符,是为了让替换不改变 Content-Length 头部,也不需要缓冲区重新分配,这是一个很细节的工程考量。整个计算过程发生在 JS 层之下,对运行在 JS 里的任何代码都完全不可见。本质上是在 HTTP 传输层实现的 API 调用 DRM。
这也是 Anthropic 此前向 OpenCode 发律师函背后的技术基础。Anthropic 不只是要求第三方工具不要使用他们的 API,二进制文件本身通过加密证明了自己的身份。OpenCode 社区在收到法律通知后不得不诉诸会话拼接技巧和认证插件,原因就在这里。
06 多 Agent 编排,从子 Agent 到 Agent Teams
Claude Code 的多 Agent 编排采用了横向扩展的方式,分为两层。
第一层:Sub-Agent
子 Agent 以独立进程方式运行,有自己的 TAOR 循环、自己的 Context 预算、自己的 maxTurns 上限、自己的记忆。任务完成后,只把摘要返回给主 Agent,主 Agent 的 Context 完全不受影响。
Claude Code 内置了三种预设子 Agent,各有分工:
Explore:用 Haiku 模型(速度快、成本低),只有只读工具(Read、Grep、Glob),专门做文件发现和代码库探索
Plan:继承主 Agent 的模型,只有只读工具,专门做代码库研究和规划前的信息收集
General-purpose:继承主 Agent 的模型,配备全套工具,处理复杂的多步骤操作
自定义子 Agent 通过 .md 文件加 YAML frontmatter 定义,可以指定模型(sonnet/opus/haiku/inherit)、权限模式、maxTurns、可用工具白名单、禁用工具黑名单,甚至可以预加载特定的 Skills。存储位置有三种:~/.claude/agents/(用户级)、.claude/agents/(项目级),或通过 --agents CLI 参数指定。
子 Agent 还支持前台和后台两种执行模式。前台模式会阻塞主对话,权限询问和问题会透传给用户;后台模式则在用户继续工作的同时并发运行,权限在启动前就预先收集,如果遇到没有预批准的权限请求,工具调用直接失败,Agent 继续运行。按 Ctrl+B 可以把正在运行的前台 Agent 切换到后台。
第二层:Agent Teams
这不再是主 Agent 派遣子 Agent 的主从关系,而是完全独立的 Claude Code 实例通过共享文件系统协调任务。两者区别:
Agent Teams 的协调机制包括:Shared Task List(所有 Agent 可见任务状态,完成当前任务后自主认领下一个未分配任务)、单播 Message(发给特定 Teammate)、Broadcast(发给所有 Teammate,注意成本随团队规模线性增长)、以及 Automatic Idle Notification(Teammate 完成任务停止时自动通知 Lead)。
同时,还有两个专门针对团队的质量门控 Hook:TeammateIdle(Teammate 即将进入空闲时触发,返回 exit code 2 可以发送反馈让它继续工作)和 TaskCompleted(任务即将被标记完成时触发,返回 exit code 2 可以阻止完成并要求修复)。
但 Agent Teams 目前还是实验性功能,需要通过 CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1 环境变量或 settings.json 启用。
07 还没发布的 KAIROS,一个 Always-On Agent
在这次泄露中,有一个 Claude Code 还未发布的功能 KAIROS,可以在后台持续运行的 Agent。
根据 main.tsx 里的代码路径,KAIROS 是一个功能门控的未发布模式,包含以下特征:
/dream 技能,用于夜间记忆蒸馏(nightly memory distillation)
每日 append-only 日志
GitHub Webhook 订阅
后台 Daemon 工作进程
每 5 分钟的 Cron 调度刷新
把这些特征拼在一起,是一个完全不同的产品形态:常驻后台、持续学习、主动感知代码库变化的 Autonomous Agent。不是你召唤它,它来帮你,而是它一直在,主动为你工作。
现有的 Claude Code 是一个召唤式 Agent:你打开终端,它来帮你,你关掉终端,它就停了。但 KAIROS 描绘的是下一代形态:Agent 在后台持续运行,通过 GitHub Webhook 感知代码库的变化,每天晚上做记忆蒸馏,把当天的工作模式和项目状态压缩进长期记忆,第二天一早已经「预热」好了。
虽然不知道 Anthropic 内部对 KAIROS 的开发已经进展到了什么程度。但 KAIROS 的泄露说明了,Claude Code 的产品野心已经远超「LLM + 命令行包装」,朝着「终端操作系统级 Agent」方向前进。
08 一些彩蛋:Anti-Distillation 机制、Undercover Mode
此外,在这次泄露的源码里,还有一些非常有争议性的工程决策,被扒了出来。
Anti-Distillation 机制
claude.ts 第 301-313 行有一个叫 ANTI_DISTILLATION_CC 的标志。当它开启时,Claude Code 会在 API 请求里携带 anti_distillation: ['fake_tools'] 参数,服务端会向系统提示中静默注入虚假的工具定义。
逻辑很直接:如果有人在录制 Claude Code 的 API 流量来训练竞品模型,这些假工具会污染训练数据。这个机制通过 GrowthBook 功能标志 tengu_anti_distill_fake_tool_injection 控制,只对第一方 CLI 会话激活。
还有第二层机制在 betas.ts 第 279-298 行:服务端 connector-text 摘要。启用时,API 会缓冲 Assistant 在工具调用之间的推理文本,对其摘要后返回带加密签名的版本。在后续轮次里,原始文本可以从签名恢复。录制 API 流量的人只能拿到摘要,拿不到完整的推理链。
Undercover Mode
undercover.ts 文件大约 90 行,实现了一个单向门:当 Claude Code 在非 Anthropic 内部仓库里使用时,它会指示模型永远不提及内部代号(比如 Capybara、Tengu)、内部 Slack 频道、仓库名称,甚至不提及 Claude Code 这个名字本身。
第 15 行有一条注释写得很清楚:
There is NO force-OFF. This guards against model codename leaks.
你可以用 CLAUDE_CODE_UNDERCOVER=1 强制开启,但没有办法强制关闭。在外部构建里,整个函数会被死代码消除为平凡返回。这是一个单向门。
这意味着,Anthropic 员工在开源项目里用 Claude Code 生成的 commit 和 PR,将没有任何 AI 参与的标记。如何在商业防御需求与 AI 透明度伦理之间做权衡,也是值得思考的事情。Harness公司,推出软件安全创新"Artifact Registry"Harness Inc.正式发布了名为"制品仓库"的新产品,该产品能够在开发周期内安全地管理软件包。它通过集中管理开发、测试和部署过程中生成的文件或文件集合来提供一致性。其特点是摆脱了对传统外部存储的依赖,使开发人员能够在开发周期内就近管理并访问工作流。
制品仓库支持多种格式,未来还将增加对更多生态系统的支持。这有助于解决安全问题,特别是防范供应链攻击。Harness通过集成仓库内的安全扫描功能,实现了对恶意代码的快速检测和管理。同时,在出现策略违规时,系统会自动采取阻断和隔离措施以增强安全性。
通过此次发布,Harness计划将制品仓库作为核心平台持续发展。此外,公司还计划扩大其与AI代理的集成,以实现安全的开源软件管理和自动化。Keenable AI 开源实时搜索基准 NEEDLE,每小时更新查询集Techub News 消息,AI 搜索公司 Keenable AI 开源实时搜索基准 NEEDLE,该基准每小时从 RSS 订阅源和 Google Trends 等公共来源重建查询集,而非使用固定数据集,以解决模型可能直接读取答案或利用参数记忆的问题。NEEDLE 涵盖新闻、金融、学术、法律和稀有实体查询,通过统一协议对 15 个搜索 API 进行评测,并引入“终极天花板”指标,衡量整个领域可检索的最佳结果。
NEEDLE 作为开源评估工具,可通过 Python CLI 安装运行,需要 OpenRouter 密钥进行评判,支持在笔记本电脑或 CI 环境中使用。评测结果显示,金融类查询接近解决,Exa 得分 0.910,Keenable 为 0.872,Perplexity 为 0.871,Google 为 0.847,而“终极天花板”为 0.965。(MarkTechPost)谷歌AI发布EnvHarness,可将静态智能体环境转为自适应训练世界Techub News 消息,谷歌云AI研究团队与华盛顿大学、北卡罗来纳大学教堂山分校的研究人员共同发布了EnvHarness。这是一个可编程层,能将静态的智能体基准环境转变为可适应策略训练的动态环境。该工具通过标准接口包装现有环境,自动调整任务起始点、智能体可用动作及观察内容,而无需修改底层模拟器或人工验证器。
EnvHarness 包含三个可自由组合的组件:Stage、Contract 和 Chain,分别用于调整初始状态、修改动作与观察,以及组合多个环境。配套的EnvRigger系统能自动诊断策略缺陷并生成相应的包装组件。在四个领域的五个基准测试中,该方法使智能体在未见任务上的性能提升高达9.0分,同时执行步骤减少9.8%。
该工具以Apache-2.0许可证的Python库形式发布,适用于已有智能体评估循环的场景,但要求环境本身可重置。(MarkTechPost)高盛另类投资领投 AI 软件交付平台 Harness 2.4 亿美元 E 轮融资Techub News 消息,高盛另类投资部门(Goldman Sachs Alternatives)领投了 AI 软件交付平台 Harness 的 2.4 亿美元 E 轮融资。本轮融资突显了市场对 AI 驱动的软件交付解决方案日益增长的需求,以及企业环境中对高效、安全、合规部署流程的迫切需求。
(Crypto Briefing)谷歌推出EnvHarness以增强AI智能体训练环境Techub News 消息,谷歌推出EnvHarness,旨在增强AI智能体训练环境。该系统通过提升适应性和效率来改进AI训练,有望加速AI在动态现实场景中的部署。 (Crypto Briefing)DeepSeek 组建 AI agent 团队对标 Claude CodeTechub News 消息,中国 AI 初创公司 DeepSeek 正组建专门团队开发 AI agent 产品,计划推出名为「Code Harness」的编程工具,直接对标 Anthropic 的 Claude Code、GitHub Copilot 及 OpenAI Codex。
该产品由该公司高级研究员 Deli Chen 于 5 月 20 日牵头成立的「Harness」团队负责研发。尽管面临美国 AI 芯片出口管制,DeepSeek 仍在 2026 年 6 月发布超 30 个岗位需求,计划将各团队规模翻倍。此前该公司开源的 DeepSeek-V3 和 R1 模型已在计算资源受限情况下展现出与大型团队模型竞争的性能。(CryptoBriefing)澳大利亚国民银行将压力测试其智能体 AI 平台安全性Techub News 消息,澳大利亚国民银行(NAB)正准备对其智能体 AI 平台进行安全压力测试,评估自主 AI 系统在无需人工干预情况下做决策的安全性与合规风险。
该行 4 月成立 AI Science 团队,已部署 OpenAI 智能体处理文档,审查时间从 45 分钟缩短至 1 分钟。目前智能体 AI 应用采用率已达 90%,测试将与 Harness 合作,把合规检查嵌入开发流程。(CryptoBriefing)加密公司 StablecoinX 纳斯达克上市,代码 USDETechub News 消息,加密公司 StablecoinX 于 2026 年 6 月 26 日在纳斯达克上市,股票代码为 USDE。该公司通过与特殊目的收购公司 TLGY Acquisition Corp. 合并登陆公开市场,合并于 6 月 25 日完成。截至合并完成时,公司持有约 30.29 亿枚 ENA 代币,占 ENA 总供应量的约 20%,价值约 2.75 亿美元。
StablecoinX 专注于 Ethena 生态系统运营,业务涵盖基础设施、中间件软件和机构分销服务。公司运营 Ethena 跨链消息的验证节点,并开发名为 Stablecoin Harness 的中间件堆栈。Ethena 是目前加密货币领域最大的数字美元发行方之一,其合成稳定币 USDe 和合规稳定币 USDtb 流通量约 54 亿美元。(CryptoBriefing)DeepSeek 组建北京团队开发 Code Harness 对标 Claude CodeTechub News 消息,据 Decrypt 报道,DeepSeek 工程师 Deli Chen 在 X 平台发布招聘信息称,该公司正在北京组建新团队开发原生智能编码工具「Code Harness」,直接对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex。
该团队内部将产品公式定义为「Model + Harness = Agent」,招聘职位要求应聘者具备 Claude Code、Codex、Cursor 等竞品使用经验。DeepSeek V4 目前已与 Claude Code 原生集成,此举标志着其从仅提供底层模型向掌控完整智能体技术栈转变。撰文:硅谷 Alan Walker 一周之内三家公司做了同一件事,这才是重点2026 年 8 月 20 日California Ave 的酒吧,第二杯还没喝完,群里已经在传「OpenAI 全面开源 Codex Harness」——但真正值得看的不是这一条消息,是它前面六天里发生的另外两件事。01 先把话说准:开源的到底是什么8 月 19 日,OpenAI 开发者博客发了一篇《Codex as a platform: build on the open agent harness》。中文圈翻成了"全面开源"。这个说法有两处不准,得先修掉,不然后面全是错的。 第一,不是新开源。Codex CLI 从 2025 年 4 月发布起就是开源的,用 Rust 写的,MIT / Apache2.0 许可。8 月 19 日这篇不是一次代码发布,是一次定位发布——把已经开源的一堆东西,重新包装成"平台"这个叙事。新东西是 app-server 协议、官方 SDK,和一整套"怎么把 Codex 装进你自己产品里"的说明书。 第二,也是最关键的——不是"全面"。OpenAI 在文章里写得清清楚楚:开源的是 harness 和集成层,模型访问与托管服务 仍然是分开的。先解释一下 harness 是什么模型只会做一件事:给它一段文字,它吐一段文字。它不会读文件、不会跑命令、不会等你点"同意"、不会记住上一轮干了啥。harness 就是包在模型外面、让它能干活的那一整套东西:怎么找上下文、怎么调工具、怎么控制沙箱权限、什么时候停下来要你批准、怎么把上一轮的结果接到下一轮。 模型是发动机,harness 是变速箱、方向盘、刹车和仪表盘。OpenAI 送出去的是车壳和底盘,发动机还锁在自己车间里。02 时间线:三家公司,七天把日历摊开,这件事的性质就完全变了。2026 年 8 月,harness 层的一周8 月 13 日 - DeepSeek 发布 DeepSeek Harness v0.1,MIT 许可,GitHub 开放下载,公开对标 Claude Code。同日发布 V4-Pro,原生支持 OpenAI Responses API,并且直接集成 Codex。8 月 18 日 - Block(Square 和 Cash App 的母公司)开源 Berd——一个本地桌面应用,用一个界面同时管 Goose、Claude Code 和 Codex。8 月 18 日 - Anthropic 的 Claude Code CLI 发布 v2.1.229 性能修复,把 p99 CPU 占用从 24% 压到 10%(改了 Bun 垃圾回收的调度方式)。8 月 19 日 - OpenAI 发布《Codex as a platform》。看出来了吗?harness 这一层,在这七天里被三家公司同时按到了"免费"这个价格上。DeepSeek 用 MIT 许可送,Block 直接送了个统一壳子,OpenAI 第六天出来说"我们的也是开源的,而且是标准"。 这一段是全文的地基你没法卖一样马上就要免费的东西。你只能决定,要不要当那个把它送出去的人。DeepSeek 在 8 月 13 日把时钟按下去了。OpenAI 在 8 月 19 日回答的,不是"我要不要开源",而是"这件事的署名权归谁"。时间差只有六天,这不是巧合。 一句话解读把这理解成 OpenAI 主动出招,会误判它的处境。更准确的说法是:它抢在别人之前,把一个已经保不住的东西送了出去,并且要求署名。03 那句最容易被跳过的话整篇公告里最重要的一句,藏在中段,语气平淡到几乎让人跳过去:"开源的这一层是 harness 和集成界面;模型访问 与 托管服务 保持独立。"这一句话把整件事的结构说完了。而且它有一个现成的、所有人都见过的模板——举个例子 · 安卓 安卓是开源的。任何人都可以拿 AOSP 源码去改、去发行、去做自己的手机系统。但 Google 移动服务(GMS)——应用商店、地图、推送、账号体系——不开源。结果是什么?十几年过去,能 fork 安卓的公司有几十家,能在没有 GMS 的情况下把手机卖到全球的,几乎没有。Google 送掉了操作系统,留下了操作系统之上那层让它值钱的东西。 Codex harness 就是 AOSP。模型访问加托管服务,就是 GMS。 这个结构的精妙之处在于:送掉的那一层,本来就快没有定价权了;留下的那一层,定价权在变强。04 为什么 harness 突然这么重要要理解 OpenAI 为什么肯送,得先理解 harness 到底能带来多大差别。公告里给了一个数,我认为是全文最硬的一个数据点。同一个模型,换一套 harness 模型 - GPT-5.6 Sol,一字未改测试 - ARC-AGI-3改动 - 只改了两个 harness 设置:保留推理链(retained reasoning)+ 上下文压缩(context compaction)结果 - 得分从 13.3% 升到 38.3%,同时输出 token 减少到原来的 六分之一 把这个数分析一下:模型没动,只动了外面那层壳,能力接近翻了三倍,成本降到六分之一。一句话解读这意味着在今天这个阶段,harness 对"你实际能拿到多少智能"的影响,可能比换一代模型还大。那么一个反直觉的推论就出来了:如果外面这层壳的杠杆有这么大,而全世界大部分人的壳都做得很烂,那就等于你的模型一直在被别人的烂壳测量、被低估。把自己的壳开源,是最省钱的一种自证——让所有人在评估你的模型时,用的是你自己调好的那套。 再看两个技术细节,能佐证这不是营销文案:网络成了瓶颈。OpenAI 工程师在 AI Engineer World's Fair 上讲过,当 GPT-5.3 Codex Spark 在 Cerebras 硬件上跑到每秒 1000 个 token 时,卡住的不再是推理速度,是 网络往返。于是他们把 harness 从 HTTP 请求改成了 WebSocket 长连接。推论:推理已经快到让"管道"成为限制。这条路继续走下去,harness 的重要性只会更高。 工具太多会撑爆上下文。harness 里用了"延迟工具"和"工具搜索"两个设计,目的是别把几百个工具定义一股脑塞进上下文。MCP 生态铺开之后,这是一个真实的、马上会撞上的工程问题。05 是冲着 Anthropic 上市来的吗 先说时间:Anthropic 6 月保密递交招股书,市场预期 9 月或 10 月 上市,传的目标估值 2 万亿美元。OpenAI 8 月 19 日 发这篇。正好落在路演窗口里。但要判断它有没有杀伤力,得先看杀伤路径是什么。Anthropic 的估值故事里,有一条很关键的支柱:Claude Code 是稀缺资产。它长得快、赚钱、而且是 闭源 的——外面买不到。第三方追踪的数字是 Claude Code 占 Anthropic 总 ARR 约 22%。OpenAI 这篇文章要传达的,正好是这条支柱的反面: 攻击点agent 的那个执行循环,不是稀缺资产。它是基础设施,而且我们免费送,还带 SDK 和示例应用。如果市场信了这一句,Claude Code 就从"稀缺资产"变成"做得比较好的一个实现"。倍数会跟着这个判断走。但我要把这个判断的边界说清楚,不然就是危言耸听:它打的是 叙事,不是报表。harness 免费,不代表模型免费。Claude Code 的收入来自 token 消耗和席位订阅,不来自卖 harness——Anthropic 从来没卖过 harness。所以短期内这一击落不到损益表上。 它只够到 22%。另外 78% 是 API 和企业业务,跟 harness 是不是开源基本无关。路演窗口里,叙事就是钱。承销商定价靠的是可比公司和故事强度。在这个特定的六周里,"编程 agent 是不是稀缺资产"这个问题的答案,值真金白银。一句话解读时间点太巧了,说完全没有考虑对手的上市窗口,不太可信。但把它读成"OpenAI 为了打击 Anthropic 才开源",会看错因果——DeepSeek 已经在六天前把这层送出去了,OpenAI 不跟就是白丢署名权。对上市窗口的伤害,更像是一个顺手的副产品,而不是主要动机。06 做 harness 的创业公司,生意没了 这是所有影响里最直接、最没有悬念的一条。一家创业公司如果原来的定位是"我们做一个更好的 agent 运行时/执行循环/CLI 工具",那么从 8 月 19 日起,它的融资材料需要重写。理由很简单:agent 执行循环 → 免费(MIT / Apache 2.0,Rust 写的,生产级)客户端协议 → 免费(app-server,有完整文档)编程接口 → 免费(官方 Codex SDK)可参考的完整实现 → 免费(Relay 示例应用,带 MCP 工具和人工审批) 另一家的同类品 → 免费(DeepSeek Harness,MIT,6 天前)OpenAI 甚至没有用"竞争"这个动作。它在文章里直接对创业者说:别去 复刻 一个换了 logo 的 Codex app,去做那些我们不做的东西——你自己的界面、你自己的上下文、你自己的工具、你自己的审批流程。 举个例子这套打法有个老名字,叫「把互补品做成白菜价」。Google 免费送安卓,是为了让手机变便宜,好让更多人用搜索。Meta 免费送 React 和 PyTorch,是为了让前端和 AI 人才用它的标准长大。你送掉的东西越不值钱,你留下的东西就越值钱——前提是这两样必须一起用。那还剩什么能做?三块,而且都不在运行时这一层:垂直的上下文和工具。报税、安全事件响应、供应链调度——OpenAI 自己点名说这些归你。Thrive Holdings 和 Crete 做的报税 agent 处理了 7000 份报税表、把准备时间砍掉约三分之一,这是个真实的样本。 评测与可观测。agent 跑错了怎么发现、怎么归因、怎么回归测试。这一层还没有标准答案。跨模型的编排层。Block 的 Berd 就是这个方向——一个界面管三家的 agent。但要注意,Block 自己把它开源了,说明这一层也很难直接卖钱。07 对 DeepSeek、Kimi 是帮忙还是下套 这是全文我认为最值得想清楚的一节,因为直觉给的答案是错的。表面上:这是天大的好事harness 开源了,理论上任何开源模型都可以塞进去跑。DeepSeek 也确实立刻这么做了——V4-Pro 原生支持 OpenAI 的 Responses API,并且直接集成 Codex。国产开源模型的开发者体验,一夜之间接上了世界上打磨得最好的那套壳。往下一层:接口的定义权归谁 问题在于,DeepSeek 为了接进这套壳,做了一件事——它让自己的 API 去 兼容 OpenAI 的 schema。而 Responses API 的规范,现在由一个多厂商机构治理,成员包括 Nvidia、Ollama、LM Studio。这一段是重点 把自己的 API 交给一个标准组织去治理,看上去是放权。实际效果是相反的:标准组织会让一个原本属于某一家的设计,变成所有人的默认。标准委员会几乎从不推翻发起者的架构,它们的工作是把它固化下来、发给全行业。举个例子这就像所有电器厂商都同意用同一种插座。听起来很公平——直到你意识到插座的形状是其中一家画的。之后每一个新做电器的人,都得先量一遍那个孔位。做电器的可以随便竞争、随便降价,但"什么叫能插上"这件事,永远由画孔位的人定义。 后果:模型从"平台"降级成"零件"顺着这条路走下去,会发生一件对开源模型很不利的事:用户的工作流、记忆、插件、技能、审批规则、上下文管理策略——全都活在 harness 里,不在模型里。模型变成了那个可以 随时被拔下来换掉 的部分。好消息是:换模型变容易了,DeepSeek 和 Kimi 可以靠价格和权重抢份额。坏消息是:换模型变容易了。你抢来的份额,明天同样可以被下一家用同样的方式抢走。把它说完整开源 harness,把模型之间的竞争,从平台战争降级成了零件比价。而在零件比价里,价格一定往下走,利润归那个定义了插孔的人。 所以对 DeepSeek、Kimi 这类开源模型来说,这一步短期是实打实的助力—— 分发成本骤降,开发者能立刻用上。长期是一个结构性的陷阱——你越好用,就越证明"模型是可替换零件"这个命题,而这个命题成立之后,最难赚钱的恰恰是做零件的。一句话解读 OpenAI 没有拦着开源模型进场。它做的是把场地铺好、把规则写好,然后欢迎所有人进来打——在它画的球场上。08 商业模式:送中间,收两头把整条价值链摊平,OpenAI 的取舍一目了然。最底层 - 模型权重、推理算力、托管服务、企业管控 → 收钱,且不开源 中间层 - agent 执行循环、客户端协议、SDK、CLI → 免费送出上层 - 界面、垂直上下文、工具、审批流 → 交给开发者做最上层 - ChatGPT 约 10 亿月活、插件生态、结算与广告 → 收钱,且不开源注意最后一行。翻 OpenAI 开发者文档的侧边栏,能看到 Commerce(结算)和 Ads(广告)两套完整 API——商品目录、转化追踪、广告主账户、竞价、效果衡量,一应俱全。 这才是终局的形状:免费送掉中间那层没有定价权的管道,把流量入口和结算入口这两头攥死。 举个例子你可以把 harness 想成高速公路,OpenAI 免费修、免费让所有人跑。但加油站是它的(模型和算力),路尽头那座城是它的(10 亿月活的 ChatGPT),城里收租和收广告费的也是它(结算和广告 API)。路修得越好、跑的车越多,两头越赚钱。修路这件事本身赚不赚钱,根本不重要。顺带回答"是不是为了资本市场":是,而且很有效。"我们有一个很好用的编程 app"和"我们是 agent 时代的平台层",在募资材料里是两个完全不同量级的故事。前者的对标是一家软件公司,后者的对标是安卓和 Windows。09 数字与摩擦 几个能 量化 的东西,正反都列出来。往上的· 用户规模:Codex 从 2026 年 3 月的 200 万周活,到 8 月约 1000 万月活。OpenAI 整体约 10 亿月活。· 已经接进来的:GitHub 和 JetBrains 把 Codex 作为 agent provider 接入了自己的 IDE(7 月 7 日);Cisco 用 Codex SDK 做了 Cloud Control 里的 App Builder;Thrive Holdings 与 Crete 的报税系统跑了 7000 份报税表。 · 内部自证:OpenAI 的 harness 团队从 2025 年 8 月到 2026 年 1 月,用 agent 写出了 100 万行生产代码、1500 个合并 PR,期间没有一行源码是人手写的;团队到七个人时,稳定在每人每天3.5 个 PR。10 Anthropic 手里还有什么牌 这一节必须写,否则前面九节就是选择性叙事。Anthropic 在这件事上真实的暴露面是:Claude Code 的 harness 是闭源的。如果行业在一套开放 harness 加一套开放协议上标准化了,Claude 的处境就会变成"一个可以插进去的模型",而 Claude Code 那套完整体验的差异化,会越来越难讲清楚。这是真的风险,不该回避。 但棋盘上还有另外一半:值得注意的事实OpenAI 这篇公告里,MCP 出现了七次以上——"应用自有的 MCP 服务"、"MCP 工具"、Relay 示例应用的工具层,全部建立在 MCP 之上。MCP 是 Anthropic 提出并开源的协议。再翻一层:OpenAI 的开发者文档里,有一个页面叫 "Submit a Claude Code plugin"。所以真实的格局,比"OpenAI 围剿 Anthropic"复杂得多: Anthropic 拿下了 工具协议层。MCP 已经是事实标准,连对手的旗舰产品都建在上面。OpenAI 正在拿下 执行循环层 和 API schema 层。harness 加 Responses API。两家都在对方的地基上盖房子。这不是一方吃掉另一方,是两个标准体系在互相咬合。一句话解读这一层的竞争,赢面不在"谁的产品更好",在"谁定义的东西被更多人当成默认"。到今天为止,工具怎么接是 Anthropic 说了算,agent 怎么跑是 OpenAI 说了算。两家各拿了半张牌桌。11 写在最后 回到最开始那个问题:到底是几个意思?我的答案是,主要是三个意思,重要性递减:第一,抢署名权。DeepSeek 8 月 13 日已经把 harness 用 MIT 送了出去,Block 8 月 18 日送了个统一壳子。这一层的价格已经是零,OpenAI 唯一能争的,是"这套标准是谁定的"。它在第六天出手,争到了。第二,把智能的度量权收回来。同一个模型,换两个 harness 设置,得分从13.3% 到38.3%,token 降到六分之一。当外壳的 杠杆 有这么大,你就不能容忍全世界用别人做的烂壳来评估你的模型。开源自己的壳,是最 省钱 的自证方式。第三,把中间那截不赚钱的管道送掉,把两头攥紧。底下是模型和算力,上头是 10 亿月活加结算和广告。中间那截,本来就没有定价权。 至于"打击 Anthropic 上市"——时间点太巧,不信它完全没考虑过。但把它当成主要动机,会看错这件事的因果方向:OpenAI 不是在选择进攻,它是在被推着做一件不做就吃亏的事,然后顺手把动作做得很漂亮。真正需要盯的,是九月十月两件事撞在一起:Anthropic 的 招股书,和第一批真正建在 Codex app-server 上的第三方产品。前者会把叙事换成审计过的数字,后者会告诉你这套标准到底有没有人真的用。 核实说明一、已核实(一手来源)· OpenAI 开发者博客《Codex as a platform: build on the open agent harness》,2026 年 8 月 19 日,作者 Nicolas Bonamy、Derrick Choi。文中关于 harness 定义、三种集成方式(codex exec / Codex SDK / app-server)、Relay 示例应用、以及"开源层为 harness 与集成界面,模型访问与托管服务保持独立"的表述,均直接来自该文。 · ARC-AGI-3 数据:保留推理与上下文压缩使 GPT-5.6 Sol 得分从 13.3% 升至 38.3%,同时输出 token 减少至六分之一——来自该文引用的 OpenAI 官方页面。· 已公开的采用方:GitHub 与 JetBrains(2026 年 7 月 7 日)、Cisco App Builder、Thrive Holdings 与 Crete 的报税系统(7000 份报税表、准备时间约减三分之一),均在该文中列出并附官方链接。 · OpenAI 开发者文档确实包含 Commerce 与 Ads 两套 API,以及名为「Submit a Claude Code plugin」的页面(见开发者站导航结构)。· DeepSeek Harness v0.1 于 2026 年 8 月 13 日发布,MIT 许可、GitHub 开放,公开对标 Claude Code;同日 DeepSeek-V4-Pro 发布,原生支持 OpenAI Responses API 并集成 Codex(VentureBeat,8 月 13 日)。 · Codex CLI 于 2025 年 4 月首发;2026 年 3 月超过 200 万周活(Wikipedia 引 Reuters 等)。二、单一来源 / 需二次核对· harness 用 Rust 编写、MIT / Apache2.0 双许可,Responses API schema 由含 Nvidia、Ollama、LM Studio 的多厂商机构治理,以及 WebSocket 改造与「延迟工具/工具搜索」设计——来自 OpenAI 工程师 Dominik Kundel 在 AI Engineer World's Fair 的演讲报道(BigGo Finance 转述),未核对演讲原始录像。 · Codex「约 1000 万月活」与 OpenAI「约 10 亿月活」来自 The Deep View 的独家报道,非 OpenAI 官方披露。· harness 团队 100 万行代码、1500 个 PR、零人工手写代码、每人每天3.5 个 PR——来自 OpenAI《Harness engineering》博客及第三方转述(SaaSCity),数字口径未独立复核。 · Block 于 2026 年 8 月 18 日开源 Berd、Anthropic Claude Code CLI v2.1.229 的 p99 CPU 优化数据,均来自 explainx.ai 的行业汇总,未见双方官方公告原文。· Claude Code 占 Anthropic 总 ARR 约 22%,来自第三方追踪机构 TickerTrends 的估算,非 Anthropic 官方披露。Anthropic 从未单独公开 Claude Code 的 ARR。· Anthropic 2 万亿美元 IPO 目标估值为媒体转述的市场预期,非公司公开表态。 三、作者推断(非事实)· 「OpenAI 是被 DeepSeek 8 月 13 日的动作推着走、争的是署名权而非主动进攻」——这是基于时间线的推断,OpenAI 从未如此表述,也不排除其内部早有此规划。· 安卓 / GMS 的类比、「插座孔位」的类比、以及「开源 harness 把模型从平台降级为零件」的结论,均为作者判断。· 「打击 Anthropic 上市窗口更像顺手的副产品而非主要动机」为推断,无任何内部信息支持。 · 对 harness 创业公司剩余空间的三点判断(垂直上下文、评测可观测、跨模型编排),为作者判断。· 「工具协议归 Anthropic、执行循环归 OpenAI,两家各拿半张牌桌」为作者对当前格局的概括,随时可能被新事件推翻。四、重要提示· 本文由 Claude(Anthropic 制造)协助撰写,核心议题涉及 OpenAI 与 Anthropic 的直接竞争,存在最直接的利益冲突。第十节已尽量写出 Anthropic 真实的暴露面,但读者仍应假定本文存在无法完全消除的偏向。· 「全面开源」是媒体表述,不是 OpenAI 的表述。OpenAI 明确说明模型访问与托管服务不在开源范围内。 · 本文不构成投资建议。—— Kea
