Josh & Ejaaz:为何我们从 Claude Code 转向 OpenAI Codex撰文:Techub News 整理
在 AI 编程助手竞争白热化的当下,工具的选择往往决定了开发效率与创造力边界。Limitless Podcast 的主持人 Josh 和 Ejaaz 2026 年 5 月进行了一场深度对谈,基于他们从 Anthropic 的 Claude Code 转向 OpenAI 的 Codex(集成于 ChatGPT 5.5)的实际经历,剖析了这两款顶尖产品的现状、核心差异以及未来的趋势。这场讨论不仅提供了直观的功能对比和 Demo 演示,更触及了 AI 工具演进背后的关键概念,对于任何依赖 AI 进行开发或创意工作的从业者而言,都具有极高的参考价值。
市场格局的戏剧性翻转:Codex 的“觉醒”与数据碾压
仅仅几个月前,Claude Code 还是几乎所有软件工程师和企业的首选,安装量遥遥领先。但 Josh 指出,在圣诞节前后,AI 编程的“氛围”发生了根本性转变——从一个“有趣的工具”变成了开发者实际交付代码时使用的利器。而此后,OpenAI 似乎“醒了过来”。
Ejaaz 用一组惊人的数据说明了这种转变:在过去一周,Codex 的安装量超过了 4600 万次,而 Claude Code 则低于 50 万次。这与历史数据形成了鲜明对比,此前 Claude Code 的安装量曾远远超过 Codex。Ejaaz 认为,这种戏剧性翻转的核心原因很简单:OpenAI 推出了更好的模型。他们在过去几周内密集发布的功能,比大多数公司一年内推出的还要多。
为了直观对比,他们制作了一个“比分牌”:OpenAI Codex 以 11 分领先,Anthropic Claude 仅得 2 分。这 11 分的优势来源于多个关键领域的突破。
Codex 的五大核心优势:从“超人”操作到屏幕监控
1. 计算机控制与速度:Claude 率先实现了让 AI 接管桌面、移动光标的能力,但速度较慢,且常遇到障碍,需要用户手动引导。Codex 不仅比普通人操作更快,甚至比 Josh 本人还快。Ejaaz 描述其光标移动速度之快,如同“使用电脑的超人”,并且可以近乎 24/7 不间断运行。
2. 长时程自主性:Codex 能够更智能、更持久地工作。传统上,AI 完成任务依赖一种名为“Ralph Loop”(以《辛普森一家》中坚持不懈的角色命名)的规划模式,即 AI 会持续迭代直至达成目标。Codex 原生集成了这种长时程思考能力,有人甚至观察到它为了完成目标持续“思考”了 36 小时。这对于解决复杂任务至关重要。
3. 浏览器使用与意图理解:Codex 可以接管浏览器,并更智能地理解它所浏览的内容。此前它不具备此能力,而现在它能进行更有目的性的操作。
4. 图像生成集成:OpenAI 2026 年 5 月发布了 ChatGPT Images 2.0 图像生成模型,其质量“绝对令人震惊”,在所有基准测试中击败了包括谷歌 Nano Banana 2.0 Pro 在内的前任领先者。而 Anthropic 目前甚至没有图像生成模型。对于任何涉及视觉工作的用户,直接在软件中使用此功能非常强大。
5. “Chronicle”——秘密的屏幕监控与效率分析:这是 Josh 认为大多数人尚未知晓的 Alpha 功能。Chronicle 会观察你滚动、点击和键入的内容,以此构建关于你的上下文和记忆,无需你主动输入。这带来了一个极其强大的提示:“根据 Chronicle(这个新的记忆功能),我在电脑上做什么事情效率很低?提出一些建议,直接告诉我我需要听到什么。”它会评估你的电脑使用习惯(例如在 Twitter 上滚动的时间),并基于其观察到的实际行为给出真实反馈,以优化你的工作流程。目前该功能仅面向付费会员(每月 100-200 美元订阅),Josh 认为这是未来重要功能的早期迹象。
此外,Codex 2026 年 5 月还推出了“自动审核”功能,能智能区分可能构成系统性威胁的操作和无需批准的操作,自动批准后者,大大简化了用户界面,让用户可以暂时离开电脑而任务照常进行。
Claude 的现存优势:个性、UI 与移动访问
Josh 和 Ejaaz 也指出了 Claude 目前仍保持优势的领域。首先是其“OpenClaw”能力(有趣的是,OpenAI 收购了 OpenClaw)。Claude 的 Dispatch 是其移动应用功能,允许用户远程与 Claude Code 交互,而 Codex 目前尚未提供此功能(团队已承诺会推出)。
其次,在个性化和用户界面方面,Claude 更出色。当使用 LLM 本身而非工具套件时,Claude 的体验更佳,UI 更温暖。此外,两者都发布了“宠物”功能(如屏幕上显示的 Angry Dario),但 Codex 的宠物能作为持久角色存在于整个电脑使用过程中,在后台与你聊天,显示进度,更具趣味性,体现了对用户体验的关注。
实战 Demo 对比:从零构建游戏与草图生成应用
为了验证理论,他们准备了两个具体的演示。
Demo 1:一次性提示构建马里奥风格游戏
Ejaaz 给出了一个提示:要求 AI 创建一个具有未来感、带霓虹灯元素的马里奥风格侧卷轴游戏,包含游戏设计、敌人、陷阱和计分板。他们将此提示输入给 ChatGPT 和 Claude,让各自的编码模型在最高设置下执行。
Claude Opus 4.7 的结果:游戏名为“Neon Plumber Moon Base Run”。视觉效果很好,有音效设计,遵循游戏原则。玩家能识别危险(如尖刺)。但逻辑存在缺陷,例如承诺的双跳功能并未正常实现,导致无法收集某些硬币。
OpenAI Codex (GPT-5.5) 的结果:游戏同样命名为“Neon Plumber Moon Base Run”。起始画面更基础,但有背景动画。游戏逻辑更好,完全可玩,有清晰的爱心(生命值)显示和计分系统,能获得功能增强道具。虽然也存在一些边缘错误,且没有音乐,但整体游戏体验更流畅、功能更完整。
在构建体验上,Ejaaz 更偏好 Codex。Codex 在接到单一提示后,没有请求任何许可,自行思考并决策推进;而 Claude Code 则会不时向用户求助。对于构建像游戏这样的非生产级项目,这种“放手”模式可能更受欢迎。
Demo 2:从手绘草图生成应用
他们提供了一个手绘(实际由 GPT Image Gen 2.0 生成)的“通用 Limitless 仪表盘应用”草图,将其输入模型。
Claude 的结果:生成了一个仪表盘,但风格基础且可预测。页面文本和图形元素很多,它推断出了旅行预算等功能(尽管提示未明确要求)。然而,它创建的是一个旅行规划板,而非围绕 Limitless Podcast 的仪表盘,可能与提示理解有关。
OpenAI Codex 的结果:界面更简洁、干净,没有追求未来感或霓虹风格。提供了一个五日旅行计划的基本信息,有多个标签页,视觉效果更好。虽然同样不是草图指定的内容,但设计更易于理解,不那么密集,且看起来已经连接到数据(顶部有“重新优化”开关)。Josh 认为 Codex 在这方面“完全碾压”,更准确地还原了原始纸张上的设计。
两个演示均显示 Codex 在逻辑实现和功能完整性上更胜一筹。
超越模型本身:“AI 模型套具”与“Vanilla Maxing”哲学
Ejaaz 指出,两大公司的模型之所以能如此快速进步,一个关键因素是“AI 模型套具”。这指的是在基础模型之上添加的层,包括预设的提示词、模型运行的环境以及确保模型以特定方式行为和发声的策略。这也解释了为何 Claude 的个性优于 ChatGPT。
Cursor 2026 年 5 月将其套具 Cursor SDK 通过 API 开放,这具有重要意义。批评者曾认为 Cursor 只是一个 AI 包装器,但事实证明,这个“包装器”或“套具”能让模型变得更智能。如果将 Cursor 的套具应用于 GPT-5.5 和 Claude Opus 4.7,得到的模型比原始基础模型更聪明、更高效。这意味着,尽管 AI 实验室投入巨资训练模型,但初创公司通过构建更好的“套具”也能创造卓越产品。套具与模型本身已密不可分,是 valuable moat。
Josh 进一步阐述了“套具”在构建“超级应用”中的作用。每个公司都试图打造一个全能的操作系统级应用,让 AI 成为其基础。OpenClaw 在此方面早期表现卓越。2026 年 5 月,Sam Altman(萨姆·奥尔特曼)宣布用户现在可以将其 ChatGPT 账户连接到 OpenClaw 生成令牌,这可能是将 OpenClaw 深度集成到 Codex 的多步计划开端。OpenAI 拥有 OpenClaw,虽然承诺保持开源,但有能力直接集成到自家产品中。Codex 的开发者也确认,原生编辑器、iOS 应用、完整浏览器和 OpenClaw 等功能都将到来。
然而,Ejaaz 指出 OpenClaw 的热度已消退,因为尽管这些工具处于前沿水平,但难以扩展到实际应用。用户不敢将其集成到存有个人文件的桌面,曾出现过访问信用卡数据或删除旧婚礼照片等恐怖故事。相比之下,在品牌信誉下提供的工具(如 ChatGPT Codex、Claude Cowork 或 NVIDIA 的企业级安全版本 NemoClaw)更能让人安心使用。
这引出了 Josh 推崇的“Vanilla Maxing”哲学:你应该 100% 使用原厂工具。很多人陷入使用各种不同仓库、技能和插件的情况,但现实是,AI 实验室的迭代速度足够快,他们会直接将功能集成到原生应用中。因此,最好的策略就是“Vanilla Maxing”——使用官方提供的工具,无需急于尝试前沿但可能不安全的外部工具。
未来展望与个人使用栈
Ejaaz 总结道,目前并没有明确的赢家,但他倾向于 Codex GPT-5.5。不过叙事转换如此之快,Claude 仍可能追赶上来。一个未被讨论和演示的模型是Claude Mythos,它在几周前伪发布,在所有基准测试中都技术上优于 5.5,但 Anthropic 因其“过于危险”和“网络安全风险”而未开放访问(美国战争部的 Peter Heskett 也提及此担忧)。OpenAI 则创建了 Mythos 级别的模型并使其对所有人可用。这或许也源于 Anthropic 计算资源的不足。
关于个人使用栈,Josh 表示他已完全转向 Codex,用于所有困难任务。但他认为,作为 LLM 或聊天机器人,GPT-5.5 略逊于 Opus 4.7,后者个性更温暖、更精准,更能理解他的意图。因此,在构建复杂项目时,他用 Opus 4.7 作为“协调者”,Codex 作为“执行者”。他还发现 Opus 4.7 在某些方面不如 4.6,例如在写作或文本消化任务上,他仍使用 Opus 4.6。
Ejaaz 的栈则更多样化。对于研究,他开始转向 GPT-5.5,因为它能进行更长时间、更深入的讨论。他举例测试了关于 AI 电力堆栈和投资标的的提示,5.5 完全超越了 4.7。但他仍因个性原因使用 4.7。总体而言,他认为 OpenAI 正处于“一代人的奔跑”中,可能很快会修复现有问题。
Josh 最后鼓励用户亲自尝试两款工具,用实际提示进行测试。无论你从事何种工作,只要使用电脑,AI 都可能帮助你更高效地完成任务,或助力你实现一直想做的爱好和副业。这场竞争的最大赢家是用户,因为每月仅需 20 美元,就能获得所有这些前沿智能和能力。[币圈动态分析] 泰达币·佩佩币位列前一日净买入榜首…尼尔币(NIL) RSI录得5.08%截至前一日基准,资产大户的投资状况中,买入排名靠前的加密货币依次为泰达币(USDT)、佩佩(PEPE)、狗狗币(DOGE)、佩吉企鹅(PENGU)、比特币(BTC)。该指标依据Bithumb内资产规模排名前5,000名用户对特定加密货币的净买入交易金额比例计算得出,显示了顶级投资者的资金流向。
根据Bithumb的统计,泰达币以15%的净买入比例位居第一,佩佩以7%紧随其后。狗狗币和佩吉企鹅均录得6%,比特币以5%的比例位列前茅。兼具避险资产属性的稳定币与波动性大的迷因币同时跻身前列,分析认为这显示出在短期市场不确定性中资金分散配置的动向。
另一方面,截至14点39分,Bithumb的相对强弱指数(RSI)显示,尼利昂(NIL)以RSI 5.08%(±0.00%)录得最低水平。随后,顺(SOON)为5.87%(-1.75%),伊夫吉(EVZ)为7.72%(-1.24%),撒哈拉AI(SAHARA)为9.10%(-0.46%),索拉(SXP)为11.11%(-2.99%)。多只标的RSI降至10%左右区间,被解读为短期超卖信号强烈形成的阶段。
RSI(相对强弱指数)是将最近14日内价格上涨幅度与下跌幅度的相对强度数值化的技术分析指标,通常RSI低于30时被视为处于超卖状态。Bithumb的RSI依据简单移动平均线(SMA)计算得出。
本文不提供金融建议,投资结果责任由投资者自行承担。10月30日下午,Bithumb交易所中USD Coin(USDC)以10%的净买入比率位居榜首,以太坊(ETH)与以太坊经典(ETC)紧随其后。相对强弱指数(RSI)指标显示,尼尔龙(NIL)以0.39%的数值进入极端超卖区间。截至30日下午5点35分,富豪们买入最多的加密货币依次为USDC、以太坊、以太经典、KAIA、比特币。
该指标基于Bithumb资产排名前5,000名用户对特定加密货币的净买入交易金额比例计算得出,反映了主要投资者的实际投资动向。
根据Bithumb统计,USDC以10%的净买入比例居首,以太坊为8%,以太经典与KAIA均为6%,比特币达5%。资金持续流向稳定币与主要蓝筹资产,防御性仓位布局仍在延续以应对短期市场波动。
另据Bithumb相对强弱指数数据显示,NIL以0.39%的RSI值(-4.25%)创最低纪录,被判定进入极端超卖状态。RAD报1.69%(-3.52%),OAS为2.94%(-6.81%),MEV达4.61%(-9.47%),SNX录得4.71%(-5.29%)。
多只标的RSI跌破5%,市场分析认为短期内可能因跌幅过大出现技术性反弹。
RSI是通过对比最近14日涨跌幅将买卖强度量化的技术分析指标,通常RSI低于30被视为超卖状态,高于70则视为超买状态。Bithumb的RSI基于简单移动平均线计算得出。
[本报道不提供金融建议,投资结果责任由投资者自行承担。]
以小博大:UniLend 被黑事件分析撰文:Sissice
编辑:Liz
背景
2025 年 1 月 13 日,据慢雾 MistEye 安全监控系统监测,EVM 链上的 UniLend 遭攻击,损失约 19.7 万美元。慢雾安全团队对该事件展开分析并将结果分享如下:
(https://x.com/SlowMist_Team/status/1878651772375572573)
相关信息
攻击者地址:0x55f5f8058816d5376df310770ca3a2e294089c33
存在漏洞的合约地址:0xc86d2555f8c360d3c5e8e4364f42c1f2d169330e
攻击交易:0x44037ffc0993327176975e08789b71c1058318f48ddeff25890a577d6555b6ba
攻击核心
本次攻击的核心在于合约在赎回资产时,计算健康因子直接使用了池中旧的 USDC 余额。这导致健康因子的计算结果高于实际情况,使得系统错误地认为用户的借贷状态是安全的。攻击者利用这一漏洞,通过闪电贷借入大量资产,存入并赎回资产时绕过健康因子的正确校验,从而无需承担实际风险便获取了目标资产。
攻击流程
1. 事先质押资产:攻击者通过前置交易 (0xdaf42127499f878b62fc5ba2103135de1c36e1646487cee309c077296814f5ff) 提前质押 200 USDC 至 UnilendV2Pool,获得了 USDC lendShare 150,237,398。随后,攻击者转移 LP Token,为后续赎回资金作准备。
2. 利用闪电贷借入资产:攻击者通过闪电贷借入 60M USDC 和 5 wstETH,并将 wstETH 转换为 6 stETH。
3. 存入资产以获取借贷份额:攻击者分别两次调用 lend 函数,将 USDC 和 stETH 存入之前准备好的 LP 中,从而获得相应的份额。此时,攻击者持有的份额为:
USDC lendshare: 150237398 + 45070847435535 = 45070997672933
stETH lendshare: 6663517741687683225
4. 借入目标资产:由于攻击者事先存入了大量的 USDC,于是通过调用 borrow 函数,可以正常借入 60 stETH。此时由于借贷,stETH borrowShare 增加至 60239272000126842038。
5. 赎回质押的 stETH:攻击者调用 redeemUnderlying 函数,赎回质押的全部 stETH。由于攻击者从未借贷过 USDC,USDC borrowShare 为 0,因此可以直接赎回全部的 stETH,stETH lendShare 归零。
6. 赎回质押的 USDC:攻击者再次调用 redeemUnderlying 函数,赎回质押的全部 USDC。在 redeemUnderlying 函数中,首先调用 _burnLPposition 函数销毁对应的 USDC lendShare,此时的 USDC lendShare 还剩下 150237398。随后,合约在 checkHealthFactorLtv1 函数中检查健康因子,最后将赎回的 USDC 转移给用户。
理论上,攻击者已经凭借质押的 USDC 借出了一部分 stETH,当他想赎回全部的 USDC 时,健康因子检查不应该通过。然而,实际情况并不是这样,让我们跟进 checkHealthFactorLtv1 函数:
我们很容易从上图发现,该函数先通过 userBalanceOftoken0 和 userBalanceOftoken1 函数获得当前的 USDC lendBalance 和 stETH borrowBalance,再计算 USDC 健康因子,并将其与安全阈值进行比较,以判断是否允许赎回 USDC。
继续深入 userBalanceOftoken0 函数进行检查:
显然,这就是问题的关键,合约直接使用了 pool 当前的 USDC 余额以及 USDC lendShare 来计算 lendBalance。然而,这一部分余额包含了用户准备赎回的 USDC 数量,USDC lendShare 却已经在前面的 _burnLPposition 函数中扣除了用户准备赎回的份额。因此 USDC lendBalance 由预期的 150237398*(728895404+4829907565)/4175666009 = 200001650 变为 150237398*(60000728895404+4829907565)/4175666009 = 2158955960717,明显偏大,导致健康因子的返回值远远高于预期,能成功通过校验。
7. 完成攻击并获利:最终,攻击者返还闪电贷借入的 USDC 和 wstETH,获利离场。由于漏洞,攻击者仅仅质押了 200 USDC 便可获得 60 stEth。
总结
本次攻击的核心在于攻击者利用 redeemUnderlying 函数使用了池子旧的 token 余额来计算健康因子,而此时用户的 token 尚未从池中转出,导致健康因子计算结果高于实际情况,系统错误地认为用户的借贷状态是安全的。攻击者因此能够绕过健康因子的正确校验,非法获取目标资产。慢雾安全团队建议项目方在健康因子计算过程中,确保资产状态的实时更新,从而避免类似情况的发生。Binance Listed UniLend to onboard Trillions worth of Tokenised Real World Assets (RWAs) to DeFi!In the fast-evolving world of cryptocurrency, a project is gaining momentum, set to redefine the future of decentralized finance. With a groundbreaking vision and a mission to bridge the gap between traditional finance and the blockchain realm, this innovative endeavor is poised to unlock the immense potential of Real World Assets (RWAs). With prominent listings on major exchanges like Binance and Coinbase Custody, this project is rapidly garnering the attention of crypto enthusiasts and investors alike.
Unlocking the Potential of Real World Assets (RWAs)
UniLend Finance’s vision, since its inception in 2020, has encompassed the inclusion of real-world assets within the DeFi ecosystem. The project’s forward-thinking approach aims to bring RWAs, including assets like gold, silver, stocks, and more, into the DeFi ecosystem.
This vision aims to provide crypto enthusiasts and investors with the opportunity to tap into a diverse array of assets beyond cryptocurrencies.
The significance of this move cannot be overstated. It empowers users to access a wide range of assets, diversify their portfolios, and explore new avenues for investment—all while enjoying the benefits of DeFi, such as enhanced liquidity and flexibility. UniLend Finance stands at the forefront of this transformative shift, offering a seamless bridge between the traditional financial world and the DeFi space..
The Permissionless Approach for a Promising Future
UniLend Finance’s permissionless approach is tailor-made for the current crypto landscape. In a world where accessibility, transparency, and community-driven initiatives are highly valued, UniLend Finance ticks all the right boxes.
The project empowers users by providing them with decision-making capabilities through Governance. It fosters an active and engaged community that actively participates in shaping the project’s future. UniLend Finance believes in the power of the community and understands that its success is intricately linked to the collective efforts of its users.
UniLend Finance’s permissionless lending and borrowing solutions are designed to be inclusive, making it accessible to users worldwide. This approach aligns perfectly with the ethos of DeFi, where financial services should be available to anyone with an internet connection.
Prominent Listings on Binance and Coinbase Custody
UniLend Finance’s journey is marked by significant milestones, including listings on Binance and Coinbase Custody. These renowned exchanges are synonymous with trust, security, and accessibility in the crypto industry.
Listing on Binance, one of the world’s largest and most influential crypto exchanges, opens up new horizons for UniLend Finance. It provides global exposure to a vast audience of crypto enthusiasts and investors, further cementing the project’s position as a game-changer in the DeFi landscape.
Coinbase Custody, known for its robust security measures and institutional-grade custody solutions, adds a layer of trust for institutional investors considering UniLend Finance. This listing signifies UniLend’s commitment to catering to a wide spectrum of users, from individual traders to institutional players
Stay Tuned for a DeFi Revolution
As UniLend Finance continues to push boundaries, the crypto community is invited to join the journey. With a commitment to unlocking the potential of RWAs, securing prominent listings, and adopting a permissionless approach, UniLend Finance is set to drive a DeFi revolution.
About UniLend Finance:
UniLend Finance is a pioneering multichain DeFi protocol that specializes in permissionless lending and borrowing solutions. With listings on major exchanges like Binance, Gate.io, HTX and Coinbase Custody, UniLend Finance is at the forefront of the DeFi revolution.
For more information and to stay updated on UniLend Finance’s latest developments, please visit the official website. You can also follow UniLend Finance on Twitter @UniLend_Financeand join the Telegram community here.撰文:Techub News 整理 在 AI 编程助手竞争白热化的当下,工具的选择往往决定了开发效率与创造力边界。Limitless Podcast 的主持人 Josh 和 Ejaaz 2026 年 5 月进行了一场深度对谈,基于他们从 Anthropic 的 Claude Code 转向 OpenAI 的 Codex(集成于 ChatGPT 5.5)的实际经历,剖析了这两款顶尖产品的现状、核心差异以及未来的趋势。这场讨论不仅提供了直观的功能对比和 Demo 演示,更触及了 AI 工具演进背后的关键概念,对于任何依赖 AI 进行开发或创意工作的从业者而言,都具有极高的参考价值。 市场格局的戏剧性翻转:Codex 的“觉醒”与数据碾压 仅仅几个月前,Claude Code 还是几乎所有软件工程师和企业的首选,安装量遥遥领先。但 Josh 指出,在圣诞节前后,AI 编程的“氛围”发生了根本性转变——从一个“有趣的工具”变成了开发者实际交付代码时使用的利器。而此后,OpenAI 似乎“醒了过来”。 Ejaaz 用一组惊人的数据说明了这种转变:在过去一周,Codex 的安装量超过了 4600 万次,而 Claude Code 则低于 50 万次。这与历史数据形成了鲜明对比,此前 Claude Code 的安装量曾远远超过 Codex。Ejaaz 认为,这种戏剧性翻转的核心原因很简单:OpenAI 推出了更好的模型。他们在过去几周内密集发布的功能,比大多数公司一年内推出的还要多。 为了直观对比,他们制作了一个“比分牌”:OpenAI Codex 以 11 分领先,Anthropic Claude 仅得 2 分。这 11 分的优势来源于多个关键领域的突破。 Codex 的五大核心优势:从“超人”操作到屏幕监控 1. 计算机控制与速度:Claude 率先实现了让 AI 接管桌面、移动光标的能力,但速度较慢,且常遇到障碍,需要用户手动引导。Codex 不仅比普通人操作更快,甚至比 Josh 本人还快。Ejaaz 描述其光标移动速度之快,如同“使用电脑的超人”,并且可以近乎 24/7 不间断运行。 2. 长时程自主性:Codex 能够更智能、更持久地工作。传统上,AI 完成任务依赖一种名为“Ralph Loop”(以《辛普森一家》中坚持不懈的角色命名)的规划模式,即 AI 会持续迭代直至达成目标。Codex 原生集成了这种长时程思考能力,有人甚至观察到它为了完成目标持续“思考”了 36 小时。这对于解决复杂任务至关重要。 3. 浏览器使用与意图理解:Codex 可以接管浏览器,并更智能地理解它所浏览的内容。此前它不具备此能力,而现在它能进行更有目的性的操作。 4. 图像生成集成:OpenAI 2026 年 5 月发布了 ChatGPT Images 2.0 图像生成模型,其质量“绝对令人震惊”,在所有基准测试中击败了包括谷歌 Nano Banana 2.0 Pro 在内的前任领先者。而 Anthropic 目前甚至没有图像生成模型。对于任何涉及视觉工作的用户,直接在软件中使用此功能非常强大。 5. “Chronicle”——秘密的屏幕监控与效率分析:这是 Josh 认为大多数人尚未知晓的 Alpha 功能。Chronicle 会观察你滚动、点击和键入的内容,以此构建关于你的上下文和记忆,无需你主动输入。这带来了一个极其强大的提示:“根据 Chronicle(这个新的记忆功能),我在电脑上做什么事情效率很低?提出一些建议,直接告诉我我需要听到什么。”它会评估你的电脑使用习惯(例如在 Twitter 上滚动的时间),并基于其观察到的实际行为给出真实反馈,以优化你的工作流程。目前该功能仅面向付费会员(每月 100-200 美元订阅),Josh 认为这是未来重要功能的早期迹象。 此外,Codex 2026 年 5 月还推出了“自动审核”功能,能智能区分可能构成系统性威胁的操作和无需批准的操作,自动批准后者,大大简化了用户界面,让用户可以暂时离开电脑而任务照常进行。 Claude 的现存优势:个性、UI 与移动访问 Josh 和 Ejaaz 也指出了 Claude 目前仍保持优势的领域。首先是其“OpenClaw”能力(有趣的是,OpenAI 收购了 OpenClaw)。Claude 的 Dispatch 是其移动应用功能,允许用户远程与 Claude Code 交互,而 Codex 目前尚未提供此功能(团队已承诺会推出)。 其次,在个性化和用户界面方面,Claude 更出色。当使用 LLM 本身而非工具套件时,Claude 的体验更佳,UI 更温暖。此外,两者都发布了“宠物”功能(如屏幕上显示的 Angry Dario),但 Codex 的宠物能作为持久角色存在于整个电脑使用过程中,在后台与你聊天,显示进度,更具趣味性,体现了对用户体验的关注。 实战 Demo 对比:从零构建游戏与草图生成应用 为了验证理论,他们准备了两个具体的演示。 Demo 1:一次性提示构建马里奥风格游戏 Ejaaz 给出了一个提示:要求 AI 创建一个具有未来感、带霓虹灯元素的马里奥风格侧卷轴游戏,包含游戏设计、敌人、陷阱和计分板。他们将此提示输入给 ChatGPT 和 Claude,让各自的编码模型在最高设置下执行。 Claude Opus 4.7 的结果:游戏名为“Neon Plumber Moon Base Run”。视觉效果很好,有音效设计,遵循游戏原则。玩家能识别危险(如尖刺)。但逻辑存在缺陷,例如承诺的双跳功能并未正常实现,导致无法收集某些硬币。 OpenAI Codex (GPT-5.5) 的结果:游戏同样命名为“Neon Plumber Moon Base Run”。起始画面更基础,但有背景动画。游戏逻辑更好,完全可玩,有清晰的爱心(生命值)显示和计分系统,能获得功能增强道具。虽然也存在一些边缘错误,且没有音乐,但整体游戏体验更流畅、功能更完整。 在构建体验上,Ejaaz 更偏好 Codex。Codex 在接到单一提示后,没有请求任何许可,自行思考并决策推进;而 Claude Code 则会不时向用户求助。对于构建像游戏这样的非生产级项目,这种“放手”模式可能更受欢迎。 Demo 2:从手绘草图生成应用 他们提供了一个手绘(实际由 GPT Image Gen 2.0 生成)的“通用 Limitless 仪表盘应用”草图,将其输入模型。 Claude 的结果:生成了一个仪表盘,但风格基础且可预测。页面文本和图形元素很多,它推断出了旅行预算等功能(尽管提示未明确要求)。然而,它创建的是一个旅行规划板,而非围绕 Limitless Podcast 的仪表盘,可能与提示理解有关。 OpenAI Codex 的结果:界面更简洁、干净,没有追求未来感或霓虹风格。提供了一个五日旅行计划的基本信息,有多个标签页,视觉效果更好。虽然同样不是草图指定的内容,但设计更易于理解,不那么密集,且看起来已经连接到数据(顶部有“重新优化”开关)。Josh 认为 Codex 在这方面“完全碾压”,更准确地还原了原始纸张上的设计。 两个演示均显示 Codex 在逻辑实现和功能完整性上更胜一筹。 超越模型本身:“AI 模型套具”与“Vanilla Maxing”哲学 Ejaaz 指出,两大公司的模型之所以能如此快速进步,一个关键因素是“AI 模型套具”。这指的是在基础模型之上添加的层,包括预设的提示词、模型运行的环境以及确保模型以特定方式行为和发声的策略。这也解释了为何 Claude 的个性优于 ChatGPT。 Cursor 2026 年 5 月将其套具 Cursor SDK 通过 API 开放,这具有重要意义。批评者曾认为 Cursor 只是一个 AI 包装器,但事实证明,这个“包装器”或“套具”能让模型变得更智能。如果将 Cursor 的套具应用于 GPT-5.5 和 Claude Opus 4.7,得到的模型比原始基础模型更聪明、更高效。这意味着,尽管 AI 实验室投入巨资训练模型,但初创公司通过构建更好的“套具”也能创造卓越产品。套具与模型本身已密不可分,是 valuable moat。 Josh 进一步阐述了“套具”在构建“超级应用”中的作用。每个公司都试图打造一个全能的操作系统级应用,让 AI 成为其基础。OpenClaw 在此方面早期表现卓越。2026 年 5 月,Sam Altman(萨姆·奥尔特曼)宣布用户现在可以将其 ChatGPT 账户连接到 OpenClaw 生成令牌,这可能是将 OpenClaw 深度集成到 Codex 的多步计划开端。OpenAI 拥有 OpenClaw,虽然承诺保持开源,但有能力直接集成到自家产品中。Codex 的开发者也确认,原生编辑器、iOS 应用、完整浏览器和 OpenClaw 等功能都将到来。 然而,Ejaaz 指出 OpenClaw 的热度已消退,因为尽管这些工具处于前沿水平,但难以扩展到实际应用。用户不敢将其集成到存有个人文件的桌面,曾出现过访问信用卡数据或删除旧婚礼照片等恐怖故事。相比之下,在品牌信誉下提供的工具(如 ChatGPT Codex、Claude Cowork 或 NVIDIA 的企业级安全版本 NemoClaw)更能让人安心使用。 这引出了 Josh 推崇的“Vanilla Maxing”哲学:你应该 100% 使用原厂工具。很多人陷入使用各种不同仓库、技能和插件的情况,但现实是,AI 实验室的迭代速度足够快,他们会直接将功能集成到原生应用中。因此,最好的策略就是“Vanilla Maxing”——使用官方提供的工具,无需急于尝试前沿但可能不安全的外部工具。 未来展望与个人使用栈 Ejaaz 总结道,目前并没有明确的赢家,但他倾向于 Codex GPT-5.5。不过叙事转换如此之快,Claude 仍可能追赶上来。一个未被讨论和演示的模型是Claude Mythos,它在几周前伪发布,在所有基准测试中都技术上优于 5.5,但 Anthropic 因其“过于危险”和“网络安全风险”而未开放访问(美国战争部的 Peter Heskett 也提及此担忧)。OpenAI 则创建了 Mythos 级别的模型并使其对所有人可用。这或许也源于 Anthropic 计算资源的不足。 关于个人使用栈,Josh 表示他已完全转向 Codex,用于所有困难任务。但他认为,作为 LLM 或聊天机器人,GPT-5.5 略逊于 Opus 4.7,后者个性更温暖、更精准,更能理解他的意图。因此,在构建复杂项目时,他用 Opus 4.7 作为“协调者”,Codex 作为“执行者”。他还发现 Opus 4.7 在某些方面不如 4.6,例如在写作或文本消化任务上,他仍使用 Opus 4.6。 Ejaaz 的栈则更多样化。对于研究,他开始转向 GPT-5.5,因为它能进行更长时间、更深入的讨论。他举例测试了关于 AI 电力堆栈和投资标的的提示,5.5 完全超越了 4.7。但他仍因个性原因使用 4.7。总体而言,他认为 OpenAI 正处于“一代人的奔跑”中,可能很快会修复现有问题。 Josh 最后鼓励用户亲自尝试两款工具,用实际提示进行测试。无论你从事何种工作,只要使用电脑,AI 都可能帮助你更高效地完成任务,或助力你实现一直想做的爱好和副业。这场竞争的最大赢家是用户,因为每月仅需 20 美元,就能获得所有这些前沿智能和能力。
