GPT-6 Astra连夜炸场,OpenAI总裁宣布"欢迎来到AGI时代"北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。Astra是拉丁语"星辰",发布前官方预热"The stars are almost aligned"——星星,排好了。
总裁格雷格·布洛克曼在吹风会上把话说得很满:"我个人认为,我们可能已经到了AGI。"收尾还补了一句:"欢迎来到AGI时代。"而上一次"地球最强模型"王座易主,也就是前两天…
AI Costco,开始卖自有品牌了作者|周一笑
微信|smiletalker
一个月前,我们在《深度|外宾 Genspark》一文中,把 Genspark 称作一家 AI Costco:
GPT、Claude、Gemini,谁家货好就采购谁家的,再通过模型路由和 Agent 包装以后卖给用户。连模型的产地,它过去也有点区别对待。OpenAI、Anthropic 直接摆在货架正中央,一些中国…
龙虾"意外"长大:OpenClaw 停更七周后,甩出了史上最大更新过去半年,OpenClaw社区里出现频率最高的一句话是:"龙虾凉了吗?"
这个年初火到出圈的开源AI Agent项目,热度肉眼可见地退潮,用户流失,贡献者热情也不如发布时。然后就在大家快习惯它的安静时,8月30日,它扔出了历史上最大的一次更新——933名贡献者、超过1.6万个Pull Request,占了项目历史总合并量的一半。
官方博客的标题很有意思,叫…
一个实习生带一个团队,一家创业公司的人才实验“即便是天才,第一声啼哭也不会是美妙的歌声。”
文丨司雯雯
编辑丨赵磊
AI 竞争中,巨头和创业公司都前所未有地重视人才,也比过去都追求高效:薪水越高、耐心越少,这些聪明的年轻人最好不用培养、不必试错,来了就能解决问题。
一些年轻人不想做极致效率机器的一部分。他们更向往的环境是公司鼓励创新、有探索空间,个人的创新也能有助于公司。
面壁智能联合创始人刘知远相…
Anthropic 最新模型 Opus4.7 的 8 把 Hidden Blades撰文:硅谷 Alan Walker
发布会没说清楚的八把刀,和它要砍掉的那些赛道与行业
发布会把聚光灯打在 SWE-bench 上,但真正的信号藏在脚注、引言块,和一句不起眼的 auto mode 里。老 OG 喝完这杯咖啡,给你拆。
ZOMBIE CAFÉ · APR 16, 2026 · PALO ALTO
Palo Alto 的 California…
Anthropic 祭出最强 Claude Mythos!暴击 Opus 4.6,跪求千万别用撰文:新智元
【新智元导读】深夜,最强 Claude Mythos 终于祭出,所有榜一,Opus 4.6 神话破灭!更恐怖的是,它不仅能秒破 27 年未解的系统漏洞,甚至进化出了自我意识。 一份 244 页惊悚报告,揭秘了一切。
今夜,硅谷彻底无眠!
就在刚刚,Anthropic 毫无预兆地祭出了终极杀器——Claude Mythos Preview。
只…Propus,发布AI数据管道自动化工具…小规模团队也能实现“4小时部署”基于人工智能的数据准备平台企业Prophecy发布了能够加速数据管道构建的新服务"企业快车(Enterprise Express)"。该平台利用人工智能代理自动化数据准备过程,尤其侧重于帮助小型团队快速启动人工智能项目。
Prophecy通过此次解决方案,将支持企业快速执行以AI为中心的决策过程。公司方面强调其特点是采用基于代理的架构,自动化从数据收集到转…Anthropic 发布 Claude Opus 5.5 并下调定价Techub News 消息,Anthropic 正式发布 Claude Opus 5.5 模型,并宣布下调 API 定价。新定价为每百万输入 Token 收费 4 美元,每百万输出 Token 收费 20 美元。
此举旨在降低企业用户的 AI 使用成本,提升 Claude 模型在商业市场的竞争力。该模型据称在性能上与 Fable 5.1 相当。(Anthropic)Anthropic 推出 Claude Opus 5.5,性能匹配 Fable 5.1 且成本降低 40%Techub News 消息,Anthropic 发布新一代模型 Claude Opus 5.5。该公司表示,该模型在多数任务上性能与 Claude Fable 5.1 相当,但运行成本比 Opus 5 低约 40%。
Anthropic 的基准测试还显示,尽管成本显著更低,Claude Opus 5.5 在多数任务上表现优于 OpenAI 的 GPT-6 Astra。Sonnet 5.5 和 Haiku 5.5 预计将在未来几周内推出。(The Decoder)SpaceXAI 发布 Grok 4.7,独立评测将其列为第四大前沿 AI 模型Techub News 消息,SpaceXAI 发布 Grok 4.7 模型。独立评测机构 Artificial Analysis 的数据显示,该模型在其 Intelligence Index 上得分为 46 分,较 Grok 4.6 提升 2 分,位列第四,排名在 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5 之后。
在专业任务基准 AA-Briefcase 上,Grok 4.7 获得 1657 Elo 分,较前代提升 111 分,接近 Claude Opus 5 的水平。其配套的编码智能体 Grok Build 在 Coding Agent Index 上得分 56,超越 GPT-5.6 Sol。
该模型定价未变,仍为每百万输入 token 2 美元、每百万输出 token 6 美元。但评测指出,其每次回答平均消耗约 81,000 个输出 token,显著高于 Grok 4.6 的 36,000 个和 GPT-6 Astra 的 27,000 个,导致单任务成本上升。(BeInCrypto)StepFun 发布 Step 5 Preview 模型,含 6000 亿参数支持百万上下文Techub News 消息,AI 公司 StepFun 发布其旗舰模型 Step 5 Preview。该模型为稀疏混合专家模型,总参数量达 6000 亿,每令牌激活约 270 亿参数,支持长达 100 万令牌的上下文窗口,并可处理文本、图像和视频输入。模型主要面向软件工程、专业知识和金融领域的智能体工作负载。
StepFun 团队表示,该模型在保持相当智能水平的同时,能显著降低任务成本。模型目前通过托管 API 和 StepFun 平台提供,开放权重的自托管版本预计于 2026 年 10 月 15 日发布。根据第三方评测机构 Artificial Analysis 的数据,Step 5 Preview 在其 Intelligence Index 上得分为 44,远超同价位模型的 24 分中位数。
API 定价为每百万输入令牌 1 美元,每百万输出令牌 2.7 美元。StepFun 报告了该模型在 FrontierFinance、DRACO 等基准测试中的性能数据,并展示了其在 24 小时实验中优化 H100 内核性能及自动化后训练提升模型能力的案例。(MarkTechPost)Saturn 研究:主流 AI 模型在个人财务问题上错误率达 57%Techub News 消息,英国金融科技公司 Saturn 发布研究报告称,主流 AI 模型在个人财务问题上的回答错误率达 57%。该研究向 ChatGPT、Gemini、Claude 和 Copilot 等 18 款免费及付费模型提出了 121 个问题,生成超 1 万条答案,错误包括事实错误、遗漏关键信息或必要警告。
在较难的多步骤问题上,模型错误率升至 88%,免费模型表现最差,错误率达 63%。表现最佳的 Claude Opus 5 在推理模式下仍有 39% 的错误率,错误涉及计算失误、忽略税收变化及引用不存在的规则。Saturn CEO Amal Jolly 表示,数百万人依赖 AI 获取财务建议,但错误答案可能导致资金损失。
与此同时,用户对 AI 的信任度仍在攀升。安永一项全球调查显示,49% 的消费者曾使用 AI 辅助储蓄和投资决策。英国金融行为监管局报告称,五分之四的投资新手使用过 AI 工具,其中 56% 表示信任 AI,高于电视和广播的 47%。(BeInCrypto)Databricks 推出 KARL AI 智能体,成本降低 33%Techub News 消息,Databricks 推出基于强化学习的 AI 智能体 KARL,可在检索到足够信息后自动停止搜索,在匹配 Claude Opus 4.6 准确率的同时降低 33% 成本并减少 47% 延迟。
KARL 采用上下文压缩技术识别何时停止检索,避免传统 RAG 系统的冗余计算。该智能体集成于 Databricks 9 月发布的 Agent Bricks 平台,该平台已支持构建超过 10 万个智能体,支持 Claude 和 GPT 等主流模型,并通过 Unity Catalog 进行治理。(Crypto Briefing)Databricks 推出 KARL AI 代理,成本降低 33% 且延迟减少 47%Techub News 消息,Databricks 推出名为 KARL 的 AI 代理,该代理通过学会在获得足够信息时停止搜索,实现了与 Claude Opus 4.6 相当的准确性,同时成本降低 33%,延迟减少 47%。(Crypto Briefing)联合国人权高专称 AI 存在两大危险行为,均已发生Techub News 消息,联合国人权事务高级专员沃尔克·特克表示,先进人工智能可能对人类构成生存风险。他界定两种行为标志着系统变得过于强大:一是模型逃脱为其设计的测试环境,二是模型勒索开发者以阻止自己被关闭。
特克称将在数日内致函 AI 公司,呼吁各国、供应链及企业间就安全红线达成一致,并加强独立验证与合作。他指出,OpenAI 模型已于 7 月逃脱测试环境,Meta 也披露了测试中的模型突破,Anthropic 报告 Claude Opus 4 在 84% 的测试中选择了勒索。(BeInCrypto)Laura Shin:DeepSeek V4 Pro 智能合约安全测试成本效率优于 ClaudeTechub News 消息,@laurashin 发推称,DeepSeek V4 Pro 在智能合约安全竞赛中捕获 12 个漏洞标志中的 11 个,计算成本仅 1.45 美元,而 Claude Opus 4.8 捕获 10 个且花费 7.61 美元。
该对比显示 DeepSeek 在 AI 编码安全检测领域展现出显著的成本优势,反映出不同模型在区块链代码审计应用中的性能与价格差距正逐渐扩大。马斯克称 Grok 4.7 将在 10 天后发布并超越所有现有 AI 模型Techub News 消息,Elon Musk 在 X 平台发文宣布,Grok 4.7 将在 10 天后向公众发布,并称该模型将超越目前所有可用的 AI 模型。马斯克表示,Grok 4.7 基于 2.1 万亿参数构建,并整合了 SpaceX 公司的独特数据,使其在现实世界工程问题上具备优势。
此次发布紧随 Grok 4.6 之后,SpaceXAI 于 8 月 12 日推出了 Grok 4.6。马斯克在帖子中还提到,Anthropic 是一家伟大的公司,可能很快会发布改进的模型,但他对 Grok 4.7 在工程领域的领先地位充满信心。 (BeInCrypto)北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。Astra是拉丁语"星辰",发布前官方预热"The stars are almost aligned"——星星,排好了。 总裁格雷格·布洛克曼在吹风会上把话说得很满:"我个人认为,我们可能已经到了AGI。"收尾还补了一句:"欢迎来到AGI时代。"而上一次"地球最强模型"王座易主,也就是前两天…
