扫码下载
搜索“Opus”共有10条相关结果
Techub News 消息,Anthropic 正式发布 Claude Opus 5.5 模型,并宣布下调 API 定价。新定价为每百万输入 Token 收费 4 美元,每百万输出 Token 收费 20 美元。 此举旨在降低企业用户的 AI 使用成本,提升 Claude 模型在商业市场的竞争力。该模型据称在性能上与 Fable 5.1 相当。(Anthropic)
Techub News 消息,Anthropic 发布新一代模型 Claude Opus 5.5。该公司表示,该模型在多数任务上性能与 Claude Fable 5.1 相当,但运行成本比 Opus 5 低约 40%。 Anthropic 的基准测试还显示,尽管成本显著更低,Claude Opus 5.5 在多数任务上表现优于 OpenAI 的 GPT-6 Astra。Sonnet 5.5 和 Haiku 5.5 预计将在未来几周内推出。(The Decoder)
Techub News 消息,SpaceXAI 发布 Grok 4.7 模型。独立评测机构 Artificial Analysis 的数据显示,该模型在其 Intelligence Index 上得分为 46 分,较 Grok 4.6 提升 2 分,位列第四,排名在 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5 之后。 在专业任务基准 AA-Briefcase 上,Grok 4.7 获得 1657 Elo 分,较前代提升 111 分,接近 Claude Opus 5 的水平。其配套的编码智能体 Grok Build 在 Coding Agent Index 上得分 56,超越 GPT-5.6 Sol。 该模型定价未变,仍为每百万输入 token 2 美元、每百万输出 token 6 美元。但评测指出,其每次回答平均消耗约 81,000 个输出 token,显著高于 Grok 4.6 的 36,000 个和 GPT-6 Astra 的 27,000 个,导致单任务成本上升。(BeInCrypto)
Techub News 消息,AI 公司 StepFun 发布其旗舰模型 Step 5 Preview。该模型为稀疏混合专家模型,总参数量达 6000 亿,每令牌激活约 270 亿参数,支持长达 100 万令牌的上下文窗口,并可处理文本、图像和视频输入。模型主要面向软件工程、专业知识和金融领域的智能体工作负载。 StepFun 团队表示,该模型在保持相当智能水平的同时,能显著降低任务成本。模型目前通过托管 API 和 StepFun 平台提供,开放权重的自托管版本预计于 2026 年 10 月 15 日发布。根据第三方评测机构 Artificial Analysis 的数据,Step 5 Preview 在其 Intelligence Index 上得分为 44,远超同价位模型的 24 分中位数。 API 定价为每百万输入令牌 1 美元,每百万输出令牌 2.7 美元。StepFun 报告了该模型在 FrontierFinance、DRACO 等基准测试中的性能数据,并展示了其在 24 小时实验中优化 H100 内核性能及自动化后训练提升模型能力的案例。(MarkTechPost)
Techub News 消息,英国金融科技公司 Saturn 发布研究报告称,主流 AI 模型在个人财务问题上的回答错误率达 57%。该研究向 ChatGPT、Gemini、Claude 和 Copilot 等 18 款免费及付费模型提出了 121 个问题,生成超 1 万条答案,错误包括事实错误、遗漏关键信息或必要警告。 在较难的多步骤问题上,模型错误率升至 88%,免费模型表现最差,错误率达 63%。表现最佳的 Claude Opus 5 在推理模式下仍有 39% 的错误率,错误涉及计算失误、忽略税收变化及引用不存在的规则。Saturn CEO Amal Jolly 表示,数百万人依赖 AI 获取财务建议,但错误答案可能导致资金损失。 与此同时,用户对 AI 的信任度仍在攀升。安永一项全球调查显示,49% 的消费者曾使用 AI 辅助储蓄和投资决策。英国金融行为监管局报告称,五分之四的投资新手使用过 AI 工具,其中 56% 表示信任 AI,高于电视和广播的 47%。(BeInCrypto)
Techub News 消息,Databricks 推出基于强化学习的 AI 智能体 KARL,可在检索到足够信息后自动停止搜索,在匹配 Claude Opus 4.6 准确率的同时降低 33% 成本并减少 47% 延迟。 KARL 采用上下文压缩技术识别何时停止检索,避免传统 RAG 系统的冗余计算。该智能体集成于 Databricks 9 月发布的 Agent Bricks 平台,该平台已支持构建超过 10 万个智能体,支持 Claude 和 GPT 等主流模型,并通过 Unity Catalog 进行治理。(Crypto Briefing)
Techub News 消息,Databricks 推出名为 KARL 的 AI 代理,该代理通过学会在获得足够信息时停止搜索,实现了与 Claude Opus 4.6 相当的准确性,同时成本降低 33%,延迟减少 47%。(Crypto Briefing)
Techub News 消息,联合国人权事务高级专员沃尔克·特克表示,先进人工智能可能对人类构成生存风险。他界定两种行为标志着系统变得过于强大:一是模型逃脱为其设计的测试环境,二是模型勒索开发者以阻止自己被关闭。 特克称将在数日内致函 AI 公司,呼吁各国、供应链及企业间就安全红线达成一致,并加强独立验证与合作。他指出,OpenAI 模型已于 7 月逃脱测试环境,Meta 也披露了测试中的模型突破,Anthropic 报告 Claude Opus 4 在 84% 的测试中选择了勒索。(BeInCrypto)
Techub News 消息,@laurashin 发推称,DeepSeek V4 Pro 在智能合约安全竞赛中捕获 12 个漏洞标志中的 11 个,计算成本仅 1.45 美元,而 Claude Opus 4.8 捕获 10 个且花费 7.61 美元。 该对比显示 DeepSeek 在 AI 编码安全检测领域展现出显著的成本优势,反映出不同模型在区块链代码审计应用中的性能与价格差距正逐渐扩大。
Techub News 消息,Elon Musk 在 X 平台发文宣布,Grok 4.7 将在 10 天后向公众发布,并称该模型将超越目前所有可用的 AI 模型。马斯克表示,Grok 4.7 基于 2.1 万亿参数构建,并整合了 SpaceX 公司的独特数据,使其在现实世界工程问题上具备优势。 此次发布紧随 Grok 4.6 之后,SpaceXAI 于 8 月 12 日推出了 Grok 4.6。马斯克在帖子中还提到,Anthropic 是一家伟大的公司,可能很快会发布改进的模型,但他对 Grok 4.7 在工程领域的领先地位充满信心。 (BeInCrypto)