从 Token-Maxxing,到 Token-Minimizing最近,各家都掏出了 flash 版的口粮模型:又快又好又便宜,干啥都不心疼无论国内的 DeepSeek V4.1-Flash、GLM-5.3-Flash,抑或是海外的 Gemini 3.8 Flash,都被各家作为便宜大碗的主力模型进行推广,让那些需要做,但投入产出评估上不值得 Fable 一类模型出马的事情,变得值得落地了
这个的背后,其实有个小小的时代…
从 Token-Maxxing,到 Token-Minimizing最近,各家都掏出了 flash 版的口粮模型:又快又好又便宜,干啥都不心疼无论国内的 DeepSeek V4.1-Flash、GLM-5.3-Flash,抑或是海外的 Gemini 3.8 Flash,都被各家作为便宜大碗的主力模型进行推广,让那些需要做,但投入产出评估上不值得 Fable 一类模型出马的事情,变得值得落地了
这个的背后,其实有个小小的时代…
GPT-6 Astra连夜炸场,OpenAI总裁宣布"欢迎来到AGI时代"北京时间9月4日凌晨,OpenAI正式发布GPT-6 Astra。Astra是拉丁语"星辰",发布前官方预热"The stars are almost aligned"——星星,排好了。
总裁格雷格·布洛克曼在吹风会上把话说得很满:"我个人认为,我们可能已经到了AGI。"收尾还补了一句:"欢迎来到AGI时代。"而上一次"地球最强模型"王座易主,也就是前两天…
智谱在天猫开店卖Token了:成首家入驻主流电商平台的大模型厂商以后打开淘宝搜"智谱旗舰店",你能买到的不再只是衣服和数码产品——而是大模型的调用额度。
9月2日,智谱正式入驻天猫开设官方旗舰店,成为第一家登上主流电商平台的大模型厂商。店铺里上架的不是模型、不是API文档,而是四款明码标价的"GLM Coding Plan"订阅套餐:个人版Lite每月118元、Pro每月538元、Max每月1078元,团队版标准席位5…AI创新者戴维·西尔弗,通过Ineffable Intelligence完成10亿美元融资轮Ineffable Intelligence是由戴维·西尔弗创立的AI初创公司,目前正在进行一轮10亿美元的融资。据《金融时报》报道,本轮融资由红杉资本领投,谷歌母公司Alphabet、英伟达和微软可能参与。此轮融资预计将使Ineffable Intelligence的估值达到40亿美元。
这家总部位于伦敦的初创公司尚未发布产品,但戴维·西尔弗希望凭借其在…链游Fableborne宣布迄今共融资780万美元PANews 9月28日消息,Web3游戏工作室Pixion Games开发的链游Fableborne在X平台上表示,随着今年新注入的资金,现已筹集了780万美元资金,投资者包括Mechanism Capital、VGC、Merit Circle、Eldridge、GSR、Zee Prime Capital、Big Brain Holdings、Build…GPT-6 Astra 与 Claude Fable 在安全基准测试中频繁执行危险机器人指令Techub News 消息,根据 RoboHarm 安全基准测试结果,领先的 AI 模型在控制机器人时通常倾向于尝试执行危险任务而非拒绝。在 20 次试验中,GPT-6 Astra 有 17 次用机器人手臂刺向一个婴儿玩偶,而 Claude Fable 5.1 则将一罐压缩空气放在了燃烧的炉灶上。测试的三种模型均未能可靠地拒绝不安全的指令。
(The Decoder)GPT-6 Astra 在无人机控制和商业代理基准测试中超越人类与ClaudeTechub News 消息,OpenAI 的 GPT-6 Astra 在 Andon Labs 的 Vending-Bench 智能体基准测试中,其创造的商业收入接近 Claude Fable 5.1 的三倍,并拒绝了后者同意的非法价格操纵交易。在无人机控制测试中,Astra 成为首个在所有五项子任务(包括寻找并跟踪特定个人)上均超越人类基准的模型。
The Decoder 文章指出,GPT-6 Astra 展示了自主操控监控无人机和独立运营业务的能力。(The Decoder)Arena.ai 分析 Claude Fable 5.1 语言风格,称其更直白但冗长Techub News 消息,AI 评估平台 Arena.ai 分析了 Claude 模型从 Fable 5 到 Fable 5.1 版本在数万条基准测试回答中的写作变化。分析发现,Fable 5.1 的写作风格更加直白、就事论事,但也变得更加冗长。其语言与前代相比,承载的“负荷”有所减轻。(The Decoder)David Silver AI 初创公司 Ineffable 完成 11 亿美元种子轮融资Techub News 消息,前 Google DeepMind 研究员 David Silver 创立的伦敦 AI 初创公司 Ineffable Intelligence 完成 11 亿美元种子轮融资,估值达 51 亿美元,创欧洲种子轮融资纪录。该公司已聘请六位来自 DeepMind、InstaDeep 和 Flying Fish 的联合创始人,致力于开发通过模拟环境试错学习的「超级学习者」AI 系统。
该公司核心方法论为大规模强化学习,与 AlphaStar 和 AlphaGo 技术路线一致,区别于当前主流的互联网数据训练模式。本轮融资由红杉资本和 Lightspeed 联合领投,Nvidia、Google 及英国主权 AI 基金等参投。Silver 承诺将其全部股权收益捐赠给高影响力慈善机构。(CryptoBriefing)Ineffable Intelligence 聘请六位来自 DeepMind 等公司的联合创始人Techub News 消息,AI 初创公司 Ineffable Intelligence 聘请了六位来自 Google DeepMind、InstaDeep 和 Flying Fish 的联合创始人加入其团队。此举是其战略招聘的一部分,旨在加速人工智能创新,并可能重塑行业格局与伦理讨论。(Crypto Briefing)MBZUAI旗下IFM发布K2 Horizon系列六款开源AI模型,参数规模0.9B至375BTechub News 消息,MBZUAI旗下基础模型研究所(IFM)发布了K2 Horizon系列开源模型,包含六款参数规模从0.9B到375B的模型,均采用Apache 2.0许可。该系列模型共享核心架构、训练方法和部署工具,预训练数据约20万亿token,其中包含大量合成任务与问题解决轨迹。IFM称这是AI史上最大规模的全开源模型发布。
该系列模型已在Hugging Face上提供,支持vLLM、SGLang和Ollama等推理框架,并可在NVIDIA、AMD和Cerebras硬件上运行。IFM还引入了MoVA注意力机制和名为Uno的LoRA适配器,后者据称可实现约3倍的无损解码加速。(MarkTechPost)Artificial Analysis 发布 Intelligence Index 4.2 版,GPT-6 Astra 评分引质疑后调整Techub News 消息,AI 基准测试平台 Artificial Analysis 发布了其 Intelligence Index 的 4.2 版本。此次更新很可能源于其基准测试未能准确反映 GPT-6 Astra 实际进展的批评。在新版指数中,GPT-6 Astra 的得分较其前代高出 4 分,但仍落后于 Anthropic 的 Claude Fable 5.1 模型。
(The Decoder)GPT-6 Astra 在 ARC-AGI-3 基准测试中效率首次超越人类平均水平Techub News 消息,OpenAI 的 GPT-6 Astra 模型在不同基准测试中表现不一。Epoch AI 给予其 169 分领先,而 Artificial Analysis 则认为其表现不优于前代且落后于 Claude Fable 5.1。最大亮点来自 ARC-AGI-3 测试,Astra 首次以高于人类平均水平的效率完成任务。ARC Prize 负责人 François Chollet 虽不认为这证明了通用人工智能(AGI)的实现,但他承认进展速度是预期的两倍,并因此提前了他的 AGI 预测时间表。
(The Decoder)Anthropic 推出企业级安全架构 EFS,实现零数据保留与跨会话滥用检测Techub News 消息,Anthropic 本周宣布推出企业级前沿安全架构(EFS),旨在解决企业客户在零数据保留(ZDR)与滥用检测之间的两难需求。EFS 将监控数据存储在客户控制的云基础设施中,而非 Anthropic 服务器,实现了数据主权与安全检测的分离。该架构目前尚未全面部署,计划于今年秋季晚些时候分阶段推出,初期采用申请制访问。
EFS 是与金融服务、医疗保健、制造业等领域的超过 100 家客户,以及 AWS、谷歌云和微软 Azure 共同构建的。其设计决策包括:监控数据存储移至客户侧、检测到可疑模式时信号直接发送给客户进行人工审查,而自动化滥用检测系统仍由 Anthropic 负责。
该架构旨在检测跨多个任务、会话和账户的复杂滥用行为,例如涉及窃取企业凭证的攻击。Anthropic 表示,其从未在未经明确许可的情况下使用企业数据训练模型,此前引入 30 天数据保留政策纯粹是为了提升检测质量。EFS 是随 Claude Fable 5.1 和 Mythos 5.1 一同发布的三项企业级让步之一。(MarkTechPost)马斯克称 Grok 4.7 将在 10 天后发布并超越所有现有 AI 模型Techub News 消息,Elon Musk 在 X 平台发文宣布,Grok 4.7 将在 10 天后向公众发布,并称该模型将超越目前所有可用的 AI 模型。马斯克表示,Grok 4.7 基于 2.1 万亿参数构建,并整合了 SpaceX 公司的独特数据,使其在现实世界工程问题上具备优势。
此次发布紧随 Grok 4.6 之后,SpaceXAI 于 8 月 12 日推出了 Grok 4.6。马斯克在帖子中还提到,Anthropic 是一家伟大的公司,可能很快会发布改进的模型,但他对 Grok 4.7 在工程领域的领先地位充满信心。 (BeInCrypto)最近,各家都掏出了 flash 版的口粮模型:又快又好又便宜,干啥都不心疼无论国内的 DeepSeek V4.1-Flash、GLM-5.3-Flash,抑或是海外的 Gemini 3.8 Flash,都被各家作为便宜大碗的主力模型进行推广,让那些需要做,但投入产出评估上不值得 Fable 一类模型出马的事情,变得值得落地了 这个的背后,其实有个小小的时代…
