QR コードでダウンロード
「Bench」の検索結果:全175件
刚刚,OpenAI 把一个内部前沿模型做出来的数学成果,一股脑放上了 GitHub 来源:OpenAI 官方账号 Github 仓库位于 openai/math,里面收了 722 篇论文,并把结果归成 372 个族,涉及大约 4000 道问题,平均每个结果,花掉约 3 小时 ChatGPT Pro 的思考算力 如果你打开第 003 号,会发现惊人的一幕:O…
今天凌晨,真的又是一个神奇的一天。 两个模型,直接在今天凌晨同时发布,中路对狙。 一个是延迟了两周,终于出来见人的Grok 4.7。 一个是小米,在前几天的模型训练直播后,终于掏出了他们的MiMo v2.6。 各领风骚十几天,真的不是说说而已。 曾经我说过,大模型在我心里,其实存在一个很难同时满足的不可能三角。 性能、价格、速度。 这就是过去几乎满足不了的…
作者|刘必可(微信zbthdx) 编辑|王兆洋(微信Geisterspiele) 最近,OpenAI 公布了 Navier–Stokes 存在性与光滑性问题的一份解答及 Lean 形式化证明。这是克雷数学研究所在 2000 年提出的七个“千禧年难题”之一,每题设有百万美元奖金。据 OpenAI 公告,其内部模型构造了光滑外力下的有限时间爆破:方程描述的流速…
昨天早上,可能会是人类时代的一个分水岭。 以至于这篇文章,在我即使有提前做了大量功课,有一定的知识储备的情况下,还是写了整整一天的时间,完稿时间是今天的凌晨6点15,无他,还是因为这个事件的信息量过大,历史意义过大,那种宿命感,在调研在写的过程中,还是有无数次的巨大的情绪波动。 这个事件大家比较关注新闻的,都已经看过了。 就是昨天(10月7号)早上,Ope…
英伟达投资了一个叫 Reflection 的模型公司,发布了第一个开源模型 Beam,对标智谱的 GLM-5.2 官方说两者在高级推理测试上分数相当,Beam 的推理算力只要 5.2 的三分之一到四分之一 彭博和金融时报都表示:它是美国在开源模型领域,对中国的反击 但是呢,作为新选手...从目前成绩上来看,与国内头部的其他开源模型比如 qwen3.8/gl…
最近几天的AI圈,每天都有爆炸性新进展:World Labs被收购、Muse及Grot Bot引领个人智能体赛道起飞、Anthropic公布招股书、Frontiar labs一边喊着“pace the frontier”一边疯狂发新模型... 这些事件中关键的声音与深度解读,你都可以在硅谷101今年的科技大会上听到。 10月10-11日,为期两天的Alig…
2个月,估值翻了4倍。 作者 刘燕秋 本文字数2597 手搓量丨80% AI含量丨20% 2026年初,一款名为Instinct的AI助手开启邀请制私有Beta测试。没有人想到,这个夏天,它会在硅谷创投圈病毒式传播。大量投资人和创业者自发晒单,内测用户迅速突破10万。 这款产品至今仍未公开上线,也没有披露任何收入,但资本已经蜂拥而至。 今年8月,Insti…
AI又跑出3200亿神话。 作者 陶辉东 编辑 王庆武 本文字数2845 手搓量丨92% AI含量丨8% AI赛道,继cursor之后最大的年轻人造富神话来了。 近日,AI编程公司Cognition宣布完成超过20亿美元的E轮融资,投后估值达到了480亿美元(约3200亿人民币)。Cognition的这轮融资火爆异常,投资机构30多家,几乎集齐了硅谷顶级V…
作者|黄小艺 微信|H997Hbiu 一家成立约一年的公司,被放到了25亿美元估值的谈判桌上。 9月,外媒报道称,阿里拟领投AI训练与评测公司UniPat的一轮3亿美元融资,本轮估值约25 亿美元,腾讯、红杉中国等投资者也传出参与意愿。 这个数字,曾经属于前两轮AI创业热潮中的明星项目:Kimi背后的月之暗面,在成立约一年时达到了约25亿美元的估值;AI编…
文|王欣逸 编辑|张雨忻 如果你近期有和投资人闲聊两句,会得出这样一个结论:AI圈的关注点再一次回到了模型和AI Infra(基础设施)。模型,对应着时下应用遇冷,热度向上游转移;而AI Infra的关注点之一,是后训练平台和推理平台。 昨天,Mind Lab发布了他们的最新成果:推出面向行业的模型后训练与推理平台Mint Recursive,以及基于这一…
Techub News 消息,联想天禧 AI 自主研发的专业代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash,在国际软件工程评测 SWE-bench-Live(Lite 分榜)中以 71% 的问题解决率登顶全球第一名,并正式通过官方审核。 SWE-bench-Live 以真实 GitHub 项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,评测过程需提交全链路运行轨迹并由官方团队严格审查。TianxiCode 与 DeepSeek-v4.1-Flash 成功通过审查并获得「Verified」认证。 TianxiCode 展现了跨文件多跳检索与精准上下文管理、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大系统工程能力。联想表示,该框架未来将应用到联想 AI 硬件产品中。(量子位)
Techub News 消息,OpenAI 宣布推出开源基准 MentalHealthBench,用于评估前沿模型在现实心理健康对话中的表现。该基准由超过 80 位心理健康临床医生参与构建,旨在供研究人员审查方法、自行评估并在此基础上进行开发。OpenAI 表示,此举旨在展示前沿模型在此类对话中的持续改进。(@OpenAI)
Techub News 消息,Yandex电竞团队近日宣布阵容调整,签下选手ATF作为新的offlaner,同时将原选手DM移至替补席。此次变动可能影响团队在未来赛事中的竞争策略与动态。(Crypto Briefing)
Techub News 消息,由 Meta FAIR 实验室、伦敦大学学院和牛津大学联合开发的 AI 研究代理 AIRA₂ 在 MLE-bench-30 基准测试中取得突破,在 24 小时计算后平均百分位排名达 81.5%,72 小时后提升至 83.1%,较前代最佳基线提升约 9 个百分点。 该代理采用异步多 GPU 执行策略和「隐藏一致性评估」协议,在 4000 个团队的 Kaggle 竞赛中获得第 8 名并赢得金牌,在 20 项 AIRS-Bench 评估任务中的 6 项超越人类最优表现。研究团队通过 arXiv 预印本发布成果。(CryptoBriefing)
Techub News 消息,Microsoft 发布开源沙盒框架 ThinkingBox,用于测试 AI Agent 在处理真实业务任务时的可靠性。 该框架通过检查后端数据库的实际变更而非分析对话记录来评估 Agent 表现,并配套推出 ThinkingBox-Bench 基准测试。测试显示,表现最佳的模型在单次任务中通过率为 65.36%,但在 20 次重复试验中全部通过的比例仅为 25.25%,暴露出显著的「发现-可靠性差距」。该框架现已在 GitHub 开源,旨在建立行业评估标准。(CryptoBriefing)
Techub News 消息,AI 初创公司 Datalab 发布了开源基准套件 OmniExtractBench,旨在评估结构化文档提取系统的性能。该基准汇集了来自 4 个现有基准的 620 份文档,通过统一评分器以可解释的六种判定类型评估模型填充 JSON 模式的准确性。 Datalab 指出,现有提取基准存在偏见、评分机制不透明、文档类型单一等问题。OmniExtractBench 采用匈牙利算法进行基于内容的行对齐,评分器可通过 PyPI 安装,数据则在 Hugging Face 上以 CC BY 4.0 许可证提供。(MarkTechPost)
Techub News 消息,AI 公司 Instinct 已完成 10 亿美元融资,投后估值达 100 亿美元,其在不到一个月内估值从 25 亿美元翻四倍。本轮融资的投资者包括红杉资本和 Benchmark。 Instinct 是一家专注于开发实用人工智能产品的公司。(Crypto Briefing)
Techub News 消息,芝加哥商品交易所(CME)与 CF Benchmarks 合作推出了两个新的加密货币追踪指数,旨在为机构投资者提供更清晰的加密货币市场可见性,协助投资组合经理进行绩效衡量和风险管理。 (Crypto Briefing)
Techub News 消息,AI 研究公司 Dolores Research 发布了 WAGMI Bench,这是一个用于评估虚拟协议(Virtuals Protocol)上 AI 交易代理性能的开源基准框架。该框架旨在标准化 AI 交易代理的评估流程,以促进金融市场的透明度和创新。(Crypto Briefing)
Techub News 消息,IBM Research 发布开源工具 BenchDrift,用于测量基准测试问题在重新措辞后,对大型语言模型(LLM)评分产生的显著波动。该工具旨在量化基准测试中措辞效应的影响,帮助更准确评估模型性能。(Crypto Briefing)