QR コードでダウンロード
「Benchmarks」の検索結果:全75件
Techub News 消息,芝加哥商品交易所(CME)与 CF Benchmarks 合作推出了两个新的加密货币追踪指数,旨在为机构投资者提供更清晰的加密货币市场可见性,协助投资组合经理进行绩效衡量和风险管理。 (Crypto Briefing)
Techub Newsのニュースによると、AI企業Nace AIがDrex 1.5意思決定モデルをオープンソース化しました。このモデルは90億のパラメータを持ち、エージェントとバックエンドワークフロー向けに設計されており、その中核機能は状態と問題を読み取り、事前設定されたオプションに対して確率スコアを出力することです。テキストを生成するのではありません。 公開されたDecision Index 0.3.1ベンチマークテストでは、Drex 1.5は58.08点を獲得し、パラメータが100億未満のモデルの中で第一位にランクされ、その性能はクローズドソースモデルJev 1.13.0(57.96点)と同等です。モデルは長文書(32Kから128Kトークン)の処理において優れた性能を発揮し、精度は93.4%です。 モデルの重みはHugging Faceで公開されており、開発者はPython、llama.cpp、Ollama、またはOpenRouterなどのホスティングサービスを通じてデプロイできます。(MarkTechPost)
Techub News のニュースによると、Microsoft はルーティング、分類、検証、エージェント制御のための意思決定モデル Microsoft-Decision-1 をリリースしました。このモデルは、阿里巴巴の Qwen3.5-9B を基にファインチューニングされ、テキストを生成するのではなく、各固定オプションの較正された確率を返すことで意思決定スコアを算出します。現在、Microsoft Foundry と OpenRouter プラットフォームで利用可能です。 Microsoft は、147,137 の質問を含む 36 のベンチマークテストで 9 つのシステムを比較し、Microsoft-Decision-1 が 83.5% の平均精度でリードしました。その p50 レイテンシは 85 ミリ秒で、GPT-6 Sol よりも 35 倍高速です。このモデルは、はい/いいえ、多肢選択、評価、分類など、さまざまな形式をサポートし、出力は JSON 形式です。(MarkTechPost)
Techub News 消息,知名软件开发工具商 JetBrains 发布了 Mellum2.1,这是一个专为编程智能体和快速子智能体设计的开源模型。Mellum2.1 是一个 120 亿参数的混合专家思维模型,每令牌激活 25 亿参数,在 17 项基准测试中的 15 项上超越了其前代 Mellum2,并在 LiveCodeBench v6 等多项编程基准上领先于 Qwen3.5-9B。 该模型在 Apache 2.0 许可下发布于 Hugging Face,架构与 Mellum2 保持一致,主要升级来自在真实软件环境中进行的强化学习训练。这使得它成为一个可自托管的小型模型,能够探索代码仓库、编辑文件并检查自己的修改。 JetBrains 表示,该模型可在用户自己的 GPU 上通过 vLLM 或 SGLang 运行,速度测试基于 1 块 NVIDIA H200。其上下文长度为 131,072 个令牌,主要面向智能体工作、通用推理助手和私有自托管部署三种用途。(MarkTechPost)
Techub News 消息,NVIDIA 联合普林斯顿大学和马里兰大学的研究人员推出 PivotOPD,这是一种用于多轮大语言模型智能体的策略蒸馏方法。该方法训练智能体避免最具破坏性的早期错误,并在错误发生时进行恢复。在针对 13 个基线的测试中,该方法在 ALFWorld、WebShop 和基于搜索的 QA 任务上,为 Qwen3-1.7B 和 Qwen3-8B 学生模型取得了最佳平均成绩。研究结论是,恢复能力是可学习的,而标准策略蒸馏很少教授这一点。 该方法在 Qwen3-8B 学生模型上,能从 72.7% 的重放关键错误中恢复,而标准策略蒸馏的恢复率仅为 20.3%。该方法不增加推理成本,训练后的智能体可在其基础模型运行的任何地方运行。(MarkTechPost)
Techub News 消息,Anthropic 发布最新轻量级 AI 模型 Claude Haiku 5.5。该模型在 OSWorld 计算机使用测试中的得分从上一代的 15.7% 跃升至 72.4%,性能显著提升。同时,其调用价格下调幅度高达 90%,但新的分词器设计可能导致单任务消耗更多 Token,部分抵消了降价带来的节省。(The Decoder)
Techub News 消息,Google 发布了新的图像生成模型 Nano Banana 2.1。该模型基于 Gemini 3.6 Flash 构建,在部分基准测试中表现优于前代 Pro 模型,且成本更低。不过,在实践测试中,Pro 模型生成的图像质量有时更好。(The Decoder)
Techub News 消息,AI 初创公司 Reka 发布了全能推理模型 Rho-1 的研究预览版。该模型参数量为 190 亿,采用单一神经网络,能够理解并生成文本、图像和视频,进行跨模态推理,并输出机器人动作指令。Reka 将其定位为替代传统多模型协作的智能体流程。 Rho-1 的设计取消了不同模态模型间的任务交接,将文本、视觉和机器人动作统一在一个上下文窗口内处理为令牌。其架构包含理解与生成两个专家权重流,共享注意力机制。模型支持连续生成视频,并能根据新指令在生成过程中实时调整状态。 在速度方面,基础模型生成视频的速度中位数为实时速度的 0.79 倍,可观看的视频流大约在 6 秒后开始。Reka 还提供了一个蒸馏变体,将去噪步骤从 99 步减少到 8 步,能在约 1 秒内返回一个 5.3 秒的视频片段。(MarkTechPost)
Techub News 消息,来自 PhAI Labs、香港中文大学、复旦大学、斯坦福大学、牛津大学和普林斯顿大学的研究人员发布了 JEPA-Anything,这是一个领域无关的世界模型构建框架。该框架采用一种名为正交预测因子分解(OPF)的方法,扩展了联合嵌入预测架构(JEPA),可将同一套学习方案应用于视觉、生物学、临床轨迹、控制、分子动力学、物理场和天气等七个截然不同的领域。 研究团队在多个基准测试中验证了该框架的有效性。在单细胞数据分析、临床事件预测、分子动力学模拟以及物理场和天气预测等任务上,JEPA-Anything 均取得了优于或匹配现有专用模型的性能。例如,在分子动力学 100 步模拟中,其对水、石英、扑热息痛和苯等物质的预测误差最低。(MarkTechPost)
Techub News 消息,AI 初创公司 Reflection AI 宣布推出开源编程模型 Beam,其参数规模达 5010 亿。Reflection 表示,Beam 在高级推理基准测试中的表现与 Z.AI 的 GLM-5.2 模型相当。Beam 专为编程与 AI 代理任务设计,目前可在其官网下载使用。该公司此前已获得 NVIDIA 的投资。(Tech in Asia)