扫码下载
搜索“Arena”共有10条相关结果
Techub News 消息,AI 评估平台 Arena.ai 分析了 Claude 模型从 Fable 5 到 Fable 5.1 版本在数万条基准测试回答中的写作变化。分析发现,Fable 5.1 的写作风格更加直白、就事论事,但也变得更加冗长。其语言与前代相比,承载的“负荷”有所减轻。(The Decoder)
Techub News 消息,据主办方 LTP 消息,Liquidity Arena 2026 AI 量化交易大赛将于 9 月 9 日进入双赛道主赛阶段。赛事官方数据显示,目前已有百余支团队报名参赛,选手构成覆盖 AI 开发者、高校及研究机构,以及对冲基金、Prop Trading 团队、HFT 团队和专业交易员等。 此前的 Track A 第一阶段已经收官。官方统计,参赛 AI Agent 在该阶段累计完成超过 70,000 笔交易,最终 30 支团队晋级 Mainnet Duel Finals。 9 月 9 日起,两大赛道将并行展开角逐: Track A — Logic Frontier:30 支晋级团队进入决赛阶段,重点考察 AI Agent 的自主推理能力、市场信号解读及交易表现,并将通过 MCP 及 Reasoning Log 对交易决策过程进行验证。 Track B — Liquidity Pro:面向对冲基金、Prop Trading 团队、HFT 团队及专业交易员开放,评估维度聚焦策略收益、资本承载能力、执行质量及滑点控制等量化交易指标。值得注意的是,该赛道目前仍接受报名,截止时间为 9 月 23 日 23:59(GMT+8)。 奖励方面,本届赛事总奖励价值超过 30 万美元,其中包括 10 万美元以上现金奖励,以及 AI Token 激励、LTP VIP 交易及清算费权益、合作伙伴资源和职业发展机会等。 据悉,赛事由 LTP 机构级交易基础设施提供支持,AWS、Calais、MiniMax、SoSoValue、AIVIX、1 ndex by 1 Token、Amsterdam Investment Club 及 THEO QUANT 等为合作伙伴。
Techub News 消息,OpenAI 最新模型 GPT-6 Astra 在 Code Arena 的 WebDev 排行榜上以 1,797 分获得第一名,领先 Anthropic 的 Claude Fable 5.1 达 35 分。该模型于 2026 年 9 月 3 日发布,目前已向 ChatGPT 订阅用户及特定 API 和云合作伙伴开放。 Code Arena 采用众包 Elo 评分系统,通过社区投票评估模型处理真实前端编码任务的能力,目前已记录超 65 万张投票。与传统固定数据集测试不同,该基准侧重评估多步推理、工具使用和迭代编码工作流。GPT-6 Astra 和 Claude Fable 5.1 定价相同,均为每百万输入 token 10 美元、每百万输出 token 50 美元,上下文窗口均达 100 万 token。(CryptoBriefing)
Techub News 消息,据 Binance 公告,该平台本周在 Yield Arena 推出新一轮限时奖励活动,用户可通过 Simple Earn、以太坊 Staking、SOL Staking 及 Dual Investment 等产品参与。 活动包含 USDe 4% APR 奖励、USDT 灵活产品最高 7% APR 及 Dual Investment 最高 5888 美元奖励等,活动期限至 8 月底至 9 月初不等。
Techub News 消息,Google DeepMind 的 Gemini 3.7 Flash 在 Agent Arena 实时排行榜中上升至第 20 位,在基于 170 万用户会话的实时代理基准测试中取得了 3.4% 的分数提升。 Agent Arena 通过真实世界的工具编排和任务完成效果评估 AI 模型,主要追踪工具幻觉率和整体成功率等指标。与排名第 27 位的 Gemini 3.5 Flash 及第 34 位的 3.6 版本相比,3.7 版本展现出显著的代际进步。该模型在提升 token 效率的同时,增强了多模态代理性能,可跨文本、图像等多种数据类型执行工作流。目前 Gemini 3.7 Flash 尚未正式发布。(CryptoBriefing)
Techub News 消息,Y Combinator 孵化的初创公司 Design Arena 完成 800 万美元融资,旨在构建众包评估 AI 生成视觉内容的平台。该平台通过双盲对比机制让用户对 AI 生成的网页设计、图像及视频进行投票评分,目前积累超过 500 万用户,覆盖 140 多个国家。 与传统依赖 FID 分数或 CLIP 相似度等技术指标的评估方式不同,Design Arena 建立了基于真实人类主观偏好的 Elo 排名系统,为 OpenAI、Anthropic 等前沿实验室提供视觉领域的性能参考数据。这种将评估转化为轻度娱乐活动的模式,形成了具有地理和人口多样性的数据集,填补了 AI 视觉领域主观审美评估的空白。(CryptoBriefing)
Techub News 消息,Code Arena 于 4 月 15 日推出 Image-to-WebDev benchmark,评估 AI 模型将 UI 设计图转化为功能网页代码的能力,Claude Opus 5 (Max) 以 1703 分位居榜首。 该基准测试涵盖 Anthropic、OpenAI、xAI 等多家提供商的模型,主要评估 React 代码生成与多步骤推理能力。分析指出,此类工具的性能直接影响加密货币项目的产品开发效率,随着新模型持续加入,排名仍可能发生变化。(CryptoBriefing)
Techub News 消息,Arena.ai 新推图像编辑模型七项评测分类,OpenAI GPT Image 2 全类别居首,Elo 评分 1463 分,结果基于超 16.5 万次社区投票。 该平台获 2850 万张投票,涵盖 52 个模型。Meta、微软、Google 及字节跳动旗下模型亦在列。其曾于 2026 年 2 月推出文本生图类似分类。(CryptoBriefing)
Techub News 消息,Moonshot AI 开源模型 Kimi K3 在 Arena.ai 的 Frontend Code Arena 排行榜中登顶,超越 Anthropic 的 Claude 和 OpenAI 的 GPT 系列模型。 该模型采用混合专家(MoE)架构,拥有约 2.8 万亿参数,支持 100 万 token 的上下文窗口,可单次处理约 75 万字的代码或文档。Kimi K3 在七个评估子领域中的六个排名第一,API 定价为每百万输入 token 3 美元、输出 token 15 美元。Moonshot AI 计划于 7 月 27 日前发布完整模型权重,为去中心化 AI 项目提供无许可限制的最先进代码模型。(CryptoBriefing)
Techub News 消息,Meta 旗下 Muse Image 模型在 Arena.ai 的文本到图像排行榜中升至第二位,Elo 分数达 1280 分,仅次于 OpenAI 的 GPT Image 2。该排名基于 7715 张社区投票,显示其在 AI 生成媒体领域的竞争力。 该模型于 7 月 7 日由 Meta Superintelligence Labs 发布,具备自主工具使用和涌现式自我完善能力。除文本到图像外,其在单图和多图编辑领域也位列第二,配套模型 Muse Video 在文本到视频排行榜中排名第三。用户可通过 Meta AI 应用、Instagram Stories 及 WhatsApp 使用。(CryptoBriefing)