掃碼下載
搜索“Sandboxes”共有8條相關結果
Techub News 消息,知名软件开发工具商 JetBrains 发布了 Mellum2.1,这是一个专为编程智能体和快速子智能体设计的开源模型。Mellum2.1 是一个 120 亿参数的混合专家思维模型,每令牌激活 25 亿参数,在 17 项基准测试中的 15 项上超越了其前代 Mellum2,并在 LiveCodeBench v6 等多项编程基准上领先于 Qwen3.5-9B。 该模型在 Apache 2.0 许可下发布于 Hugging Face,架构与 Mellum2 保持一致,主要升级来自在真实软件环境中进行的强化学习训练。这使得它成为一个可自托管的小型模型,能够探索代码仓库、编辑文件并检查自己的修改。 JetBrains 表示,该模型可在用户自己的 GPU 上通过 vLLM 或 SGLang 运行,速度测试基于 1 块 NVIDIA H200。其上下文长度为 131,072 个令牌,主要面向智能体工作、通用推理助手和私有自托管部署三种用途。(MarkTechPost)
Techub News 消息,以太坊联合创始人 Vitalik Buterin 在新加坡的 OKX NOW 活动上表示,AI 正开始展现出强大的黑客能力,包括逃逸沙箱、攻击网站以及发现软件漏洞。 同时,AI 也在帮助以太坊在协议层和应用层识别漏洞并进行形式化验证,从而提升资产安全与数据隐私。他认为,更高层级的安全防护将变得至关重要,因为 AI 可能发现系统中的任何可利用漏洞。(@WuBlockchain)
Techub News 消息,AI 初创公司 Reflection AI 推出其首个开源模型 Beam。该模型为稀疏混合专家模型,总参数量达 5010 亿,每 Token 激活参数为 230 亿,专为编程、推理和 AI 代理任务设计。Reflection AI 团队表示,Beam 在推理基准测试中,性能可与 GLM 5.2 等大型开源模型竞争,但推理计算量减少 3 至 4 倍。 Beam 已完成预训练,目前处于最终红队测试阶段,尚未开放自托管,早期访问需通过 Reflection 平台等待名单申请。该模型预训练使用了 23.8 万亿 Token 的数据集,并在 6144 块 NVIDIA GB300 NVL72 GPU 上耗时不到四周完成。Reflection AI 称其数据筛选过程去除了约 95% 的原始互联网 Token,同时保留了约 1.8 万亿个高质量 Token。(MarkTechPost)
Techub News 消息,AI 基础设施公司 Prime Intellect 推出 Prime Inference 推理服务平台,为前沿开源模型提供无服务器端点和预留容量服务。该平台运行在 Prime Intellect 自有的多数据中心 GPU 集群上,在公开发布前内部每日处理近万亿个 Token。 Prime Inference 是 Prime Intellect 开放训练堆栈的推理层,支持 OpenAI 兼容的 API。其堆栈结合了 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer 等技术,旨在优化智能体工作负载,并报告其 GLM-5.3 端点在 OpenRouter 上速度领先,工具调用错误率接近零,自推出以来保持 100% 的正常运行时间。 平台提供两种服务模式:无服务器端点用于可变需求,预留容量用于持续工作负载。硬件目前采用 NVIDIA Blackwell,未来将支持 Vera Rubin。团队级统一账单和用量跟踪已上线,但具体按模型定价尚未完全公布。(MarkTechPost)
Techub News 消息,H Company 发布 Holo4 系列通用计算机使用模型,专为 AI 代理设计。该模型能够点击、键入屏幕、编写代码以及调用 MCP 或 API 工具。Holo4 提供 27B(密集)和 35B-A3B(专家混合,3B 激活)两种尺寸,均支持 256K 上下文,可通过 H Models API 使用。 其中,Holo4 35B-A3B 以 Apache 2.0 许可开源权重,支持商业自托管;Holo4 27B 权重为 CC BY-NC 4.0 许可,商业使用需通过 API。该模型旨在弥合仅 GUI 或仅 API 代理的局限性,可在桌面、网页、Android、代码沙箱和商业 API 等平台上运行。 根据 H Company 公布的基准测试,Holo4 27B 在 OSWorld 基准上达到 85.2% 准确率,每次任务成本 0.08 美元。在 AndroidWorld 上达到 85.1%。Holo4 27B 的 API 定价为每百万令牌输入 0.40 美元,输出 3.00 美元。(MarkTechPost)
Techub News 消息,加州大学伯克利分校的研究团队发布了 CUA-Lite,这是一个用于计算机使用代理(CUA)的开源平台。该平台将代理、环境、轨迹以及评估和训练框架整合在一个统一的操作空间、数据模式和命令下,覆盖桌面、浏览器和移动端。其轻量级沙箱可在任何 Docker 主机上运行,无需 /dev/kvm 支持。 平台的核心组件 Lite.OSWorld 在普通 Docker 容器中复现了 OSWorld 的任务套件和评估器,内存占用从 4.1 GB 降至 0.9 GB,并行实例数量增加约 4.6 倍,且评估分数与原始虚拟机版本一致。平台还包含 LiteSample 统一数据模式,并已将十余个现有 CUA 数据集预处理后发布在 Hugging Face 上。 该框架集成了 10 多个基于 GPT、Claude、Gemini 等模型的代理,以及 15 多个涵盖桌面、浏览器和移动端的基准测试。通过单一命令支持监督微调和强化学习训练,例如在 Lite.ScaleCUA 上微调 Qwen3-VL-2B-Instruct 模型,在 332 项任务的评估集上平均回合回报从 0.138 提升至 0.237。 (MarkTechPost)
Techub News 消息,据报道,OpenAI、Anthropic 和 Meta 的 AI 模型已突破其网络测试环境,并接触到了真实世界的系统。这一事件引发了 AI 实验室的讨论,即是否应给予网络安全测试沙箱互联网访问权限,以更好地评估和防范此类风险。(@Cointelegraph)
Techub News 消息,据 CryptoBriefing 报道,CoreWeave 发布 Sandboxes 平台,提供安全隔离环境支持 AI 模型通过实时交互进行强化学习,并与机器学习平台 Weights & Biases 合作提供无服务器部署选项,旨在提升 GPU 利用率并降低训练成本。 该公司前身为以太坊矿企 Atlantic Crypto,2019 年更名为 CoreWeave 后转型为 AI 云基础设施提供商,目前已在纳斯达克上市。此次发布进一步巩固其与英伟达在智能体推理工作负载方面的合作关系,标志着其从加密货币挖矿向 AI 计算服务的全面转型。
目前搜尋結果已載入完畢