QR コードでダウンロード
「Quantization」の検索結果:全10件
Techub News 消息,安全公司 Cantina Security 与 Yeta Labs 联合发布 apex-flash-1,这是一个专门为漏洞研究训练的开源权重模型。该模型基于 Z.ai 的 GLM-5.3-Flash 进行强化学习微调,采用 MIT 许可证在 Hugging Face 上发布。 在 Cantina 的内部基准测试中,该模型在处理 60 项测试任务时,成功解决了 40 项(通过率 66.7%),成本约 2.38 美元。相比之下,Claude Opus 5 High 解决了 43 项任务(通过率 71.7%),成本约 74.68 美元,约为 apex-flash-1 成本的 31 倍。模型采用 BF16 格式时约需 640 GB GPU 显存。(MarkTechPost)
Techub News 消息,网络安全公司 Aikido Security 发布其首个开源权重安全模型 Altar-1。该模型是基于 Z.AI 的 GLM-5.3 模型压缩而成,旨在运行于客户控制的本地基础设施中,为其自主渗透测试设备 Aikido Machine 提供支持。 Altar-1 通过量化和专家剪枝两步压缩技术,将模型体积从原始 BF16 格式的 1,506.7 GB 减小至 328 GB,比其 AWQ INT4 父模型小 32.8%。模型权重已在 Hugging Face 上公开,可在配备 4 块 NVIDIA H200 GPU 的单节点上通过 vLLM 部署。 Aikido 团队在内部 CVE 基准测试中评估了 Altar-1,其平均召回率为 60.4%,覆盖了 32 个已知漏洞中的 23 个。该公司表示,Altar-1 已在一次客户生产环境渗透测试中发现了一个有效的严重级别漏洞。(MarkTechPost)
Techub News 消息,Black Forest Labs(BFL)发布了开源机器人 AI 模型 FLUX 3 Action。这是一个拥有 70 亿参数的开源世界动作模型,用于机器人控制。该模型在 RoboLab-120 基准测试中以 42.92% 的任务成功率排名第一,领先于英伟达的 Cosmos 3 Nano 模型。 FLUX 3 Action 基于多模态模型 FLUX 3 构建,通过预测未来视频帧和机器人动作序列来控制机器人。它提供了三种不同速度与性能权衡的检查点,其中经过指导蒸馏的版本在保持高性能的同时,推理速度比基础版本快 1.8 至 2 倍。 该模型采用 FLUX Kommunity 许可证,允许非商业使用。在硬件部署方面,其 DROID 策略在 H200 GPU 上以 BF16 精度运行需要约 32 GB 显存,通过 FP8 量化和文本编码器卸载可适配 24 GB 显存的显卡。(MarkTechPost)
Techub News 消息,阿里巴巴旗下通义千问团队发布 Qwen-Image-2.1,这是一个统一的文生图与图像编辑模型。其视觉生成组件包含 70 亿参数,一个检查点即可覆盖文生图、多参考图编辑、局部编辑及透明 RGBA 输出等功能。 该模型已支持 Diffusers、ComfyUI、vLLM-Omni 等框架用于研究与评估,商业部署需单独向通义千问申请许可。模型默认支持 2K 分辨率,并具备原生透明图像生成与多参考图编辑能力。 根据通义千问团队在其内部基准 Qwen-Image-Bench 上的测试,Qwen-Image-2.1 综合得分为 60.28,高于其他已列出的开源权重模型。(MarkTechPost)
Techub News 消息,AI 模型公司 PrismML 发布 Ternary Bonsai 2 27B 模型。该模型是 Qwen3.8 27B 的三元权重版本,体积仅 5.93 GB(FP16 版本为 53.80 GB),在 20 项基准测试中平均性能保留率达 98.2%。模型支持文本与图像输入,上下文长度达 262K token,并可在 RTX 5090 等消费级硬件上运行。 模型采用 Apache 2.0 许可,权重已开源。其架构与 Qwen3.8 27B 保持一致,参数总量 27.36B,其中语言主干 24.35B,嵌入层与语言模型头 2.54B,视觉模块 0.47B。模型使用三元量化技术,绝大多数权重仅取 -1、0、+1 三个值,配合共享的 FP16 缩放因子,实现高压缩比。 性能评估显示,模型在数学与代码任务上保留率超 99%,但在长程智能体任务(如 Terminal-Bench 2.1)上性能下降较明显。实测中,RTX 5090 解码速度达每秒 142.5 token,RTX 4090 为 96.7 token/s,苹果 M5 Max 笔记本为 46.8 token/s。(MarkTechPost)
Techub News 消息,Nunchux AI 发布 VC-Attention,一种无需训练的低比特注意力内核,专为视频扩散 Transformer 设计。它同时解决值量化误差和 softmax 阶段缓慢两个问题,通过 V-Smooth 处理值异常值和 ExpCast-FP8 优化 softmax 瓶颈。 在 B200、H200、RTX 5090 等 GPU 上的测试显示,该内核能实现 1.13 倍至 1.70 倍的端到端加速,注意力计算速度提升最高达 3.58 倍。在 Wan2.2 等开源视频生成模型上,其保真度优于 SageAttention2 等先前方法。(MarkTechPost)
Techub News 消息,DeepSeek AI 发布了 DeepSeek-V4.1-Flash 模型。该模型为多模态混合专家模型,拥有 5520 亿骨干参数和 1960 亿额外记忆参数,上下文窗口扩展至 100 万 token。其核心优化在于将全局 KV 缓存占用降至每 token 890 字节,约为 V4-Flash 的四分之一。 模型采用因果编码器-解码器架构,将预填充计算量减少近半。同时引入压缩稀疏注意力 2 代技术,并采用 FP4 量化 KV 缓存,进一步降低了存储需求。模型权重已在 Hugging Face 上以 MIT 许可证开源,并提供公开 API。 研究团队表示,该模型在保持与 DeepSeek-V4-Pro-Base 相当的世界知识和编码能力的同时,仅使用了后者三分之一的总体参数和四分之一的激活参数。单 token 解码的计算量在上下文从 4K 增长到 100 万时仅增加四分之一。(MarkTechPost)
Techub News 消息,MBZUAI旗下基础模型研究所(IFM)发布了K2 Horizon系列开源模型,包含六款参数规模从0.9B到375B的模型,均采用Apache 2.0许可。该系列模型共享核心架构、训练方法和部署工具,预训练数据约20万亿token,其中包含大量合成任务与问题解决轨迹。IFM称这是AI史上最大规模的全开源模型发布。 该系列模型已在Hugging Face上提供,支持vLLM、SGLang和Ollama等推理框架,并可在NVIDIA、AMD和Cerebras硬件上运行。IFM还引入了MoVA注意力机制和名为Uno的LoRA适配器,后者据称可实现约3倍的无损解码加速。(MarkTechPost)
Techub News 消息,AI 研究机构 Nous Research 为其开源智能体 Hermes Desktop 新增一键本地模型设置功能。该功能可自动读取用户硬件配置,选择适配的模型并下载权重,同时配置推理运行时环境,简化了本地运行开源模型的流程。 Hermes Desktop 基于 MIT 许可证免费提供,支持 macOS 12+、Windows 10/11 及 Linux 系统,无需账户即可运行本地模型。其内置的模型目录会针对用户具体硬件进行适配性评估,并以绿、黄、红三色标识运行可行性,确保所选模型能在给定硬件上以至少 64K 的上下文窗口运行。(MarkTechPost)
Techub News 消息,Multiverse Computing 研究人员开发新技术,将 GPT-OSS 模型从 1200 亿参数压缩至 600 亿参数,压缩版在九项测试中的七项上超越完整版性能。 该技术名为 Quantization-Aware Healing,使压缩模型直接从原始版本学习而非中间版本。研究团队称,此方法可在保持性能的同时,显著降低 AI 模型运行所需的内存、电力及计算资源。(CryptoBriefing)
現在の検索結果をすべて読み込みました