掃碼下載
搜索“Sparse Attention”共有4條相關結果
Techub News 消息,DeepSeek AI 发布了 DeepSeek-V4.1-Flash 模型。该模型为多模态混合专家模型,拥有 5520 亿骨干参数和 1960 亿额外记忆参数,上下文窗口扩展至 100 万 token。其核心优化在于将全局 KV 缓存占用降至每 token 890 字节,约为 V4-Flash 的四分之一。 模型采用因果编码器-解码器架构,将预填充计算量减少近半。同时引入压缩稀疏注意力 2 代技术,并采用 FP4 量化 KV 缓存,进一步降低了存储需求。模型权重已在 Hugging Face 上以 MIT 许可证开源,并提供公开 API。 研究团队表示,该模型在保持与 DeepSeek-V4-Pro-Base 相当的世界知识和编码能力的同时,仅使用了后者三分之一的总体参数和四分之一的激活参数。单 token 解码的计算量在上下文从 4K 增长到 100 万时仅增加四分之一。(MarkTechPost)
Techub News 消息,MBZUAI旗下基础模型研究所(IFM)发布了K2 Horizon系列开源模型,包含六款参数规模从0.9B到375B的模型,均采用Apache 2.0许可。该系列模型共享核心架构、训练方法和部署工具,预训练数据约20万亿token,其中包含大量合成任务与问题解决轨迹。IFM称这是AI史上最大规模的全开源模型发布。 该系列模型已在Hugging Face上提供,支持vLLM、SGLang和Ollama等推理框架,并可在NVIDIA、AMD和Cerebras硬件上运行。IFM还引入了MoVA注意力机制和名为Uno的LoRA适配器,后者据称可实现约3倍的无损解码加速。(MarkTechPost)
Techub News 消息,Z.ai 发布了 GLM-5.3-Flash,这是 GLM-5 系列中首个原生多模态模型,也是该实验室推出的最具性价比的编程模型。它是一个混合专家模型,总参数量为 3200 亿,每个令牌激活 180 亿参数,上下文窗口达 1,048,576 个令牌,并支持图像和视频输入。该模型以 MIT 许可证发布,权重已上传至 Hugging Face。 Z.ai 报告称,该模型在基准测试和实际工作负载中均优于 GLM-5.2,价格约为其十分之一,并在其内部编程基准测试中与 Claude Opus 4.8 的差距在半个百分点以内。模型的首周预览以“Ox Alpha”匿名身份在 OpenCode 和 OpenRouter 上运行,完全基于国产中国 AI 芯片提供服务。 该模型可在 Hugging Face 上获取权重,并已提供托管 API 服务。默认 FP8 检查点权重约为 306 GiB,当前 vLLM 路径仅支持 NVIDIA Hopper 及更新架构,这意味着中型和大型组织或租用 GPU 容量的 AI 原生初创公司可自行托管。 (MarkTechPost)
Techub News 消息,据 CryptoBriefing 报道,上海 AI 公司 MiniMax 预告其下一代 M3 模型,采用 MiniMax Sparse Attention(MSA)架构,处理百万 token 上下文时解码速度较 M2 提升 15.6 倍,预填充速度提升 9.7 倍,同时保持输出质量。 该公司由腾讯、阿里和米哈游投资,2026 年 1 月上市。技术报告显示,M3 基于 GQA 驱动动态块选择技术,可智能筛选数据块以降低计算量。分析指出,该架构若开源,有望提升去中心化推理网络效率,为加密原生 AI 应用提供支持。
目前搜尋結果已載入完畢