Techub News 消息,DeepSeek AI 发布了 DeepSeek-V4.1-Flash 模型。该模型为多模态混合专家模型,拥有 5520 亿骨干参数和 1960 亿额外记忆参数,上下文窗口扩展至 100 万 token。其核心优化在于将全局 KV 缓存占用降至每 token 890 字节,约为 V4-Flash 的四分之一。 模型采用因果编码器-解码器架构,将预填充计算量减少近半。同时引入压缩稀疏注意力 2 代技术,并采用 FP4 量化 KV 缓存,进一步降低了存储需求。模型权重已在 Hugging Face 上以 MIT 许可证开源,并提供公开 API。 研究团队表示,该模型在保持与 DeepSeek-V4-Pro-Base 相当的世界知识和编码能力的同时,仅使用了后者三分之一的总体参数和四分之一的激活参数。单 token 解码的计算量在上下文从 4K 增长到 100 万时仅增加四分之一。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,DeepSeek AI 发布了 DeepSeek-V4.1-Flash 模型。该模型为多模态混合专家模型,拥有 5520 亿骨干参数和 1960 亿额外记忆参数,上下文窗口扩展至 100 万 token。其核心优化在于将全局 KV 缓存占用降至每 token 890 字节,约为 V4-Flash 的四分之一。 模型采用因果编码器-解码器架构,将预填充计算量减少近半。同时引入压缩稀疏注意力 2 代技术,并采用 FP4 量化 KV 缓存,进一步降低了存储需求。模型权重已在 Hugging Face 上以 MIT 许可证开源,并提供公开 API。 研究团队表示,该模型在保持与 DeepSeek-V4-Pro-Base 相当的世界知识和编码能力的同时,仅使用了后者三分之一的总体参数和四分之一的激活参数。单 token 解码的计算量在上下文从 4K 增长到 100 万时仅增加四分之一。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Microsoft AI CEO Mustafa Suleyman(穆斯塔法·苏莱曼):AI将创造无限丰饶,但我们必须学会“遏制”本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。