Techub News 消息,字节跳动 Seed 团队研究发现,DeepSeek-V4 系列模型在处理长上下文时,其检索准确率会随着信息在输入中的位置呈现周期性波动,波动周期与模型采用的 KV Cache 压缩步长一致。研究人员在 128K 长上下文测试中发现,同一条信息仅因位置不同,DeepSeek-V4-Flash-Base 模型的检索准确率最大差距可达 40.2 个百分点。 团队将这种现象命名为「相位敏感性」,并指出其根源在于模型为节省内存而采用的分块 KV Cache 压缩技术。该技术导致模型内部的不同注意力组件对压缩窗口内的不同位置产生了偏好,形成「相位专门化」。后训练和架构迭代能显著缩小这种差距,但周期性差异依然存在。(量子位)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,字节跳动 Seed 团队研究发现,DeepSeek-V4 系列模型在处理长上下文时,其检索准确率会随着信息在输入中的位置呈现周期性波动,波动周期与模型采用的 KV Cache 压缩步长一致。研究人员在 128K 长上下文测试中发现,同一条信息仅因位置不同,DeepSeek-V4-Flash-Base 模型的检索准确率最大差距可达 40.2 个百分点。 团队将这种现象命名为「相位敏感性」,并指出其根源在于模型为节省内存而采用的分块 KV Cache 压缩技术。该技术导致模型内部的不同注意力组件对压缩窗口内的不同位置产生了偏好,形成「相位专门化」。后训练和架构迭代能显著缩小这种差距,但周期性差异依然存在。(量子位)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。