Today for AI

IT之家 · 智能时代 · 2026/10/9 08:49:58

字节 Seed 揭示 DeepSeek 长上下文性能漂移:分块 KV 缓存压缩致相位敏感性,检索准确率波动达 40%

出处作者 / 发布主体:IT之家
78AI 研判分
核心综述

字节跳动 Seed 团队在 arXiv 发表论文指出,DeepSeek 模型采用的分块 KV 缓存压缩技术引入了“相位敏感性”,导致长上下文检索性能出现周期性漂移。研究发现,相同信息在不同相位下的检索难度存在系统性不对称,大型开放权重模型的检索准确度波动幅度高达 40 个百分点,揭示了平均基准分数掩盖的周期性弱点。

报道全文原始报道全文

10 月 9 日消息,字节 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,谈到分块 KV 缓存压缩带来的相位敏感性,直指 DeepSeek“抽风”原因。

字节 Seed 团队发现 DeepSeek“抽风”原因,长上下文可能性能漂移

该研究评估了基础版和后训练版的 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro,以及后训练后的 DeepSeek-V4.1-Flash。

模型通过分块 KV 缓存压缩以固定步幅将连续标记的窗口压缩为更少的缓存条目,能够减少长上下文推理的内存和注意力成本。

然而,这种压缩还引入了一个新的位置坐标:Token 的相位,或其相对于压缩窗口边界的位置。

字节 Seed 团队发现 DeepSeek“抽风”原因,长上下文可能性能漂移

该团队发现使用这种压缩的模型中存在系统性不对称性:相同的信息在一个阶段很容易检索,但在另一个阶段很难检索。团队将这种检索性能的周期性变化称为相位敏感性(phase sensitivity)。

在采用此类压缩的大型开放权重模型中,长上下文检索准确度在各个阶段之间可能相差高达 40 个百分点,从而揭示了平均基准分数可能掩盖的周期性弱点。

字节 Seed 团队发现 DeepSeek“抽风”原因,长上下文可能性能漂移

IT之家附论文链接: