跳到文章正文
大模型 编辑推荐

字节团队找到大模型“抽风”的原因:长上下文会阶段性失忆

字节跳动 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,讨论的是分块 K…

字节跳动 Seed 团队今年 9 月底在预印本平台 arXiv 提交了一篇论文,讨论的是分块 KV 缓存压缩带来的“相位敏感性”,直指大模型长上下文时好时坏的原因。

研究评估了基础版和后训练版的 DeepSeek-V4-Flash、DeepSeek-V4-Pro,以及后训练后的 DeepSeek-V4.1-Flash。

所谓分块 KV 缓存压缩,是把连续 token 的窗口按固定步长压缩成更少的缓存条目,好处是能降低长上下文推理的内存和注意力开销。但压缩也引入了一个新的位置坐标——token 的“相位”,也就是它相对于压缩窗口边界的位置。

团队发现,使用这种压缩的模型存在系统性的不对称:同样的信息,在一段里很容易检索到,换到另一段却很难。他们把这种检索性能的周期性变化称作“相位敏感性”。

在最极端的情况下,采用这类压缩的大型开源模型,长上下文检索准确率在不同相位之间能相差多达 40 个百分点。这意味着一个好看的基准平均分,可能会掩盖某些阶段的明显短板。

本文地址:https://www.163264.com/16561