据报道,字节跳动Seed团队近日发现,DeepSeek在处理长文本时的检索表现会受到缓存压缩方式影响:同样一条信息,放在不同位置,模型找到它的准确率最高可相差约40个百分点。相关论文已于9月底提交至arXiv。

研究覆盖DeepSeek V4 Flash、V4 Pro的基础版和后训练版,以及V4.1 Flash的后训练版。团队发现,模型对某些位置的信息检索较准确,对另一些位置则容易出错,而且这种差异会按固定间隔重复出现。

这一现象与模型节省计算资源的方式有关。DeepSeek采用分块KV缓存压缩,将连续的一段内容压缩成更少的缓存记录,以降低处理长文本时的内存和计算开销。但信息处于压缩块中的哪个位置,也会影响模型读取它的效果,形成周期性的性能弱点。

在约13万词元的长文本测试中,研究人员保持问题和目标信息不变,只移动信息的位置。V4 Flash基础版的检索准确率差距达到40.2个百分点。后训练后,这一差距缩小至19.1个百分点,V4.1 Flash则进一步降至6.1个百分点。

团队将这种现象称为“相位敏感性”。论文指出,单看平均测试成绩,可能看不出模型在哪些位置容易漏掉信息,因此长文本评测还应比较同一条信息放在不同位置时的检索表现。