本博客日IP超过2000,PV 3000 左右,急需赞助商。
极客时间所有课程通过我的二维码购买后返现24元微信红包,请加博主新的微信号:xttblog2,之前的微信号好友位已满,备注:返现
受密码保护的文章请关注“业余草”公众号,回复关键字“0”获得密码
所有面试题(java、前端、数据库、springboot等)一网打尽,请关注文末小程序
【腾讯云】1核2G5M轻量应用服务器50元首年,高性价比,助您轻松上云
最近我看到有老外说,Opus 5.5 和 GPT 6.1 Sol 的价格下降,完全是因为这两家公司偷偷使用了 DeepSeek 的开源成果。
由此可以看出 DeepSeek 确实在性价比上有一些创新的,但这类创新也有一些负面影响,即同一个 DeepSeek,有时会灵时不灵,字节 Seed 团队为此还专门写了一篇论文,揭开其中“性能漂移”的原因。
字节 Seed 团队发现,同一段资料这次提问它能精准引用,换个问法、或者对话再长一点,DeepSeek 就可能会出现“失忆”;上下文稍微拉长,回答质量就开始飘忽不定,甚至莫名“抽风”。
起初,研究人员把锅甩给了“模型幻觉”或者“服务不稳定”。但在今年 9 月底,字节跳动 Seed 团队在预印本平台 arXiv 上提交了一篇论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》(周期性弱点:来自分块 KV 缓存压缩的相位敏感性),直指这一现象背后的技术根因。所以,接下来,本篇文章就围绕这个“性能漂移”到底是什么、它是怎么被发现的、影响有多大、根因是什么,以及对我们普通用户意味着什么展开讨论。
什么是性能漂移?
传统意义上的“模型漂移(Model Drift)”,指的是模型部署后由于真实数据分布变化,性能随时间逐渐下降。但这并不是本次 DeepSeek 问题的全貌。
字节 Seed 团队发现的是一种“位置依赖的性能漂移”,即不是模型变笨了,而是信息站错了“位置”。
要理解它,得先知道一个背景。为了让大模型处理更长的上下文,业界普遍采用 “KV 缓存压缩”技术,即把历史对话中 Key-Value 缓存按固定步幅、分块地压缩成更少的条目,从而降低长上下文推理的内存和注意力计算成本。DeepSeek 正是这一技术路线的重要实践者。
但这类技术的问题在于,分块压缩在压缩窗口边界上,给每个 Token 引入了一个全新的坐标“相位(Phase)”,即 Token 相对于压缩窗口边界的位置。
团队发现,采用这类压缩的模型存在一种系统性的不对称,同样的信息,落在压缩窗口的某些位置时很容易被检索到;一旦落在另一些位置,就会变得异常困难。他们把这种检索性能随相位周期变化的现象称为“相位敏感性(Phase Sensitivity)”。
说白了,信息本身没变,模型也没“变笨”,只是信息在长上下文里所处的“相位”不同,被“看见”的概率就截然不同。这就是网友体感上“时灵时不灵”的性能漂移。
这个问题是怎么被发现的?
这个现象发现的关键,在于评估方法。
常规的长上下文基准测试,往往把所有测试样本混在一起算一个平均分。平均分看起来很漂亮,但相位敏感性恰好是一种周期性、位置性的缺陷,它只在特定相位上发作。于是平均分被大量“正常相位”的样本稀释,周期性弱点就这样被悄悄掩盖了。
为了验证这不是个别模型的偶然现象,Seed 团队做了两件事。
第一,横向评估真实模型。他们对基础版和后训练版的 DeepSeek-V4-Flash、DeepSeek-V4-Pro,以及后训练后的 DeepSeek-V4.1-Flash 进行了系统评估。 结果显示,在这些采用分块 KV 缓存压缩的大型开放权重模型上,长上下文检索准确度在不同相位之间最多可相差 40 个百分点。
第二,纵向做机制归因。团队从零开始预训练了一族 Transformer,在多种 KV 压缩设计下都复现了相位敏感性,排除了“只是某个模型没训好”的可能;随后通过因果干预的机制分析,进一步发现不同注意力组件对不同源相位的信息检索贡献是不对称的。即模型内部发生了相位专门化(Phase Specialization)。他们还构建了理想化检索模型进行理论分析,发现梯度流的动力学特性天然倾向于让模型形成这种尖锐的相位专门化。也就是说,相位敏感性某种程度上是训练过程的“内生偏好”,而非纯粹工程实现失误。
正因如此,团队在论文中给出了一个方法论上的重要结论,评估采用分块 KV 缓存压缩的模型,必须跨压缩相位分别测量,高平均分与系统性的位置失效,完全可以同时存在。
影响有多大?
这个发现的杀伤力在于“隐蔽”,那它的影响有多大呢?
40 个百分点的相位间差距,意味着模型的长上下文能力并非一条平稳的曲线,而是一片布满周期性“暗礁”的水域。暗礁所在的位置由压缩窗口边界决定,随输入长度周期性出现。如果你的 prompt 恰好把关键信息放在了“弱相位”,模型就会系统性地漏掉它,不是随机出错,而是稳定地出错。
这对下游应用的影响也是实打实的。
- RAG(检索增强生成):喂给模型的资料长度不一,关键证据落在弱相位的概率客观存在,检索链路越长,踩中弱点的环节越多;
- 长文档问答/合同审阅:几万字的材料里,某一段恰好“被看不见”,得出的结论可能南辕北辙;
- 代码补全与长程依赖分析:依赖关系一旦落在周期性弱点上,模型会”忘记”前文定义过的变量、接口与约束;
- Agent 长任务:多轮工具调用、多步骤推理对上下文的稳定性要求极高,相位漂移会被逐步放大。
更值得行业警惕的是,相位敏感性并非 DeepSeek 一家的问题,而是所有采用分块 KV 缓存压缩路线模型的共性风险。这篇论文的价值,恰恰在于把一类可能被普遍忽视、却被平均分掩盖的系统性缺陷摆上了台面。
为什么会漂移?
文章配图参见我的公众号文章:https://mp.weixin.qq.com/s/DjZ5U0pEsbvIru3RQlIPVQ。
综合来看,成因可以概括为以下三层。
- 工程动因:压缩换成本。长上下文推理的显存和算力开销巨大,分块 KV 缓存压缩是控制成本的关键手段。这是全行业在效率压力下的理性选择,DeepSeek 正是凭借极致的效率优化著称。
- 结构后果:压缩引入了“相位”这个新坐标。Token 不再只由绝对位置决定,还由它相对压缩窗口边界的位置决定。位置编码体系没有为这个新坐标做过专门的设计与对齐,检索能力在相位维度上自然分布不均。
- 训练内因:梯度动力学偏好尖锐的相位专门化。机制分析与理想化模型研究共同表明,训练过程中不同注意力头会“分工”负责不同相位,且梯度流倾向于把这种分工推向尖锐化。这解释了为什么后训练、换模型版本都难以根治——相位专门化在预训练阶段就已埋下种子。
说白了,就是“省显存”的压缩方案,在位置维度上制造了一个没被训练好的盲区,而训练动力学又把这个盲区固化成了周期性弱点。
对我们日常使用有什么影响?
相位敏感性听起来很学术,但对日常使用的影响是具体的。
因此,在使用过程中有以下建议。
- 长对话别硬撑,该分段就分段。超过几十轮的对话,关键结论及时落盘存档,不要指望模型在所有相位上都能稳定记住全部历史。
- 重要信息“多放几遍、换个位置”。既然弱点是周期性的,同一个关键约束条件在 prompt 的不同位置重复出现(开头、中间、结尾各一次),可以显著提高被检索到的概率,这是目前最朴素的“避坑”技巧。
- 警惕平均分幻觉。看模型跑分时要留意评测是否覆盖了不同上下文长度、不同信息位置的细分指标。只报平均分的榜单,可能正在掩盖周期性弱点。
- 关键任务做交叉验证。涉及法律、医疗、财务等高风险场景,长上下文材料的结论务必人工复核,或用多个模型交叉验证,不要把“找到了引用”当作“引用正确”的充分条件。
- 关注模型更新说明。对开发者而言,这篇论文实际上指明了优化方向:为压缩相位设计感知机制、在训练中加入相位对齐目标、以及在评估协议中强制跨相位测量。对用户而言,后续版本更新若提到“长上下文稳定性优化”,大概率就是在补这块短板。
结语
DeepSeek 的这次“性能漂移”风波,本质上是大模型行业一个缩影,在效率与能力的天平上,每一次激进的成本优化,都可能在看不见的维度留下新的欠账。
字节 Seed 团队的这项工作,可贵之处不在于“揭短”,而在于提供了一套可复现、可测量、可归因的方法论,从零预训练复现现象、因果干预定位机制、理想化模型解释成因,最后落到“跨相位评估”的评测规范。它提醒我们,当基准分数越来越高时,真正决定模型可用性的,往往是这些藏在平均分之下的周期性暗礁。
期待 DeepSeek V4.2 或者是 V5 等下一个或下一代模型,能更好的解决这类问题,有更多的突破吧!

最后,欢迎关注我的个人微信公众号:业余草(yyucao)!可加作者微信号:xttblog2。备注:“1”,添加博主微信拉你进微信群。备注错误不会同意好友申请。再次感谢您的关注!后续有精彩内容会第一时间发给您!原创文章投稿请发送至532009913@qq.com邮箱。商务合作也可添加作者微信进行联系!
本文原文出处:业余草: » DeepSeek V4 掉链子?字节发现 DeepSeek 存在性能漂移