BT财经

境内金融信息服务备案编号:

【京金信备(2021)5号】

2026年10月11日

注册 / 登录

40个百分点的差距:AI模型为什么越长“抽风”

今天凌晨,字节跳动Seed团队的论文挂在arXiv上,标题很学术:“Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression”。但它描述的现象,所有用过大型语言模型处理长文档的人并不陌生——模型突然“抽风”了。

同一个信息,在某些情况下模型检索得清清楚楚,换个位置它就忘了。论文用实验数据给出了精确度量:长上下文检索准确率在“最佳相位”与“最差相位”之间,可相差高达40个百分点。

这不是玄学bug。这是当前AI行业为降低推理成本而广泛部署的一项优化技术,所带来的系统性代价。

什么是“相位敏感”?

要理解这个问题,先看大模型推理时的一个现实约束:内存。

当用户给模型输入长达数万甚至数十万字的上下文时——比如一份五百页的合同、一场长达数小时的录音转录文本——模型需要记住前面出现过的每一个Token(可以理解为词元,相当于字或词的最小单位)。这些记忆以KV Cache的形式驻留在显存里。

显存容量有限。为了容纳更长上下文,业界采用了一种叫分块KV缓存压缩的技术。它的基本原理是:把连续的Token窗口按固定步长切分成块,每块压缩成更少的KV条目。这就好比把一本厚书的每一页摘要压缩到半页纸——节省了空间,但丢失了一些细节精度。

问题在于,这种压缩方式引入了一种新的位置坐标:相位(phase)。简单说,每个Token相对于它所落入的压缩窗口边界的距离,就是它的相位。窗口内不同位置的Token,被压缩的方式和损耗程度各不相同。

字节团队发现,模型在不同相位下的检索能力存在系统性不对称——同样的信息,如果恰好落在“幸运相位”,检索几乎准确;如果落在“倒霉相位”,模型就像失忆了一样。

他们把这种现象命名为相位敏感性(phase sensitivity),形象地说,模型的性能会沿着输入序列周期性波动,像锯齿一样有高峰也有低谷。

谁被影响?

这篇论文的实验对象很明确:字节团队评估了基础版和后训练版的DeepSeek-V4-Flash和DeepSeek-V4-Pro,以及后训练后的DeepSeek-V4.1-Flash。

选择这些模型并非偶然。DeepSeek的V4系列是目前开放权重大模型中性能最受关注的产品之一,其分块KV缓存压缩策略直接决定了企业客户部署时的成本和效果。

论文数据显示,在长上下文场景中,同一信息的检索准确率会在不同的压缩相位之间剧烈波动,最高可达40个百分点。这意味着什么?假设你在第100个Token的位置询问一个在第5000个Token之前出现的关键事实——如果这个位置组合处于“最佳相位”,模型的回复准确率可能在90%以上;而如果处于“最差相位”,准确率可能骤降至50%以下。

对于RAG(检索增强生成)系统、长文档问答、法律合同审查这类依赖精确信息召回的应用场景,这种不确定性不是锦上添花的问题,而是直接影响产品可用性的硬伤。

更关键的是,论文作者指出,平均基准分数掩盖了这一缺陷。

目前的模型评测体系通常报告整体平均准确率。如果一个模型在某个基准测试中的平均检索准确率为75%,这个数字背后可能隐藏着极端的两极分化:有的地方近乎完美,有的地方形同废设。企业在部署前只看平均分数,很难提前感知这种周期性的盲点。

注意力组件也在“偏科”

论文的一个有趣发现是因果干预分析显示的不同注意力组件表现出“相位专业化(phase specialization)”现象。

通俗理解:模型的各层注意力机制在处理不同时相的信息时,表现出不均衡的“专长”。有些注意力头在特定时相格外敏锐,另一些则完全不在意。这种不均衡不是随机噪声,而是由梯度流动力学在训练过程中逐渐强化形成的结构性特征。

换言之,这不是一次性偏差,而是在预训练和后训练过程中被模型本身的学习动态固化下来的模式。

目前论文没有给出一种完美的架构修补方案。团队提出的核心建议是方法论层面的:评估采用分块KV缓存压缩的模型时,必须跨越不同压缩相位进行测量,不能仅看平均值。

行业的镜子

分块KV缓存压缩是当前开源大模型生态中极为常见的推理优化手段。它的核心价值在于减少长上下文推理时的显存占用和注意力计算开销——对中小企业而言,这意味着可以用更低成本的硬件运行更大的模型,降低了AI普惠的门槛。

字节团队的研究等于向全行业提出一个问题:你们现在使用的模型,在压缩优化的同时,是否也接受了这种随机的性能波动?

DeepSeek官方截至发稿尚未对此发表论文做出公开回应。其GitHub仓库(deepseek-ai)也未发布相关修复更新。

论文的价值不在于否定某一家公司,而在于揭示了当前行业通用方案的系统性脆弱——当所有人都使用类似的技术来压缩上下文成本时,整个行业可能都在经历同一种未知的性能衰减,只是各自发现的早晚不同。

接下来观察什么

这篇文章的价值不仅在于诊断,还在于提供了一把可供验证的标尺。未来几周内,以下几个观察指标将决定这一研究的实际影响力:

1。 其他开源模型是否复现相同结果——如果Phi、Llama、Qwen等系列同样存在显著的相位敏感性,说明这是分块压缩技术的共性问题,而非DeepSeek独有; 2。 业界是否有针对相位感知的新型KV缓存调度算法——比如根据Token相位分配不同的压缩策略,或在推理时主动避开最弱相位区域; 3。 评测基准的演进方向——主流基准是否会将跨相位测量纳入标准评估流程,推动模型厂商从“平均最优”转向“全局无盲区”; 4。 企业级部署的容错策略调整——关键业务场景是否会叠加额外的验证层来检测并规避周期性性能低谷。

40个百分点不是一个可以忽略的小数字。当AI从技术演示走向真实应用,那些藏在平均值背后的局部弱点,往往才是决定用户体验的真正变量。



版权声明:本文版权归BT财经所有,未经允许任何单位或个人不得转载,复制或以任何其他方式使用本文全部或部分,侵权必究。
帮助中心
联系我们
联系我们

 

商务合作:

 

公司地址

北京市丰台区汉威国际广场一区一号楼629

 

 

商务合作

周先生

Tel: +86-17743514315

Email: info@btimes.com.cn

官方微信公众号

北京领讯时代信息技术有限公司 | Copyright ©️ 2026 财经时报 版权所有 京ICP备19043396号-7

京公网安备 11010602007380号 | 境内金融信息服务备案编号:京金信备(2021)5号

网信算备110106674807801230011号


声明:未经授权,不得复制、转载或以其他方式使用本网站的内容。BT财经尽最大努力确保数据准确,但不保证数据绝对正确。