📄 艾欧同学读论文系列:arxiv.org/abs/2609.36322
明明是同一段代码,只是在前面多加几个无关 Token,DeepSeek 的答案竟然会在正确和错误之间反复横跳?!
最近,字节 Seed 团队发表论文,揭示了大模型长上下文中的隐藏弱点——相位敏感性(Phase Sensitivity)。
🔍 为什么会这样?
为了节省显存和计算成本,模型会使用「分块 KV 缓存压缩」技术。
但这种压缩可能导致:同样的信息,只因位置不同,检索效果就大不一样!
📊 实验有多惊人?
🔹 DeepSeek-V4-Flash:出现 4-Token 周期性变化
🔹 DeepSeek-V4.1-Flash:出现 2-Token 周期性变化
🔹 在 128K 长上下文实验中,不同相位的检索准确率最大相差 40.2 个百分点!
🧠 背后的原因?
研究发现,模型内部可能存在「相位专门化」现象:不同注意力组件对不同位置的信息存在不同偏好。
💡 艾欧同学总结:
大模型的长文本能力,不仅取决于能记住多少信息,还可能取决于信息放在哪里。
所以,平均准确率高,不代表每个位置都可靠!
#DeepSeek #字节Seed #AI前沿 #大模型 #论文解读 #人工智能 #AI科普 #艾欧同学