☰
DeepSeek 为什么会突然“抽风”?字节 Seed 找到了一个隐藏原因!
2026/10/12 2:46:38 网站建设 项目流程

📄 艾欧同学读论文系列:arxiv.org/abs/2609.36322

明明是同一段代码,只是在前面多加几个无关 Token,DeepSeek 的答案竟然会在正确和错误之间反复横跳?!

最近,字节 Seed 团队发表论文,揭示了大模型长上下文中的隐藏弱点——相位敏感性(Phase Sensitivity)。

🔍 为什么会这样?

为了节省显存和计算成本,模型会使用「分块 KV 缓存压缩」技术。

但这种压缩可能导致:同样的信息,只因位置不同,检索效果就大不一样!

📊 实验有多惊人?

🔹 DeepSeek-V4-Flash:出现 4-Token 周期性变化

🔹 DeepSeek-V4.1-Flash:出现 2-Token 周期性变化

🔹 在 128K 长上下文实验中,不同相位的检索准确率最大相差 40.2 个百分点!

🧠 背后的原因?

研究发现,模型内部可能存在「相位专门化」现象:不同注意力组件对不同位置的信息存在不同偏好。

💡 艾欧同学总结:

大模型的长文本能力,不仅取决于能记住多少信息,还可能取决于信息放在哪里。

所以,平均准确率高,不代表每个位置都可靠!

#DeepSeek #字节Seed #AI前沿 #大模型 #论文解读 #人工智能 #AI科普 #艾欧同学

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询