☰
Transformer 前置知识:先懂这两条思想线索
2026/9/29 21:49:58 网站建设 项目流程

1. 引言:先别急着看论文

很多人翻开 Transformer 论文,第一眼就被结构图劝退。其实 Transformer 本身并不难,难的是它站在太多前置知识的上游。

这篇文章先不讲完整结构,只带你理清两条最关键的思想线索:符号主义与解构主义。它们是理解 Transformer 的入口,也是后面所有概念的地基。

2. 符号主义:把词当符号的时代

人工智能早期有一派主流观点叫符号主义(Symbolicism),认为智能的本质是操作符号。在自然语言处理里,这种思路的表现就是:把每个词当作一个孤立的 ID,靠词典和规则来理解语言。

它的优点是可解释、可控,缺点是语言太复杂,规则永远写不完。更关键的问题在于:在符号层面,「猫」和「狗」毫无关系,机器无法感知它们是相似的动物。

这引出了第一个核心问题:语言需要一种能表达“相似性”的表示方式。

3. 解构主义:把句子拆成关系网

「解构主义」原是哲学概念,主张拆解看似稳定的整体,重新审视内部关系。这个视角用在语言上非常贴切:

  • 传统 RNN 把句子当作一条按顺序流过的整体,一个词接一个词地读;
  • Transformer 的思路则相反:把句子拆解成词与词之间成对的关系网,每个词都能和其他所有词建立联系。

所以理解 Transformer 的第一件事,就是放弃“整体记忆”——先学会把句子拆开,再让词与词重新建立关系。这正是“解构—重组”的思路。

4. 从符号到向量:让机器看见相似性

要表达“相似性”,就不能再用孤立的符号 ID,于是有了分布式表示:把每个词映射成一个高维连续向量。语义相近的词,向量距离也相近。

猫 -> [0.8, 0.6] 狗 -> [0.75, 0.55] 苹果 -> [0.1, -0.2]

「猫」和「狗」距离很近,「猫」和「苹果」则很远。记住这一点就够了:向量是深度学习世界里的通用货币,Transformer 内部流动的所有信息都是向量。

5. 自注意力:关系网的实现

有了向量,解构后的句子要如何重新组装?答案就是自注意力(Self-Attention)。

注意力可以这样理解:当我处理一个词时,先给其他所有词打分,再按分数高低决定“参考”它们多少。这三步最直观:

1. Query 和每个 Key 打分,得到相关度分数 2. 用 softmax 把分数归一化成权重 3. 按权重对所有 Value 加权求和

当 Query、Key、Value 都来自同一个句子时,就是自注意力。它的本质正是第 3 节说的“解构—重组”:每个词都去和其他词建立联系,再按重要程度融合信息。理解了这一步,Transformer 的大门就已经推开一半。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询