☰
[智能体-272]:词向量 vs 文本向量 对比详解
2026/10/10 3:56:07 网站建设 项目流程

一、核心定义

  1. 词向量(Word Vector):单个词语映射为固定长度数字向量,Word2Vec、GloVe 产出,一个词 = 一条向量。
  2. 文本向量(句子 / 段落向量):整句话、整篇文档压缩成一条向量,BOW、BERT、BGE、E5 产出,一段文本 = 一条向量。

二、全方位对比表

表格

对比项词向量 (Word2Vec)文本向量 (BGE/E5/BERT)
映射对象单个词语句子、段落、整篇文本
生成方式用上下文预测训练,一词一个静态向量整段文本全局编码,融合全句上下文
向量数量N 个词→N 条向量N 段文本→N 条向量
一词多义静态固定向量,无法区分随上下文动态生成,同词不同句向量不同
语义范围只承载词语本身语义承载整段主旨、逻辑、隐含语义
文本拼接方法求和 / 平均得到文本表示(效果差)模型直接输出整段向量(原生最优)
典型应用近义词查询、词语类比、分词特征RAG 知识库检索、段落匹配、文档聚类、文本分类

三、通俗举例

词表:苹果、香蕉、书桌

单个词独立向量,苹果、香蕉相似度高。

  1. 文本:我爱吃苹果和香蕉

词向量方案:苹果 + 香蕉 + 爱吃三个向量相加求平均,粗暴合成文本向量,丢失语序;
文本向量方案:BGE 直接输出唯一一条向量,完整保留 “爱吃两种水果” 整句含义。

四、两种由词得到文本向量的方案(优劣)

缺点:

  1. 丢失语序:狗咬人 / 人咬狗平均向量一致;
  2. 无全局语义,无法区分整句意图;

早期低成本临时方案,现已淘汰。

方案 2:预训练模型直接生成文本向量(BGE/E5)

模型从字词→句法→全文语义逐层编码,原生段落向量,是现在 RAG、语义检索标准。

五、结合全技术演进

  1. OneHot/BoW:离散稀疏编码,无真正语义向量;
  2. Word2Vec:词粒度稠密向量,解决词语相似度,不能直接表示文本;
  3. BERT:可输出词向量 + 句向量,动态解决一词多义;
  4. BGE/E5:专门优化段落文本向量,主打长文本语义匹配、知识库检索。

六、代码直观示例

python

运行

# 1.Word2Vec词向量 from gensim.models import Word2Vec sent = [["我","爱吃","苹果"],["我","爱吃","香蕉"]] w2v = Word2Vec(sent,sg=1,vector_size=10,window=2,min_count=1) # 单个词向量 v_apple = w2v.wv["苹果"] v_banana = w2v.wv["香蕉"] # 手动拼接文本向量(平均) text_vec = (v_apple + v_banana)/2 # 2.BGE直接文本向量(伪代码) # from sentence_transformers import SentenceTransformer # model = SentenceTransformer('bge-small-zh') # text_vec = model.encode("我爱吃苹果和香蕉") #直接输出整段向量

七、一句话总结

词向量是词语的数字化身,擅长词语级语义;文本向量是段落的数字化身,擅长整句意图与全文匹配。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询