首页 / AI 百科 / 词嵌入

词嵌入Word Embedding

基础概念

把词变成一串数字向量的技术:意思相近的词,向量也彼此靠近,模型因此能用数学运算来处理语义。

计算机只会算数,不会读字。最笨的编码方式是给每个词编个序号,但序号之间的大小毫无意义,「猫」和「狗」的距离可能比「猫」和「火车」还远。词嵌入要解决的就是:给每个词找一个能表达含义的坐标。

核心思想

把每个词放进一个几百到几千维的空间里,每个维度都可以粗略看成某种语义特征的方向。含义和使用场景相似的词,会被训练成彼此靠近的向量。 这些向量不是人工标注的,而是从大量文本里「顺出来」的:一个词经常出现在相似的上下文里,它的向量就会被拉近。经典做法有基于局部上下文预测的,也有基于全局共现统计的。 学出来之后会出现一些有趣的性质:方向上的差值往往对应某种稳定的语义关系,比如「国王 − 男人 + 女人」算出来的向量最接近「女王」。这说明语义关系被部分编码成了几何关系。

在大模型里

现在很少单独训练词向量了。主流做法是先做分词,再把每个 Token 映射成一个向量,这层映射通常和整个网络一起端到端训练。而且同一个词在不同句子里的向量会经过注意力层继续变化,所以最终的表示是「带上下文的」,比静态词向量丰富得多。

为什么重要

它是把语言接入数学世界的第一道门。翻译、搜索、推荐、聚类这些任务,都要先把文本变成向量才能计算。今天说的「向量数据库」「语义检索」,本质上都是词嵌入思想的延伸。

常见误区

相关词条
Token 与分词 神经网络 RAG 检索增强生成
本词条为原创科普整理,用于帮助理解,不替代论文与官方文档。如有技术性错漏,欢迎指正。
← 返回 AI 百科 · 返回首页