1. 从文本到向量:Embedding技术核心解析
第一次接触Embedding这个概念时,我正为一个电商推荐系统焦头烂额。传统的关键词匹配总把"苹果手机"和"水果苹果"混为一谈,直到尝试用Embedding技术,才真正实现了语义级别的商品相似度计算。这种将文本转化为数值向量的魔法,如今已成为大模型时代的基石技术。
1.1 Embedding的本质定义
Embedding的本质是建立文本到向量空间的映射关系。想象每个词都是高维空间中的一个点,"猫"可能位于(0.8, -0.2, 0.4)坐标,"狗"在(0.7, -0.3, 0.5),它们的接近程度反映了语义相似性。这种映射不是随机的,而是模型从海量数据中学习到的语义规律。
关键认知:Embedding向量不是简单的数值集合,而是压缩后的语义DNA。就像人类DNA用四种碱基编码生命信息,Embedding用数百个浮点数编码语义特征。
1.2 两种生成方式的深度对比
在实际项目中,我经常需要根据场景选择Embedding生成方式:
Token级Embedding(大模型内部使用)
- 工作流程:文本→分词→查表→向量拼接
- 典型维度:768维(BERT-base)、1024维(GPT-3)
- 优势:计算高效,适合实时推理
- 局限:缺乏全局语义信息
句子级Embedding(独立模型生成)
- 代表模型:Sentence-BERT、M3E、OpenAI text-embedding-3-large
- 典型维度:384维(all-MiniLM-L6-v2)、1536维(text-embedding-3-large)
- 优势:保留上下文关系
- 局限:计算成本较高
最近在处理法律合同分析时,我们发现结合两种方式效果最佳:先用句子级Embedding筛选相关条款,再用Token级Embedding分析具体条款细节。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Embedding的实战生成过程
2.1 Token级Embedding的完整流水线
以处理句子"深度学习改变世界"为例:
- 分词阶段:
- 使用BERT的WordPiece分词器得到:["深", "度", "学", "习", "改", "变", "世", "界"]
- 每个token被赋予唯一
