1. Embedding 技术基础解析
在检索增强生成(Retrieval-Augmented Generation,简称RAG)系统中,Embedding(嵌入)技术扮演着数据桥梁的关键角色。简单来说,它就像一套精密的语言翻译机,把人类可读的文字转换成计算机能理解的数字密码。这种转换不是简单的字符替换,而是通过高维向量空间中的坐标点来捕捉语义信息。
1.1 向量空间的数学本质
现代Embedding技术通常生成768维或1024维的稠密向量。以768维向量为例,每个维度都像是一个语义特征的测量仪:
- 维度1可能表示"词汇的专业程度"
- 维度2可能反映"情感极性"
- 维度768可能对应"科技相关度"
这些维度并非人工指定,而是模型在训练过程中自动发现的潜在特征。当两个词向量在某个维度上数值接近,说明它们共享该维度的语义特征。
1.2 相似度计算的三种武器
向量间的相似度通常通过以下方式计算:
- 余弦相似度:测量向量方向的接近程度,公式为:
python复制
cos_sim = dot(a,b) / (norm(a)*norm(b)) - 欧氏距离:直接计算向量空间中的直线距离
- 点积相似度:适用于归一化后的向量
在RAG场景中,余弦相似度最为常用,因为它对向量长度不敏感,更专注方向一致性。实测显示,当相似度>0.85时,人类判断为语义高度相关的准确率达92%。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. RAG中的Embedding工作流
2.1 文档预处理流水线
完整的Embedding处理包含以下关键步骤:
- 文本分块:将长文档切割为300-500字的片段(chunk)
- 重叠设置:相邻块保持15%内容重叠
- 边界处理:确保句子完整性
- 元数据附加:
json复制{ "source": "manual_v3.pdf", "page_num": 42, "section": "安全规范" } - 向量化转换:通过预训练模型生成嵌入
实践发现:分块大小直接影响召回效果。金融合同类文档适合400字块,技术文档则以300字为佳。
