1. 流形理论视角下的Embedding技术演进
流形理论为理解Embedding技术提供了全新的几何视角。让我们从词向量发展的四个关键阶段,剖析其背后的流形结构演变。
1.1 One-Hot编码的离散性局限
最早的词表示方法采用One-Hot编码,每个词被映射为高维空间中的一个基向量。这种表示存在两个根本缺陷:
- 所有向量彼此正交,无法表达语义关系
- 维度随词汇量线性增长,导致维度灾难
从流形角度看,这相当于将每个词孤立地放置在离散点上,缺乏连续语义空间的几何结构。例如,"猫"和"犬"的向量距离与"猫"和"汽车"完全相同,这与人类语义认知严重不符。
1.2 静态嵌入的欧氏空间突破
Word2Vec和GloVe的突破在于发现了词向量的分布式表示特性。其核心是分布假设:出现在相似上下文中的词应该具有相似向量表示。这种表示带来了三个重要特性:
- 语义相似性:通过余弦相似度可量化词语义关系
- 线性类比:如"国王"-"男"+"女"≈"女王"
- 聚类结构:同类词在高维空间形成聚集
此时的Embedding空间可视为平坦的欧几里得空间,语义关系通过简单的线性距离度量。但静态嵌入无法处理一词多义问题,因为每个词被固定映射到单一位置。
1.3 动态嵌入的流形雏形
以ELMo和BERT为代表的上下文感知模型,将Embedding提升到新的维度。关键突破包括:
- 同一词在不同语境获得不同表示
- 通过Transformer层捕获深层语义特征
- 表示空间呈现非线性结构
这时的Embedding空间开始展现出流形特性:每个词不再对应固定点,而是对应一个条件概率分布形成的局部曲面。例如,"苹果"在水果语境和科技语境会落在流形上不同位置。
1.4 大模型时代的复杂流形结构
现代LLM的Embedding空间已发展为高度复杂的非线性流形:
- 语义转换形成连续轨迹(如"好"→"很好"→"最好")
- 不同语义簇之间通过特定路径连接
- 空间曲率分布不均匀,高频概念区域更平坦
这种结构使得简单的欧氏距离度量(如余弦相似度)难以准确反映语义关系。我们需要引入黎曼几何工具,在流形表面测量真实的语义距离。
实测发现,在768维BERT嵌入空间中,两个语义相关但表面不相似的词(如"经济"和"金融")的欧氏距离可能是
