1. 图嵌入与文本表示:从线性序列到结构化建模
在自然语言处理领域,文本表示一直是核心基础任务。传统方法通常将文本视为简单的词序列或词袋,这种线性视角虽然支撑了从RNN到Transformer等模型的成功,却忽略了语言中丰富的结构化信息。词语之间通过句法依存构成树状或图状关系,文档之间通过引用、主题相似性相互关联,词汇与文档之间也存在复杂的所属关系。这些非线性的结构化关系正是图嵌入技术能够天然建模的对象。
图嵌入(Graph Embedding)的核心思想是将图中的节点(如词、文档、实体)映射为低维稠密向量,使得图中邻近或结构相似的节点在向量空间中彼此靠近。近年来,随着图神经网络(Graph Neural Networks, GNN)的发展,图嵌入技术已经从早期的浅层随机游走方法(如DeepWalk、Node2Vec)演进到基于深度消息传递的端到端学习范式,能够同时融合节点特征与图拓扑信息。
在文本处理场景中,我们可以通过多种方式构建图结构:
- 词语共现图:节点代表词语,边权重反映词对在滑动窗口内的共现频次。这种简单的构建方式已经能够捕捉词语之间的语义关联。
- 文档-词异构图:包含两类节点——文档节点和词节点,边表示词在文档中的出现(通常用TF-IDF加权)。这种二分图结构能够同时建模文档内容和词汇分布。
- 句法依存图:以词语为节点,句法依存关系为有向边。这种图直接编码了句子的语法结构。
- 知识图谱:实体作为节点,关系作为边。这种图结构能够引入外部知识来增强文本理解。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Text GCN:基于异构图的半监督文本分类
2.1 模型架构与图构建
Text GCN(Graph Convolutional Networks for Text Classification)是2019年提出的一种创新方法,它将整个语料库构建为一个大型异构图,然后通过两层图卷积网络同时学习词嵌入和文档嵌入,最终实现半监督文本分类。这种方法在小样本场景下表现出色,甚至在某些数据集上接近全监督BERT的性能。
Text GCN构建的图包含两类节点:
- 文档节点:语料库中的每篇文档对应一个节点
- 词节点:语料库中所有词(或经过频率筛选后的词表)对应多个节点
边权重由两种关系决定:
- 文档-词边:如果词w_j出现在文档d_i中,则边权重为TF-IDF值
- 词-词边:基于全局词共现统计,使用点互信息(PMI)作为边权重
这种图结构的邻接矩阵可以表示为分块矩阵形式:
code复制A = [ 0 A_doc-word
A_doc-word^T A_word-word ]
其中文档节点之间没有直接连接,而是通过共享的词节点间接关联。
2.2 图卷积操作与训练
Text GCN采用两层图卷积网络(GCN)进行信息传播和学习。前向传播过程可以表示为:
code复制Z = softmax(Â ReLU(Â X W^(0)) W^(1))
其中:
- Â是添加自环并对称归一化的邻接矩阵
- X是节点的one-ho
