1. 项目背景与核心价值
《平凡的世界》作为中国当代文学经典之作,其庞大的人物关系网和复杂的社会背景为知识图谱构建提供了绝佳素材。这个毕设项目选择知识图谱+问答系统的技术路线,本质上是在探索如何用计算机技术解构文学作品的深层语义网络。
传统文学研究依赖人工标注和分析,而知识图谱能够将小说中的人物、地点、事件等实体及其关系结构化存储,形成可计算的知识网络。问答系统则让非专业读者也能通过自然语言快速获取作品中的关键信息。这种技术组合在数字人文领域具有典型示范意义。
从技术角度看,项目涉及三大核心模块:知识抽取(从文本到结构化数据)、知识存储(图谱数据库设计与实现)、知识应用(问答接口开发)。每个环节都需要处理文学文本特有的模糊性和语境依赖性,这正是项目的技术挑战所在。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 知识图谱构建全流程
2.1 文本预处理与实体标注
原始文本采用人民文学出版社的《平凡的世界》电子版,需要进行以下预处理:
- 文本清洗:去除版权信息、章节标记等非正文内容
- 分句处理:以句号为界拆分文本,保留原始段落结构
- 实体标注:采用BIO标注体系标记五类核心实体:
- 人物(如孙少安/B-PER、田润叶/I-PER)
- 地点(如双水村/B-LOC)
- 组织(如黄原师专/B-ORG)
- 时间(如一九七五年/B-TIME)
- 事件(如责任制/B-EVENT)
实操技巧:文学文本中实体边界常不明确(如"孙少安家"应标注为"孙少安/家"两个实体),建议先用正则表达式处理复合名词
2.2 关系抽取方案选型
采用基于依存句法分析+规则匹配的混合方法:
python复制# 示例:配偶关系抽取规则
def extract_spouse(sent, entities):
for token in sent.dependency_parse:
if token.deprel == 'nmod:assmod' and '配偶' in token.form:
head = sent.words[token.head-1]
return (head.lemma, entities[token.id-1])
关系类型设计为三级体系:
1.
