1. 项目概述:当古诗词遇上知识图谱与AI大模型
这个毕业设计项目将传统中华古诗词文化与现代AI技术深度融合,打造了一个集知识图谱构建、情感分析、智能问答和自动写诗于一体的综合系统。作为一名长期从事自然语言处理开发的工程师,我认为这类项目完美展现了如何用技术手段活化传统文化遗产。
系统核心功能模块包括:
- 基于Python的古诗词知识图谱构建
- 支持朝代、作者、意象等多维度可视化查询
- 运用深度学习的情感倾向分析
- 基于大模型的智能问答系统
- AI辅助诗词创作功能
提示:知识图谱的构建质量直接影响后续所有功能的准确性,需要特别重视数据清洗和关系定义阶段。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 知识图谱构建全流程解析
2.1 数据采集与清洗
古诗词数据主要来自《全唐诗》《全宋词》等权威典籍的数字化版本。我们使用Scrapy框架构建爬虫时,特别注意处理了以下特殊字符:
python复制def clean_text(text):
# 处理古文特殊标点
text = re.sub(r'[-]', '', text)
# 统一异体字
text = text.replace('逈', '迥').replace('峯', '峰')
return text.strip()
常见数据问题包括:
- 作者别名处理(如苏轼/苏东坡)
- 朝代纪年转换(天宝→唐玄宗时期)
- 诗词异文标注(不同版本的用字差异)
2.2 本体设计关键点
采用七元组模型定义古诗词知识图谱:
mermaid复制(classDiagram虽被禁用,此处用文字描述)
实体类型:诗人、诗词、朝代、地点、意象、典故、格律
关系类型:创作于、使用意象、引用典故、属于格律、影响关系等
特别注意处理了:
- 诗人间的师承/唱和关系
- 意象的层级关系("花"→"梅花")
- 跨朝代的文学流派传承
2.3 图数据库选型对比
经实测三种主流方案:
| 数据库 | 插入速度(万条/分钟) | 复杂查询响应时间 | 适合场景 |
|---|---|---|---|
| Neo4j |
