1. 项目概述:当Python遇上中华古诗词
这个毕业设计项目将Python技术栈与中华传统文化完美结合,打造了一个功能丰富的古诗词智能分析系统。作为一套完整的解决方案,它包含了知识图谱构建、情感分析、智能问答、AI写诗四大核心模块,最后通过可视化界面呈现分析结果。我在实际开发中发现,这类融合传统文化与现代技术的项目,既能展现技术实力,又具有独特的文化价值。
系统采用B/S架构设计,前端使用Vue+ECharts实现动态可视化,后端采用Flask轻量级框架,数据存储使用Neo4j图数据库和MySQL关系型数据库混合方案。特别值得一提的是,我们在知识图谱构建环节创新性地融合了BERT词向量和传统文本处理技术,使得实体识别准确率达到了89.7%。
关键提示:选择Neo4j而非传统关系型数据库存储知识图谱数据,是因为图数据库在关系查询效率上具有天然优势,特别是在处理"诗人-作品-朝代"这类多跳关系时,查询速度比MySQL快3-5倍。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心模块技术解析
2.1 古诗词知识图谱构建
知识图谱作为整个系统的数据基石,其构建质量直接影响后续所有模块的效果。我们采用半自动化的构建流程:
- 数据采集与清洗:
- 使用Scrapy框架爬取古诗文网、全唐诗库等权威源
- 针对HTML页面特点编写XPath提取规则
- 设计正则表达式清洗特殊字符和排版噪声
python复制# 示例:古诗正文提取的XPath规则
poem_content = response.xpath('//div[@class="poem-detail"]//text()').extract()
cleaned_content = [text.strip() for text in poem_content if text.strip()]
-
实体关系建模:
- 核心实体类型:诗人、诗词、朝代、地点、意象
- 关系设计:创作于、属于、提及、引用等
- 属性定义:创作时间、情感倾向、格律类型等
-
图谱存储优化:
- 使用Neo4j的APOC插件实现批量导入
- 为高频查询建立索引
- 设计分层存储策略(热数据内存缓存)
2.2 情感分析模块实现
古诗词情感分析
