1. 项目背景与挑战
作为一名长期从事中西古典文本研究的学者,我最初接触大模型技术时完全是个门外汉。我的专业背景是医学和心理学,日常在大学讲授批判思维和跨文化交流课程。虽然对数据库、向量化等技术有所耳闻,但直到六个月前才开始真正接触这些概念。
这个项目源于一个迫切的研究需求:如何将约600万字的中西古典文献(以繁体中文为主,包含大量英、法、德、意、希腊等多语言引文)进行系统化的数字化处理。传统的人工整理方式效率低下,而现有的数字人文工具又难以满足复杂的多语言处理需求。更棘手的是,我们的研究团队缺乏专业的技术支持,预算也十分有限。
正是在这样的背景下,我发现了DeepSeek的百万token窗口功能。这个看似技术性的功能,实际上为非技术背景的研究者打开了一扇全新的大门——它允许我们将整个研究项目的完整生命周期都容纳在一个连续的对话环境中。从环境配置到数据处理,从问题解决到方法论反思,所有环节都能在这个"长程思考空间"中完成。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术环境搭建
2.1 硬件与基础软件配置
我的工作环境包括一台配备双RTX 5080显卡的工作站,运行Windows 11系统。虽然硬件条件不错,但最初我对如何利用这些资源几乎一无所知。主要使用的软件工具包括:
- PowerShell:用于系统管理和脚本执行
- VS Code:代码编辑和项目管理
- Jupyter Notebook:交互式编程和数据分析
- Continue:AI辅助编程插件
- Notepad++:文本清洗和格式转换
2.2 数据库系统选型与配置
经过与DeepSeek的多次讨论,我们最终选择了PostgreSQL 18作为基础数据库系统,并添加pgvector扩展以支持向量化操作。这个选择基于几个关键考量:
- PostgreSQL对复杂查询和自定义数据类型的强大支持
- pgvector扩展提供了高效的向量搜索能力
- 开源免费,适合学术研究使用
- 社区支持良好,遇到问题容易找到解决方案
安装过程并非一帆风顺。第一个重大挑战出现在编译pgvector扩展时,系统提示找不到nmake命令。经过排查,发现是缺少Visual Studio的C++开发组件。安装相应组件后,在开发者命令提示符中成功完成了编译。
另一个棘手的问题是编码冲突。Windows系统默认
