1. MinerU Tianshu 项目概述
MinerU Tianshu(天枢)是一个功能强大的企业级AI数据预处理平台,专注于将各类非结构化数据转换为AI可用的结构化格式。作为一个长期从事数据处理工作的开发者,我最近在本地部署了这个平台,发现它在处理复杂数据格式时表现出色。
这个平台支持多种数据类型的转换:
- 文档类:PDF、Word、Excel、PPT等办公文档可转换为Markdown或JSON格式
- 多媒体类:视频、音频文件可提取文字内容和关键帧信息
- 图像类:JPG、PNG等图片格式可进行文字提取和结构化处理
- 专业格式:FASTA、GenBank等生物信息学专用格式也能很好支持
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 本地部署准备
2.1 环境要求
在开始部署前,需要确保系统满足以下要求:
- Node.js 18+ 版本
- Python 3.12 环境
- CUDA 工具包(如需GPU加速)
- 至少16GB内存(处理大型文档时建议32GB以上)
- 50GB以上可用磁盘空间(用于存放模型和临时文件)
提示:建议使用Linux系统进行部署,Windows系统可能会遇到更多依赖问题。我在Ubuntu 20.04和Windows 11上都进行了测试,Linux环境明显更稳定。
2.2 项目结构
项目克隆后主要包含以下目录:
code复制mineru-tianshu/
├── backend/ # 后端服务核心代码
├── frontend/ # 前端界面代码
├── models/ # 模型存放目录
├── .env.example # 环境配置示例文件
└── README.md # 项目说明文档
3. 详细部署步骤
3.1 Python环境配置
首先需要创建独立的Python虚拟环境:
bash复制# 创建项目目录
mkdir mineru-tianshu && cd mineru-tianshu
# 使用uv创建虚拟环境
uv python list # 查看可用Python版本
uv init # 初始化项目
uv venv --python 3.12 # 创建指定版本的虚拟环境
创建完成后项目目录会生成以下文件:
code复制├── .python-version
├── pyproject.toml # 项目配置文件
└── README.md # 项目说明
3.2 依赖安装
安装核心依赖库(建议使用国内镜像源加速):
bash复制# PaddlePaddle GPU版本(需CUDA 12.6)
uv pip install paddlepaddle-gpu==3.2.0 -i https://www.paddlepaddle.org.cn/packages/stable/
