1. 项目背景与核心挑战
在金融数据分析领域,财报数据的结构化处理一直是个棘手的问题。我最近在处理A股上市公司海光信息2024年财报时,再次深刻体会到这个痛点。原始PDF财报中的表格数据往往存在格式混乱、多级表头、跨页重复等问题,传统方法需要编写大量硬编码规则来处理。
以海光信息的利润表为例,原始数据呈现为:
code复制主要会计数据 2024年 2023年
营业收入 9,162,148,135.92 6,011,998,991.03
归属于...净利润 1,930,990,510.51 1,263,178,600.37
这种数据至少存在三个典型问题:
- 数值包含千分位逗号
- 指标名称存在换行和省略
- 表头可能跨越多行
传统解决方案要么依赖复杂的正则表达式,要么需要人工逐条核对。而大语言模型(LLM)的出现,为我们提供了新的可能性——让程序处理确定性规则,让LLM处理语义理解。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术方案设计
2.1 混合处理架构
我们采用程序+LLM的混合架构,具体分工如下:
| 处理阶段 | 程序职责 | LLM职责 |
|---|---|---|
| 数据提取 | PDF解析、表格定位 | - |
| 初步清洗 | 去空值、去干扰行、数值标准化 | - |
| 语义对齐 | - | 表头理解、字段映射、格式转换 |
| 结果验证 | 数据类型检查、范围校验 | 异常值识别、逻辑矛盾检测 |
这种分工充分发挥了各自优势:程序处理确定性的脏数据清洗效率极高(单页PDF处理约50ms),而LLM处理语义理
