1. 项目背景与核心价值
建筑行业从业者每天都要面对海量的规范文件、标准图集和技术手册,这些资料往往以PDF、CAD图纸、Excel表格等不同格式分散存储。传统检索方式效率低下,经常出现"记得某条规范但找不到出处"、"看到图纸编号却查不到对应条文"的困境。这个项目就是要用多模态大模型技术,构建一个能同时理解文本、表格和图纸的建筑规范知识库。
我在某大型设计院信息化部门工作期间,曾统计过工程师平均每天要花费2.3小时在资料检索上。最典型的场景是:审查施工图时发现某个节点构造疑似不符合防火规范,需要依次查阅《建筑设计防火规范》GB50016的文本条款、对应的构造详图图集、以及材料燃烧性能参数表格。这个过程往往需要切换多个软件窗口,在不同格式文件间反复跳转。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术方案选型
2.1 多模态架构设计
核心采用"分治-融合"的两阶段架构:
- 模态专用编码器:
- 文本:RoBERTa-wwm建筑领域微调版
- 表格:TAPAS模型+自定义表格结构解析模块
- 图纸:基于ResNet-50的视觉特征提取器
- 跨模态融合层:
- 采用Late Fusion方式,通过注意力机制动态加权各模态特征
- 特别设计了图纸-文本交叉注意力模块,用于建立条文与图示的映射关系
实践发现:建筑图纸中的图例、标注文字区域需要特殊处理。我们开发了基于OpenCV的图元检测预处理模块,能自动识别图纸中的文字框、尺寸标注和技术说明区域。
2.2 数据准备要点
2.2.1 数据来源清单
- 文本类:
- 国标/行标PDF(需OCR校对)
- 地方标准Word文档
- 企业技术规程TXT
- 表格类:
- 材料性能参数表(Excel)
- 构造做法选用表(CAD属性表)
- 图纸类:
- 标准图集(DWG+PDF)
- 典型节点大样图(JPG)
2.2.2 清洗转换流程
- PDF文本提取:
python复制# 使用pdfplumber处理文字型PDF
import pdfplumber
with pdfplumber.open("GB50016.pdf") as pdf:
for page in pdf.pages:
text = pa
