1. 大模型本地部署RAG系统核心术语解析
最近一年,开源大模型技术突飞猛进,个人用户已经可以在家用电脑上搭建自己的智能问答系统(RAG)。但当你真正开始尝试时,各种专业术语就像天书一样扑面而来。作为一个从零开始搭建过多个本地RAG系统的实践者,我深知这些术语对新手造成的困扰。今天我们就来彻底拆解这些"黑话",让你在部署时不再迷茫。
1.1 RAG系统的三大核心组件
一个完整的RAG(Retrieval-Augmented Generation)系统由三类模型协同工作:
1.1.1 大语言模型(LLM) - 系统的"大脑"
- 作用:根据用户问题和检索到的内容生成自然语言回答
- 典型代表:Qwen系列、Gemma、DeepSeek等
- 关键指标:参数规模(7B/13B等)、上下文窗口长度
1.1.2 向量模型(Embedding Model) - 系统的"记忆检索器"
- 作用:将文本转换为高维向量,通过向量相似度匹配相关内容
- 典型代表:bge-m3、Qwen-Embedding等
- 关键特点:支持多语言、对长文本处理效果好
1.1.3 重排模型(Reranker) - 系统的"质检员"
- 作用:对初步检索结果进行二次排序,提升结果相关性
- 典型代表:bge-reranker、Qwen-Reranker等
- 工作方式:计算query-document对的相关性得分
实际部署经验:三类模型的版本需要匹配(如都用Qwen系列),否则可能出现兼容性问题。我曾混用不同系列的模型导致回答质量下降30%。
1.2 模型格式:GGUF vs Safetensors vs AWQ
1.2.1 GGUF格式
- 特点:专为CPU推理优化,支持量化,内存占用低
- 适用场景:无独立显卡的普通电脑
- 工具支持:Ollama、LM Studio、llama.cpp
- 文件示例:
Qwen1.5-7B-Q4_K_M.gguf
1.2.2 Safetensors格式
- 特点:安全稳定的通用格式,加载速度快
- 适用场景:有GPU的环境
- 工具支持:vLLM、Xinference
- 优势:避免传统PyTorch格式的安全风险
1.2.3 AWQ格式
- 特点:4bit量化同
