1. 项目概述
最近在本地部署大模型的需求越来越旺盛,特别是像Llama 3和Qwen2这样的开源模型。作为一名长期使用Python进行AI开发的工程师,我发现Ollama这个工具能极大简化本地大模型的部署流程。今天就来分享如何用Python连接本地运行的Ollama服务,快速调用Llama 3和Qwen2模型进行推理。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 环境准备与安装
2.1 Ollama安装与配置
首先需要在本地安装Ollama。根据操作系统不同,安装方式略有差异:
对于Windows用户:
- 访问Ollama官网下载最新安装包
- 双击运行安装程序
- 安装完成后,在命令行输入
ollama --version验证安装
对于Linux/macOS用户:
bash复制curl -fsSL https://ollama.com/install.sh | sh
注意:国内用户可能会遇到下载速度慢的问题,可以通过设置镜像源解决:
bash复制export OLLAMA_HOST=mirror.ollama.com
2.2 模型下载
安装完成后,可以下载需要的模型。Llama 3和Qwen2都是不错的选择:
bash复制ollama pull llama3
ollama pull qwen2
模型下载完成后,可以用以下命令启动服务:
bash复制ollama serve
3. Python连接Ollama
3.1 安装必要的Python库
我们需要安装ollama的Python客户端库:
bash复制pip install ollama
3.2 基础连接示例
最简单的连接方式:
python复制import ollama
response = ollama.chat(
model='llama3',
messages=[{'role': 'user', 'content': '你好,介绍一下你自己'}]
)
print(response['message']['content'])
3.3 高级配置
对于生产环境,建议配置更稳定的连接:
python复制client = ollama.Client(
host='http://localhost:11434',
timeout=60,
verify=False # 如果是自签名证书
)
4. 模型调用实践
4.1 文本生成
使用Llama 3生成文本:
python复制def generate_text(prompt, model='llama3', max_tokens=500):
response = ollama.gene
