1. 项目概述:vllm-ascend部署qwen3-rerank-8B的技术实践
在昇腾AI生态快速发展的背景下,vllm-ascend作为专为昇腾处理器优化的推理框架,为国产大模型部署提供了新的技术路径。本次实践聚焦于qwen3-rerank-8B这款8B参数的专用嵌入模型在昇腾910B平台上的完整部署过程。不同于通用语言模型,rerank类模型在语义搜索、推荐排序等场景具有独特优势,其部署过程也面临显存优化、算子适配等特殊挑战。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 环境准备与依赖配置
2.1 硬件环境要求
- 昇腾910B芯片(至少16GB显存)
- 内存:建议64GB以上
- 存储:需预留50GB空间用于模型文件和临时数据
- 操作系统:OpenEuler 22.03 LTS(经测试与vllm-ascend v0.14.0rc1兼容性最佳)
2.2 软件依赖安装
bash复制# 安装CANN工具包(版本需≥6.0.RC1)
wget https://ascend-repo.obs.cn-east-2.myhuaweicloud.com/CANN/6.0.RC1/.../Ascend-cann-toolkit_6.0.RC1_linux-aarch64.run
chmod +x Ascend-cann-toolkit_6.0.RC1_linux-aarch64.run
./Ascend-cann-toolkit_6.0.RC1_linux-aarch64.run --install
# 配置环境变量
echo 'source /usr/local/Ascend/ascend-toolkit/set_env.sh' >> ~/.bashrc
source ~/.bashrc
# 安装vllm-ascend特定版本
pip install vllm-ascend==0.14.0rc1 --extra-index-url https://pypi.vllm.ai/simple
注意:必须使用指定版本的CANN和vllm-ascend,新版本可能存在算子兼容性问题
3. 模型准备与转换
3.1 模型获取与验证
qwen3-rerank-8B作为专用嵌入模型,需从官方渠道获取:
- 申请模型权重(需提供使用场景说明)
