1. 项目概述与背景
在NVIDIA DGX Spark(GB10芯片)上部署Qwen3.5-35B-A3B-FP8量化模型是一项极具挑战性但又极具价值的工作。作为阿里通义千问团队发布的MoE(混合专家)架构模型,Qwen3.5-35B-A3B拥有35B总参数但仅激活3B参数,这种设计使其兼具大模型的推理能力和小模型的推理速度,特别适合本地Agent工作流部署。
FP8量化是本次部署的核心技术选择。相比原始BF16格式,FP8量化将模型大小从65GB降至37.5GB,精度损失控制在0.5%以内,同时避免了NVFP4格式在ARM64 GB10平台上的兼容性问题。这种量化方案不仅减少了内存占用,还使KV缓存空间翻倍,能够支持更长的上下文长度。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 环境准备与配置
2.1 硬件要求
部署Qwen3.5-35B-A3B-FP8模型需要满足以下硬件条件:
- NVIDIA DGX Spark或其他搭载GB10/B200的设备
- 至少80GB统一内存(运行FP8模型+KV缓存)
- 建议128GB统一内存以充分利用262K上下文
2.2 软件依赖安装
在开始部署前,需要确保系统已安装必要的软件依赖:
bash复制# 确认Docker和NVIDIA Container Toolkit已安装
docker --version
nvidia-smi
# 安装ModelScope(用于下载模型)
pip install modelscope --break-system-packages
3. 模型下载与验证
3.1 使用ModelScope下载模型
ModelScope提供了国内镜像,下载速度更快:
bash复制modelscope download --model Qwen/Qwen3.5-35B-A3B-FP8
模型将下载到默认路径:/root/.cache/modelscope/hub/models/Qwen/Qwen3.5-35B-A3B-FP8
3.2 验证模型完整性
下载完成后,需要确认文件完整性:
bash复制ls -lh /root/.cache/modelscope/hub/models/Qwen/Qwen3.5-35B-A3B-FP8/
# 应看到14个safetensors分片文件,总大小约37.5GB
4. vLLM服务部署
4.1 完整启动命令
以下是启动vLLM服务的完整命令:
bash复制# 1. 先清理旧容器(防止名字冲突)
docker stop qwen35-fp8 && docker rm qwen35-fp8
# 2. 启动解锁版容器
docker run -d \
--name qwen35-fp8 \
--gpus all \
--ipc=host \
--network=host \
--privileged \
--security-opt seccomp=unconfined \
-p 8000:8000 \
-e VLLM_LOGGING_LEVEL=INFO \
-e PYTHONUNBUFFERED=1 \
-v /root/.cache/modelscope/hub/models/Qwen/Qwen3.5-35B-A3B-FP8:/model \
vllm/vllm-openai:cu13
