VLLM部署Qwen模型

发布时间:2026/8/18 15:48:02
VLLM部署Qwen模型 一、Qwen2.5-14B1. 环境准备# 创建并激活虚拟环境推荐 python -m venv qwen_env source qwen_env/bin/activate # 安装依赖库确保Python≥3.8 pip install vllm transformers torch2. 下载模型pip install modelscope modelscope download --model Qwen/Qwen2.5-14B-Instruct --local_dir path/to/dir如果下载模型的时候提示没有权限export MODELSCOPE_CACHE/tmp/modelscope_cache modelscope download --model Qwen/Qwen2.5-7B-Instruct3. 启动服务# 指定4张GPU根据实际GPU数量调整 export CUDA_VISIBLE_DEVICES0,1,2,3 # 设置模型路径和服务名称 MODEL_PATH./Qwen2.5-14B-Instruct SERVED_MODEL_NAMEQwen2.5_14B # 启动服务关键参数说明见注释 python -m vllm.entrypoints.openai.api_server \ --model $MODEL_PATH \ --served-model-name $SERVED_MODEL_NAME \ --tensor-parallel-size 4 \ # 使用4张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文4. 验证服务发送测试请求新终端curl http://localhost:8000/v1/models预期输出{object:list,data:[{id:qwen2.5_14B,object:model}]}5. 调用API示例​​import openai client openai.OpenAI(base_urlhttp://localhost:8000/v1, api_keynone) response client.chat.completions.create( modelqwen2.5_14B, messages[{role: user, content: 你好}] ) print(response.choices[0].message.content)6. 远程调用API示例首先本地获取IP地址ifconfig然后远程使用例如import openai client openai.OpenAI(base_urlhttp://10.233.23.133:8000/v1, api_keynone) response client.chat.completions.create( modelqwen2.5_14B, messages[{role: user, content: 你好}] ) print(response.choices[0].message.content)二、Qwen3-14B部署方式类似但需要cuda版本12.4可以nvidia-smi查看transformers版本4.51.0。1. 安装VLLM1创建 conda 环境# 创建 conda 虚拟环境环境名称为 vllmpython 的版本为 3.10 conda create -n vllm python3.102切换 vllm 环境conda activate vllm这里有可能切换失败可以尝试两种方案conda init或者source ~/.bashrc3安装 vllm 和 modelscopepip install -U vllm \ --pre \ --extra-index-url https://wheels.vllm.ai/nightly pip install modelscope2. 启动服务创建run.sh文件# 指定2张GPU根据实际GPU数量调整 export CUDA_VISIBLE_DEVICES0,1 # 设置模型路径和服务名称 MODEL_PATH./Qwen3-14B SERVED_MODEL_NAMEQwen3_14B # 启动服务关键参数说明见注释 python -m vllm.entrypoints.openai.api_server \ --model $MODEL_PATH \ --served-model-name $SERVED_MODEL_NAME \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文然后命令行运行sh run.sh3. 调用API示例​​import openai client openai.OpenAI(base_urlhttp://localhost:8000/v1, api_keynone) response client.chat.completions.create( modelqwen3-14B, messages[{role: user, content: /no_think 你好}] ) print(response.choices[0].message.content)三、关于虚拟环境在notebook使用conda install ipykernel python -m ipykernel install --user --name vllm四、Qwen3.5-27B部署方式类似但需要cuda版本13.0可以nvidia-smi查看Python 3.12。然后vLLM 0.27.1 transformers 5.15.0。1. 安装VLLM1创建 conda 环境# 创建 conda 虚拟环境环境名称为 vllmpython 的版本为 3.12 conda create -n vllm python3.122切换 vllm 环境conda activate vllm这里有可能切换失败可以尝试两种方案conda init或者source ~/.bashrc3安装 vllm 和 modelscopeuv pip install vllm0.27.1 --torch-backendcu130 pip install modelscope2. 启动服务创建run.sh文件# 指定2张GPU根据实际GPU数量调整 export CUDA_VISIBLE_DEVICES0,1 # 设置模型路径和服务名称 MODEL_PATH./Qwen3.5-27B SERVED_MODEL_NAMEQwen3.5_27B # 启动服务关键参数说明见注释 python -m vllm.entrypoints.openai.api_server \ --model $MODEL_PATH \ --served-model-name $SERVED_MODEL_NAME \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文然后命令行运行sh run.sh