站长今天直接给你上干货。很多朋友问站长,vllm + 本地模型到底怎么跑起来?网上教程一堆,但全是术语,看着就头大。别慌,站长这篇教程,你只要跟着敲命令,3 分钟内绝对能让模型在你自己的电脑上转起来。咱们不搞虚的,直接开整。
前置准备:别急着装,先看这三点
⚡ 【免费资源】DeepSeek/Ollama 部署排错手册 + 全套 AI 提示词资料包
站长已将大模型部署排错指南、常用环境配置文件及 AI 提效指令库整合分享至夸克网盘,可极速免费转存:
在动手之前,站长先帮你排掉 90% 的坑。记住,vllm + 本地模型不是玄学,是环境问题。
- 显卡要求(硬性):你必须有一块 NVIDIA 显卡,显存至少 6GB(8GB 更稳)。AMD 显卡暂时别想了,vllm 官方不支持。如果你只有 CPU,那站长劝你换 llama.cpp,别在这浪费时间。
- 显存不够怎么办? 模型量化是关键。站长推荐你用 Q4_K_M 或者 AWQ 这种 4bit 量化版本。比如 Qwen2.5-7B-Instruct-AWQ,大概 4.5GB,6GB 显存能跑。别下原版 16bit 的,必爆显存。
- Python 环境: 建议用 Python 3.10 或 3.11。装好 CUDA 12.1 以上驱动。别用 3.12,有些依赖包还没适配。
极速 3 步操作:站长手把手带你跑
现在开始计时。站长假设你已经装好了 Python 和 CUDA。如果没有,先去官网装,别偷懒。
第一步:安装 vllm(1 分钟)
打开你的终端(Windows 用 CMD 或 PowerShell,Mac/Linux 直接开)。输入以下命令,回车等待即可:
pip install vllm
如果你是中国大陆网络,建议加清华源,不然下载速度能让你怀疑人生:
pip install vllm -i https://pypi.tuna.tsinghua.edu.cn/simple
站长提醒:这步如果报错,大概率是 CUDA 版本不匹配。你输 nvcc --version 看下版本,如果是 11.8 就装 pip install vllm==0.4.2 这种老版本。别问为什么,问就是兼容性。
第二步:下载本地模型(1 分钟)
站长强烈建议你用 Hugging Face 或者 ModelScope(国内快)。这里以 Qwen2.5-7B-Instruct 为例,因为它是目前中文能力最强的开源模型之一,而且 vllm 完美支持。
用 modelscope 下载,速度飞快。在终端输入:
pip install modelscope
然后写个 Python 脚本下载(或者直接用命令):
modelscope download --model Qwen/Qwen2.5-7B-Instruct-AWQ --local_dir ./qwen-awq
站长建议:下载 AWQ 量化版,不要下原版。原版 15GB,AWQ 版只有 4.5GB,而且推理速度更快,精度损失几乎感知不到。下载完你会看到一个文件夹叫 qwen-awq,里面全是模型文件。
第三步:启动 vllm 服务(1 分钟)
模型下载好了,现在启动服务。在终端输入:
python -m vllm.entrypoints.openai.api_server \
--model ./qwen-awq \
--trust-remote-code \
--gpu-memory-utilization 0.8 \
--max-model-len 8192
站长解释一下参数:–gpu-memory-utilization 0.8 表示用 80% 显存,防止爆显存;–max-model-len 8192 是最大上下文长度,8K 足够用。如果显存小,改成 4096。
看到 Uvicorn running on http://localhost:8000 这行字,恭喜你,vllm + 本地模型已经跑起来了!
现在你打开浏览器,访问 http://localhost:8000/docs,就能看到 API 文档。或者用 Python 测试一下:
import openai
client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="qwen",
messages=[{"role": "user", "content": "你好,介绍一下你自己"}]
)
print(response.choices[0].message.content)
搞定!这就是完整的 vllm + 本地模型 调用流程。
避坑提示卡片(站长血泪经验)
💡 关联延伸阅读:如果你在配置过程中遇到相关报错,请参阅站长之前的解决教程:在win11上部署大模型推理加速工具vllm:从零到可用的避坑实操指南
⚠️ 坑 1:显存溢出(OOM)
如果你启动时报CUDA out of memory,别慌。把--gpu-memory-utilization降到 0.5,或者换更小的模型(比如 3B 量化版)。站长见过太多人卡在这。⚠️ 坑 2:模型路径错误
启动时--model ./qwen-awq一定要指向你下载的文件夹,别写模型名字。很多人直接写Qwen/Qwen2.5-7B,结果 vllm 去网上找了,半天没反应。⚠️ 坑 3:版本不兼容
vllm 更新很快,有些老模型需要--trust-remote-code参数。如果报trust_remote_code错误,加上这个参数就行。另外,vllm 0.6.x 以上版本对 Python 3.12 支持不好,建议用 3.10。⚠️ 坑 4:并发请求报错
如果你是做生产环境,记得加--max-num-seqs 8参数,限制并发数,否则连续请求会崩。
站长最后的唠叨
看到这里,你已经学会了 vllm + 本地模型 的完整流程。这套方案最大的优势就是速度快——相比 llama.cpp,vllm 的吞吐量能高 3-5 倍,而且完全兼容 OpenAI API 格式,你之前写的代码直接换 base_url 就能用。
站长再送你一个建议:本地模型别贪大,7B 量化版是性价比之王。再往上 13B、70B,除非你有 24GB 以上显存,否则体验会很差。跑通之后,你可以试着调 --tensor-parallel-size 2 来用多卡,但那是进阶玩法了,今天先到这。
如果还有问题,别问站长要微信,直接评论区留言。站长看到都会回。记住,vllm + 本地模型没那么难,动手试一次就会了。
相关 AI 排错与深度技术延伸
⚡ 开发者实操必备资源与算力限时特惠通道
阅读完本教程准备实操?站长已将 AI 部署排错手册、提示词全集与服务器限时优惠整理如下,即拿即用: