站长最近在后台收到大量读者留言,集中在同一个问题上:在哔哩哔哩上找到了“deepseek本地部署教程”,视频里每一步都看得懂,但自己动手操作时,不是显存不足,就是模型加载到一半直接闪退,甚至有人卡在pip安装依赖时出现红色报错。今天站长就把这些高频故障点全部拆开,结合实测环境,给你一份能直接照着抄的排错指南。
现象诊断:你在哪一步卡住的?
⚡ 【免费资源】DeepSeek/Ollama 部署排错手册 + 全套 AI 提示词资料包
站长已将大模型部署排错指南、常用环境配置文件及 AI 提效指令库整合分享至夸克网盘,可极速免费转存:
根据站长对上百条评论区的观察,90%的失败案例集中在以下三个环节。请你先对号入座,再往下看对应的解决方案。
- 症状A:执行
ollama run deepseek-r1时,进度条下载到90%突然中断,提示Error: pull model manifest: file does not exist。 - 症状B:模型能启动,但输入任何问题后,CPU占用直接拉满,等了几分钟才蹦出一个字,最后干脆报
Killed进程被杀。 - 症状C:视频里用的
llama.cpp编译命令,在你电脑上执行make时直接报g++: fatal error或找不到cuda.h。
原因分析:为什么哔哩哔哩教程会“水土不服”?
站长在实测中发现,B站教程的制作者大多使用NVIDIA显卡 + Windows 11 + 特定版本的CUDA环境。而你的电脑如果是AMD显卡、纯CPU环境、或者显卡驱动版本过新/过旧,视频里的命令就会像方言一样——每个字都认识,但连起来就是跑不通。
另一个深层原因是:DeepSeek官方推荐的部署方式迭代极快。很多UP主录制视频时用的是老版本命令,但你现在去官网拉取的是最新版代码,API参数和依赖库已经变了。比如旧版用 --model-path,新版改成了 --model,照着视频抄自然报错。
站长建议:遇到报错先别怀疑自己手残,先检查你下载的部署工具版本是否和教程录制时期一致。最简单的办法是看UP主视频简介里是否标注了“基于xx版本录制”,如果没有,直接跳转到文章第三部分用站长验证过的命令。
分步解决:三套实测可用的部署路径
💡 关联延伸阅读:如果你在配置过程中遇到相关报错,请参阅站长之前的解决教程:DeepSeek本地部署教程一键安装包避坑指南:从零到跑通的全流程实操配置
路径一:纯CPU环境(无显卡)最低成本跑通
如果你只是想在哔哩哔哩教程的启发下,用自己老笔记本体验一下DeepSeek,那么请直接放弃Ollama,改用llama.cpp的CPU量化版本。站长实测,4GB内存的机器也能跑,只是速度慢如蜗牛,但至少不报错。
# 第一步:克隆指定版本(不要用master分支)
git clone --branch b1.0 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
# 第二步:纯CPU编译(跳过所有GPU加速选项)
make clean
make LLAMA_NO_ACCELERATE=1 -j4
# 第三步:下载量化后的模型(推荐Q4_K_M,体积小)
# 模型文件需从HuggingFace手动下载,放到models文件夹
# 假设文件名为 deepseek-r1-1.5b-q4_k_m.gguf
# 第四步:交互式运行
./main -m models/deepseek-r1-1.5b-q4_k_m.gguf -p "你好" --interactive-first
此路径的关键坑点在于:不要用 make 后默认的GPU编译参数,否则在无NVIDIA驱动环境下必报 cuda error。站长实测,加上 LLAMA_NO_ACCELERATE=1 这个环境变量就能绕开。
路径二:NVIDIA显卡但显存只有6GB
很多B站教程推荐至少8GB显存,但站长实测6GB显存跑7B量化版是可行的,关键在于调整上下文长度和层数卸载。
# 安装Ollama(官网下载即可,不要用包管理器)
curl -fsSL https://ollama.com/install.sh | sh
# 拉取模型时指定量化版本(默认拉取的是Q4_0,但显存不够用)
ollama pull deepseek-r1:7b-q4_K_M
# 关键参数:限制上下文长度到2048,并只把20层放入GPU
ollama run deepseek-r1:7b-q4_K_M --num-ctx 2048 --n-gpu-layers 20
如果你在哔哩哔哩教程里看到的是 ollama run deepseek-r1:latest,那默认会尝试加载全部层到GPU。6GB显存瞬间爆掉,然后系统OOM杀掉进程。站长建议:用 --n-gpu-layers 手动控制,值从15开始试,每加5测试一次,直到不报 CUDA out of memory 为止。
路径三:报错 pip install -r requirements.txt 失败
这种情况多发生在你想用 vllm 或 transformers 跑服务化部署。B站教程可能没提,DeepSeek的依赖要求Python版本严格锁定在3.10-3.11。如果你用的是Python 3.12,安装 torch 时就会报找不到匹配版本。
# 强制使用Python 3.11虚拟环境
conda create -n deepseek python=3.11 -y
conda activate deepseek
# 先安装CPU版torch,再装其他依赖
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cpu
pip install transformers accelerate bitsandbytes
# 如果报bitsandbytes不兼容Windows,直接替换为
pip install bitsandbytes-windows
站长实测重点:Windows用户千万不要直接
pip install bitsandbytes,官方包不支持Windows。必须用社区维护的bitsandbytes-windows替代。这个坑在B站评论区至少出现了50次。
FAQ 常见疑问解答
问:B站教程里让修改 Modelfile 里的 FROM 路径,我改成绝对路径还是报错?
答:站长遇到同样问题。原因是Ollama不允许 FROM 指向 ~/.ollama/models 之外的目录。你需要先把GGUF文件放到 ~/.ollama/models 目录下,然后再写相对路径。或者直接用 ollama create 命令时,把文件放在当前目录下。
问:我的显卡是RTX 4060,但跑起来比B站UP主的3090还慢,为什么?
答:站长实测发现,B站很多教程没提功耗墙和散热限制。笔记本4060在满载时温度突破85度会强制降频。你需要用 nvidia-smi -pl 80 把功耗限制调低,同时用 watch -n 1 nvidia-smi 监控温度,如果超过80度,建议在机箱外加个风扇。这不是软件问题,是物理散热问题。
问:视频里部署成功后有个漂亮的Web界面,我怎么弄不出来?
答:那个界面通常不是DeepSeek自带的,而是UP主额外安装了 open-webui。你需要在启动Ollama服务后,再执行 pip install open-webui 然后 open-webui serve。注意:新版open-webui要求Ollama必须监听在 0.0.0.0 而不是 127.0.0.1。
# 设置Ollama监听所有接口
OLLAMA_HOST=0.0.0.0:11434 ollama serve
# 另开一个终端启动webui
open-webui serve --port 3000
问:make: command not found 怎么解决?
答:站长发现很多Windows用户用Git Bash执行Linux命令。你需要安装MSYS2或者用WSL2。最简单的方案是:在Windows下用 wsl --install 装Ubuntu子系统,然后在WSL内执行所有部署命令。B站教程如果没特意说明,默认都是在WSL2环境下录制的。
站长最后的排查清单
如果你按照上述步骤还是报错,请按以下顺序检查你的环境:
- 检查显卡驱动:运行
nvidia-smi,确认驱动版本大于530(否则CUDA工具包装不上)。 - 检查内存:部署7B模型至少需要16GB内存,如果只有8GB,请改用1.5B模型。
- 检查磁盘空间:量化模型文件约4.7GB,加上依赖库,至少预留15GB空间。
- 检查杀毒软件:Windows Defender会误杀
llama.cpp的临时文件,加入白名单。
站长在实测中还发现一个冷门问题:某些B站教程提供的 modelscope 下载链接失效,导致模型文件只有几KB。下载后先用 ls -la 看文件大小,如果小于1GB,说明下载不完整,重新下载即可。
最后,如果你卡在某个具体报错上,建议把完整的错误日志(不是截图,是文字复制)贴到评论区,站长会挑高频问题继续更新这篇排查指南。部署DeepSeek本身不难,难的是你电脑环境和UP主不一样——但只要按本文的路径走,就能绕开90%的坑。
相关 AI 排错与深度技术延伸
⚡ 开发者实操必备资源与算力限时特惠通道
阅读完本教程准备实操?站长已将 AI 部署排错手册、提示词全集与服务器限时优惠整理如下,即拿即用: