dify+ollama部署怎么用?小白极速入门保姆级教程

很多朋友想在自己电脑上跑一套私有化的大模型应用,又不想花钱买API,那dify+ollama部署就是最省事的组合。站长今天就手把手带你走一遍,保证你跟着做就能跑起来。

一、前置准备:先搞清楚你要装什么

⚡ 【免费资源】DeepSeek/Ollama 部署排错手册 + 全套 AI 提示词资料包

站长已将大模型部署排错指南、常用环境配置文件及 AI 提效指令库整合分享至夸克网盘,可极速免费转存:

👉 点击前往夸克网盘一键免费转存全套资料包

咱们这个方案一共就两个主角:Ollama负责在本地跑大模型,Dify负责给你一个可视化界面去搭建AI应用。你不需要懂代码,但得先把下面几样东西准备好。

1. 硬件要求

Ollama跑模型吃的是内存和显存。如果你只是体验,最低16GB内存起步,跑7B参数的小模型没问题。如果有独立显卡,比如RTX 3060 12GB或以上,那体验会好很多,能跑更大的模型。纯CPU也能跑,就是慢,适合测试流程。

2. 操作系统

Windows、macOS、Linux都行。站长建议Windows用户直接用WSL2,因为Dify的Docker部署在Linux环境下最顺。macOS用户注意芯片类型,M系列芯片跑Ollama有加速,很舒服。

3. 必装软件清单

  • Docker Desktop:Dify官方推荐用Docker Compose部署,这是最省心的方式。去官网下载对应系统的安装包,装完确保Docker服务在运行。
  • Git:用来拉取Dify的代码仓库,Windows用户装Git for Windows就行。
  • Ollama:去Ollama官网下载安装包,双击安装,一路下一步。装完在终端输入ollama --version能看到版本号就说明成功了。

4. 网络环境

拉取Docker镜像和Ollama模型都需要联网。如果你在国内,Docker镜像拉取可能会慢,建议提前配置好镜像加速器。Ollama的模型下载速度还行,但大模型文件动辄几个GB,耐心等一等。

二、极速操作步骤:从零到能用

🔥 【开发者算力福利】高并发 AI 部署 GPU / 独享云服务器限时特惠

本地算力不足或遇到 CUDA OOM 显存溢出?推荐搭配高性价比独享 GPU 云服务器:

👉 点击前往领取开发者限时优惠券

下面每一步你照着敲命令就行,站长尽量把命令写全,你直接复制粘贴。

第一步:安装并启动Ollama

去Ollama官网下载对应系统的安装包,安装完成后,打开终端(Windows用PowerShell或CMD,macOS用Terminal),输入:

ollama --version

看到版本号输出就说明装好了。接着咱们拉一个模型下来,新手建议先用qwen2.5:7b或者llama3.1:8b,中文支持好,体积适中。命令:

ollama pull qwen2.5:7b

下载完成后,测试一下模型能不能跑:

ollama run qwen2.5:7b

出现对话提示符就说明模型正常。你可以随便输入一句话测试,然后输入/bye退出。注意,Ollama默认监听11434端口,后面Dify要连这个端口。

第二步:部署Dify

打开终端,找一个你喜欢的目录,执行:

git clone https://github.com/langgenius/dify.git
cd dify/docker

进入docker目录后,先复制环境变量文件:

cp .env.example .env

Windows用户如果用的是PowerShell,用copy .env.example .env。然后启动Dify:

docker compose up -d

这个命令会拉取好几个镜像,第一次执行会比较慢,取决于你的网速。等所有容器都变成running状态,就说明Dify起来了。你可以用docker compose ps查看状态。

Dify默认的Web端口是80,如果你电脑上80端口被占用了,需要改.env文件里的EXPOSE_NGINX_PORT,比如改成8080。改完重新执行docker compose up -d

第三步:初始化Dify并接入Ollama

打开浏览器,访问http://localhost(如果改了端口就加端口号)。第一次访问会让你设置管理员账号和密码,填好之后登录。

登录后,点击右上角头像,进入设置,找到模型供应商。在列表里找到Ollama,点击进入配置。

这里关键的一步是填Base URL。如果你Dify和Ollama在同一台机器上,填http://host.docker.internal:11434。注意,不能填localhost,因为Docker容器里的localhost指向的是容器自己,不是你的宿主机。这是新手最容易踩的坑。

填完URL后,下面会列出你本地Ollama已经拉取的模型。选中qwen2.5:7b,点击保存。如果列表没出来,检查Ollama是否在运行,以及端口是否正确。

第四步:创建你的第一个AI应用

回到Dify首页,点击创建应用,选择聊天助手。给应用起个名字,比如“站长助手”。进入应用编辑页面后,在右上角选择刚才配置的Ollama模型。

然后在左侧的提示词区域,写一段系统提示词,比如“你是一个乐于助人的技术助手,用通俗易懂的语言回答问题”。保存后,就可以在右侧对话框里测试了。

如果你想让应用能回答私有文档的问题,可以在Dify里创建知识库,上传文档后,在应用里关联知识库,就能实现RAG检索增强。这一步站长后面单独写教程,今天先把基础跑通。

三、避坑提示卡片

💡 关联延伸阅读:如果你在配置过程中遇到相关报错,请参阅站长之前的解决教程:code-server ai插件安装后无法加载或报错怎么办?站长实测诊断与分步修复指南

坑1:Docker容器连不上Ollama

最常见的问题就是Base URL填了localhost。记住,Dify跑在Docker里,要访问宿主机的服务,必须用host.docker.internal。Linux用户如果这个域名不生效,可以改用宿主机的局域网IP,比如http://192.168.1.100:11434

坑2:Ollama默认只监听127.0.0.1

有些系统上Ollama只允许本机访问,Docker容器连不上。你需要设置环境变量OLLAMA_HOST=0.0.0.0,然后重启Ollama服务。Windows用户在系统环境变量里添加,macOS用户用launchctl setenv OLLAMA_HOST "0.0.0.0",Linux用户改systemd服务文件。

坑3:Docker镜像拉取超时

国内网络拉取Docker Hub镜像经常失败。解决办法是配置镜像加速器,在Docker Desktop的设置里找到Docker Engine,添加registry-mirrors。具体地址站长就不列了,网上搜“Docker镜像加速”有一堆可用的。

坑4:内存不够导致容器被杀

Dify整套服务加上Ollama跑模型,内存占用不小。如果发现容器频繁重启,用docker stats看看内存占用。建议至少给Docker分配8GB内存,跑模型再加8GB。Windows和macOS在Docker Desktop设置里可以调整资源限制。

坑5:模型下载慢或中断

Ollama拉取大模型时如果中断,重新执行ollama pull会断点续传。如果实在太慢,可以找国内镜像源,或者先用小模型把流程跑通,再换大模型。

四、跑通之后能干什么

到这里,dify+ollama部署就算完整跑通了。你可以用Dify的可视化界面搭建各种AI应用:智能客服、文档问答、内容生成、代码助手等等。所有数据都在你自己电脑上,不用担心隐私泄露,也不用给API付费。

站长建议你先用7B模型熟悉Dify的各种功能,等玩明白了再换更大的模型。如果觉得本地模型效果不够好,Dify也支持接入其他在线API,灵活切换。

整个部署过程最花时间的就是下载镜像和模型,真正操作也就十几分钟。遇到问题别慌,按照上面的避坑卡片逐一排查,基本都能解决。实在搞不定,把错误日志贴出来,站长看到会回复。

站长推荐
⚡ 开发者实操必备资源与算力限时特惠通道

阅读完本教程准备实操?站长已将 AI 部署排错手册、提示词全集与服务器限时优惠整理如下,即拿即用:

滚动至顶部