Ollama 本地部署 DeepSeek 完全指南:macOS / Windows / Linux 三端安装 + GPU 配置 + API 调用

📅 2026/7/24 11:46:36 👁️ 阅读次数 📝 编程学习
Ollama 本地部署 DeepSeek 完全指南:macOS / Windows / Linux 三端安装 + GPU 配置 + API 调用

发布日期:2026-07-22 | 关键词:Ollama / DeepSeek / 本地部署 / LLM

Ollama 是目前最流行的本地大模型运行工具,GitHub 累计176,741 Star,底层基于 Georgi Gerganov 的 llama.cpp 项目,支持 macOS、Windows、Linux 三端一键安装,三条命令即可在本地跑起 DeepSeek-R1。本文基于 Ollama 官方文档和模型库,完整覆盖三端安装流程、NVIDIA / AMD GPU 驱动配置、DeepSeek 各版本显存需求对照、REST API 调用,以及 Open WebUI 可视化界面搭建,适合零基础到有经验的开发者。


先看硬件:你的显卡能跑哪个版本?

DeepSeek 模型按参数量分多个档位,选错了要么跑不动,要么速度极慢。以下是 Ollama 官方模型库的实际文件大小与推荐配置:

模型版本文件大小上下文推荐显存适合场景
deepseek-r1:1.5b1.1 GB128K4 GB+入门体验,M 系列 Mac / 低端 PC
deepseek-r1:7b4.7 GB128K8 GB+日常使用首选
deepseek-r1:8b(latest)5.2 GB128K8 GB+当前默认版本(Qwen3-8B 蒸馏)
deepseek-r1:14b9.0 GB128K16 GB+效果更好,RTX 3080 / M2 Pro
deepseek-r1:32b20 GB128K24 GB+高质量推理,RTX 4090 / M3 Max
deepseek-r1:70b43 GB128K多卡或 48 GB+接近满血效果
deepseek-r1:671b404 GB160K多卡服务器完整模型

deepseek-v3:671b 同样需要 404 GB,需 Ollama v0.5.5+,适合服务器部署。

GPU 兼容性快速检查:

  • NVIDIA:计算能力 5.0+(GTX 750 Ti 及以上)、驱动版本 550+,RTX 20/30/40/50 全系支持
  • AMD:Linux 需 ROCm v7,支持 RX 6000/7000/9000 系列;Windows 仅支持 RX 7000 系列
  • Apple Silicon:M1 / M2 / M3 / M4 全系支持,统一内存直接当显存用,16 GB 内存可流畅跑 14b

macOS 安装

方法一:命令行(推荐)

curl-fsSLhttps://ollama.com/install.sh|sh

方法二:图形界面安装

前往ollama.com/download下载Ollama.dmg,拖入应用程序文件夹,双击启动。

安装完成后,菜单栏出现 Ollama 图标即代表服务已在后台运行(默认监听localhost:11434)。

拉取并运行 DeepSeek-R1:

# 拉取默认版本(8b,5.2 GB)ollama pull deepseek-r1# 直接运行(自动下载+启动交互对话)ollama run deepseek-r1# 指定版本ollama run deepseek-r1:14b

下载完成后,终端出现>>>提示符即可直接对话。输入/bye退出交互模式,模型仍在后台保持加载状态。


Windows 安装

方法一:PowerShell 一键安装

irmhttps://ollama.com/install.ps1|iex

方法二:图形界面安装

前往ollama.com/download下载OllamaSetup.exe,双击安装,完成后系统托盘出现 Ollama 图标。

确认服务运行:

# 检查服务状态curl http://localhost:11434# 拉取模型ollama pull deepseek-r1# 运行ollama run deepseek-r1

多 GPU 配置(NVIDIA):

如果有多张显卡,可以通过环境变量限制 Ollama 使用哪张:

# 查看 GPU UUIDnvidia-smi-L# 指定使用第一张卡(在系统环境变量中设置)$env:CUDA_VISIBLE_DEVICES ="0"

Linux 安装

一键安装脚本:

curl-fsSLhttps://ollama.com/install.sh|sh

安装完成后 Ollama 会自动配置为 systemd 服务。

NVIDIA GPU 配置

# 验证 GPU 驱动(需要 550+)nvidia-smi# 确认驱动版本nvidia-smi --query-gpu=driver_version--format=csv,noheader

如果驱动版本低于 550,前往 NVIDIA 官网下载最新驱动后重新运行安装脚本。

Linux 休眠唤醒后 GPU 丢失问题:重新加载驱动模块:

sudormmod nvidia_uvm&&sudomodprobe nvidia_uvm

AMD GPU 配置(ROCm v7)

# 安装 ROCm(参考 AMD 官方 amdgpu-install 工具)# 安装完成后下载 Ollama ROCm 扩展curl-fsSLhttps://ollama.com/download/ollama-linux-amd64-rocm.tar.zst\|sudotarx-C/usr

如果你的 AMD GPU 不在官方支持列表,可以尝试强制指定最近的 LLVM target,例如 RX 5400(gfx1034)可以尝试使用 gfx1030 的参数:

exportHSA_OVERRIDE_GFX_VERSION="10.3.0"

配置为 systemd 服务(生产环境推荐)

安装脚本已自动创建服务,手动管理命令:

# 查看服务状态sudosystemctl status ollama# 设置开机自启sudosystemctlenableollama# 重启服务sudosystemctl restart ollama# 查看日志journalctl-uollama-f

自定义配置(如修改监听端口或开启远程访问):

sudosystemctl edit ollama

在弹出编辑器中添加:

[Service] Environment="OLLAMA_HOST=0.0.0.0:11434"

常用命令速查

# 查看已下载的模型ollama list# 删除模型ollamarmdeepseek-r1:7b# 更新模型ollama pull deepseek-r1# 查看模型详情ollama show deepseek-r1# 后台运行服务(不启动终端 UI)ollama serve

REST API 调用

Ollama 在本地11434端口提供完整的 REST API,兼容 OpenAI 接口格式:

# 基础对话curlhttp://localhost:11434/api/chat\-d'{ "model": "deepseek-r1", "messages": [{"role": "user", "content": "用 Python 写一个快速排序"}], "stream": false }'

Python 调用:

pipinstallollama
fromollamaimportchat response=chat(model='deepseek-r1',messages=[{'role':'user','content':'用 Python 写一个快速排序'}])print(response.message.content)

JavaScript 调用:

npmi ollama
importollamafrom'ollama'constresponse=awaitollama.chat({model:'deepseek-r1',messages:[{role:'user',content:'用 Python 写一个快速排序'}]})console.log(response.message.content)

本地资源不足时,也可以通过支持 OpenAI 兼容接口的云端服务补充——例如七牛云 AI 推理服务提供 DeepSeek 系列模型的 API 接入,只需将base_url替换即可,代码结构与本地调用完全一致。


搭一个可视化界面:Open WebUI

不想用命令行,可以用Open WebUI,Docker 一条命令搞定:

dockerrun-d\-p3000:8080\--add-host=host.docker.internal:host-gateway\-vopen-webui:/app/backend/data\--nameopen-webui\--restartalways\ghcr.io/open-webui/open-webui:main

浏览器打开http://localhost:3000,在设置中将 Ollama API 地址填入http://host.docker.internal:11434,即可在 Web 界面与本地 DeepSeek 对话。


常见问题

Q:ollama run后模型下载很慢,能加速吗?
Ollama 模型托管在 Cloudflare,国内直连速度因网络环境差异较大。可以在ollama pull命令前设置代理:

exporthttps_proxy=http://127.0.0.1:7890 ollama pull deepseek-r1

或者在局域网内搭一台已经下好模型的机器,通过OLLAMA_HOST=0.0.0.0开启远程访问,其他机器直接用。

Q:CPU 能不能跑?
能,但很慢。Ollama 在没有 GPU 时自动回退 CPU 推理,7b 模型在 CPU 上大约每秒 3-8 个 token。1.5b 模型 CPU 体验相对可接受,14b 以上建议有 GPU 再运行。

Q:M 系列 Mac 怎么最大化利用统一内存?
Ollama 会自动调度 Apple Neural Engine + GPU,无需额外配置。M2 Pro(16 GB)跑 14b 问题不大;M3 Max(36 GB)可以流畅跑 32b。注意不要同时开其他内存占用大的应用。

Q:Ollama 更新后模型需要重新下载吗?
不需要,模型文件存储在独立路径(macOS/Linux:~/.ollama/models;Windows:C:\Users\<用户名>\.ollama\models),Ollama 版本更新不影响已下载的模型。


结语

Ollama 把本地大模型部署的门槛压到了极低——三端安装命令都在 1-2 行之内,DeepSeek-R1 的 8b 版本在任何有 8 GB 显存的机器上都能流畅运行。从 1.5b 到 671b,覆盖了从入门体验到生产部署的完整参数区间,MIT 协议可商用。

Ollama 官方 GitHub 最后更新于 2026 年 7 月,GPU 支持文档涵盖 NVIDIA RTX 50xx 最新架构和 AMD ROCm v7 全系支持,本文所有命令基于当前官方文档,建议定期访问docs.ollama.com获取最新信息。


延伸资源

  • Ollama 官网:ollama.com
  • DeepSeek-R1 模型库:ollama.com/library/deepseek-r1
  • Open WebUI:github.com/open-webui/open-webui
  • 云端 DeepSeek API 接入:qiniu.com/ai/plan