本地部署DeepSeek-R1 Windows电脑

📅 2026/8/3 6:26:39 👁️ 阅读次数 📝 编程学习
本地部署DeepSeek-R1 Windows电脑

了解一下大模型是个什么东西

llama

个人理解:这个是大模型的运行环境
以下解释来自网络:
这个单词原本是 Large Language Model Meta AI 的缩写,意思是“Meta 公司推出的大语言模型”。
为什么叫这个名字? 因为 Meta(也就是 Facebook 的母公司)在 2023 年推出了一款名为 LLaMA 的开源大模型。相比当时动辄几千亿参数的 ChatGPT,Meta 发布的 70 亿、130 亿参数的小模型效果惊人,瞬间引爆了整个开源 AI 圈。
为什么项目叫 llama.cpp? 因为作者 Georgi Gerganov 最初开发这个工具,目的就是为了在 C++ 环境下运行 Meta 的 LLaMA 模型。虽然现在这个工具已经能跑几百种其他模型(比如您正在跑的 DeepSeek 和 Qwen),但“Llama”这个名字作为元老被保留了下来。

环境搭建

1、下载deepseek最小的大模型文件

DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf
下载地址:https://hf-mirror.com/bartowski/DeepSeek-R1-Distill-Qwen-1.5B-GGUF
巡迅雷下载快,下载完成文件大小大概1.1G。

2、下载llama.cpp执行程序

直接下载压缩包解压即可:llama-b10223-bin-win-cpu-x64.zip
下载地址:https://github.com/ggml-org/llama.cpp/releases

3、尝试启动大模型

将下载的 gguf 文件放到 llama-b10223-bin-win-cpu-x64.zip 解压后的目录下,在解压后的而目录下打开cmd黑框,执行命令:llama-cli -m DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf -ngl 0 -p "你好,请介绍一下你自己"

llama-cli 这是 llama.cpp 编译出的命令行交互程序 -m 是 --model(模型)的缩写 ngl 是 --n-gpu-layers 的缩写;指定有多少层神经网络要放到显卡(GPU)上跑 -p 是 --prompt(提示词)的缩写

4、启动一个Web服务

执行:llama-server -m DeepSeek-R1-Distill-Qwen-1.5B-Q4_K_M.gguf -ngl 0 -c 2048 --temp 0.5 --host 0.0.0.0 --port 8080

llama-server 启动 llama.cpp 中的 Web 服务端程序 -c 是 --ctx-size(上下文长度)的缩写 --temp 0.5 控制回答的“发散度”和“稳定度”数值越低(如 0.1~0.2),模型越死板,数值越高(如 0.8~1.0),模型越“乱来” --host 0.0.0.0 允许局域网/外网访问;果写 127.0.0.1,则只有本机电脑能访问。写成 0.0.0.0,意味着这台电脑所在局域网内的所有其他设备 --port 8080 监听端口号

5、页面

可以进行一些简单逻辑性问题分析回答。