三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

《开源大模型食用指南》:3.2 万星的中文教程,手把手教你“吃“大模型

《开源大模型食用指南》:3.2 万星的中文教程,手把手教你“吃“大模型

最近在找中文圈的大模型教程,翻到了 Datawhale 的《开源大模型食用指南》(self-llm),GitHub 上 3.2 万 Star(截至撰稿时),全中文,而且是真的在"教",不是"列个目录就完事"。

名字起得就好。“食用指南”——吃大模型的指南。这种接地气的命名背后,是它跟那些翻译腔教程完全不同的定位:为国内初学者量身定做。

01中文大模型教程的两极分化

说实话,中文圈的大模型教程一直存在两个极端:

一个是"调用 API 教程"——教你申请个 Key、调几个接口,半小时学会,但学完只会调用别人的模型接口,并不懂本地部署、微调的完整流程;

另一个是英文教程的中文翻译——内容是好,但环境对不上:人家用 A100 集群,你用一张 4060;人家踩的坑跟你在国内网络环境踩的坑根本不是一回事。

《食用指南》恰恰填了中间那个空:基于 Linux、针对国内环境、从零开始,把本地部署和微调讲透。

02它到底教什么

项目的主要内容就四大块:

  1. Linux 环境配置——针对不同模型要求,给出详细的环境配置步骤

  2. 主流开源 LLM 部署——LLaMA、ChatGLM、InternLM、Qwen、DeepSeek 等国内外模型,逐个教

  3. 部署应用——命令行调用、在线 Demo 部署、LangChain 框架集成

  4. 模型微调——全量微调、LoRA、ptuning,由浅入深

注意这个顺序,它就是官方建议的学习路径:先环境配置,再部署使用,最后学微调。新手可以从 Qwen、InternLM、MiniCPM 这些模型先练手。

GitHub 页面顶部:仓库名 / star / README 简介与主要内容(来源:GitHub README)

03我最看重的:50+ 模型,每个都是真教程

这个项目最硬核的地方在这:仓库覆盖 50+ 主流大语言模型,绝大多数模型都配有从环境配置到跑通 Demo 的分步部署、微调教程,而不是只甩一个链接。Qwen3.5、MiniCPM5、Kimi-K2.5、DeepSeek-R1、GLM、Llama4、Gemma3、InternLM3、MiniMax、百川、Yi……国内外的都在里面。

而且它连国产硬件都照顾到了:AMD GPU(ROCm)专区、昇腾 Ascend NPU 专区、Apple M 系列专区,沐曦硬件适配教程尚在社区规划中。对国内用户来说,这解决了最大的现实问题——不是人人都有 N 卡,但人人都有台能跑模型的机器。

README「已支持 50+ 主流大语言模型」表格

AMD ROCm / 昇腾 NPU / Apple M 国产硬件专区

04 玩着学:Example 系列

教程容易枯燥,项目中也收录了不少社区热门实战案例的复现流程:

  • Chat-嬛嬛——用《甄嬛传》剧本里所有甄嬛的台词做 LoRA 微调,得到一个说话"阴阳怪气"的嬛嬛聊天模型,这个案例当年在圈子里传得特别广
  • 天机——人情世故社交场景的全流程应用,提示词工程、智能体、数据微调、RAG 一条龙
  • AMChat——基于 InternLM2-Math-7B 微调的高数解题模型
  • 数字生命——用作者本人的语料微调出一个"数字人"

这些案例大多来自社区,仓库给出了可以跟着跑通的复现步骤。

这些案例最大的价值是让人看到:微调不是实验室里的黑魔法,是每个人都能上手的事。

Example 系列案例截图(Chat-嬛嬛 / 天机 / AMChat / 数字生命)(来源:GitHub README)

05我喜欢的几个细节

  • 每个模型都是完整教程,不是链接。

很多项目号称"支持 XX 模型",点进去就一个 README 链接。它是一步一步写给你看的。

  • 学习路径清晰。

环境 → 部署 → 微调,官方直接告诉你顺序,还告诉你新手该从哪个模型开始,少走弯路。

  • 国产硬件覆盖。

AMD、昇腾、Apple M 都有专区,这是国内教程里极少见的。

  • 生态完整。

学完它,想深入原理有 Happy-LLM,想手写 RAG/Agent 有 Tiny-Universe,想学理论有 so-large-llm,想搞应用开发有 llm-universe——一个 Datawhale 把学习链路全包了。

06适合谁

  • 想本地跑开源大模型,但被环境配置劝退过的人
  • 不想只会调 API、想真正部署和微调模型的人
  • 学生党:没钱租 A100,就用自己电脑学,它连 AMD/Apple 芯片都教——不过部分大模型对显存依然有硬性门槛,优先选小参数模型在个人设备练习
  • 想给公司搭私有化大模型的人——部署、微调、服务化一条龙都有

深度思考与延伸

写这篇的时候我一直在想一个问题:为什么这种教程是中文社区长出来的,而不是从英文翻译来的?

答案其实藏在细节里。翻译腔教程默认你有一个"标准环境",而《食用指南》默认你只有一台普通电脑。它专门写 AMD 怎么写、昇腾怎么写、国内网络怎么配、4060 怎么凑合——这些是英文社区永远不会替你考虑的问题。这给我的启发是:好的产品不是"功能最多",而是"把目标用户的环境摸得最透"。做软件、做工具、做内容,道理都一样——你不需要覆盖所有人,你需要把一类人服务到极致。

第二层想法,关于"食用指南"这个名字。它把学习大模型这件事,从"研究"降维成了"吃饭"——先吃饱(把模型跑起来),再吃好(做微调),最后研究菜谱(底层原理)。这种降低心理门槛的设计,本身就是产品思维:用户不是不想学,是被"部署大模型"四个字吓住了。

第三层,也是老生常谈但我想再说一遍的:免费的教程解决"会用",解决不了"为什么"。跟着教程把 Qwen 微调出嬛嬛味,很爽,但那是别人的菜谱。真正属于自己的东西,是你从这些教程里提炼出方法后,动手解决自己工作里那个具体问题——那一步,教程帮不了你,只有你自己能走。

07结尾

项目地址:https://github.com/datawhalechina/self-llm(复制链接在浏览器打开)

如果你一直在"收藏大模型教程"但没真正跑通过一个模型,这篇就是给你的信号:找台 Linux 机器(或者虚拟机,Windows 用户可使用 WSL2),挑一个 Qwen 或 MiniCPM,从环境配置开始,跟着走一遍。跑通的那一瞬间,你会觉得大模型没那么神秘。

这里给大家精心整理了一份全面的AI大模型学习资源包括:AI大模型全套学习路线图(从入门到实战)、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等,资料免费分享

👇👇扫码免费领取全部内容👇👇

1. 成长路线图&学习规划

要学习一门新的技术,作为新手一定要先学习成长路线图方向不对,努力白费

这里,我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。

2. 大模型经典PDF书籍

书籍和学习文档资料是学习大模型过程中必不可少的,我们精选了一系列深入探讨大模型技术的书籍和学习文档,它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础(书籍含电子版PDF)

3. 大模型视频教程

对于很多自学或者没有基础的同学来说,书籍这些纯文字类的学习教材会觉得比较晦涩难以理解,因此,我们提供了丰富的大模型视频教程,以动态、形象的方式展示技术概念,帮助你更快、更轻松地掌握核心知识

4. 2026行业报告

行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5. 大模型项目实战

学以致用,当你的理论知识积累到一定程度,就需要通过项目实战,在实际操作中检验和巩固你所学到的知识,同时为你找工作和职业发展打下坚实的基础。

6. 大模型面试题

面试不仅是技术的较量,更需要充分的准备。

在你已经掌握了大模型技术之后,就需要开始准备面试,我们将提供精心整理的大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

7. 资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

← 返回列表