最近逛GitHub发现三个风格迥异但实用性拉满的项目——一个专治大模型微调的"万能工厂",一个能让AI自动画出漂亮架构图的"设计师",还有一个给Git提交把关的"质检员"。
本文从零开始,手把手讲清楚每个项目是干什么的、适合谁用、怎么装、怎么用。
🔧 一、LlamaFactory —— 大模型微调的"瑞士军刀"
仓库:github.com/hiyouga/LlamaFactory
定位:统一高效的大语言模型(LLM)与多模态模型(VLM)微调框架
Star:30k+ | 被Amazon、NVIDIA、阿里云等巨头采用
📖 它是什么?
如果把训练大模型比作开工厂,LlamaFactory就是那条全自动流水线。
传统微调需要你手动处理:数据格式转换 → 模型加载 → 训练参数调优 → 显存优化 → 评估 → 导出 → 部署。每一步都可能踩坑。而LlamaFactory把这些全部封装好了,你只需要填几张"配置表",就能启动训练。
🎯 核心能力一览
| 能力维度 | 具体支持 |
|---|---|
| 模型覆盖 | 100+ 模型,包括Llama、Qwen、DeepSeek、Gemma、GLM、Phi、Mistral、Mixtral等 |
| 训练阶段 | 预训练(Pre-training)、监督微调(SFT)、奖励建模(RM)、PPO、DPO、KTO、ORPO、SimPO |
| 优化技术 | LoRA、QLoRA(2/3/4/5/6/8bit)、GaLore、BAdam、APOLLO、DoRA、LongLoRA、PiSSA |
| 多模态 | 图像理解、视觉定位、视频识别、音频理解、工具调用 |
| 推理加速 | 集成vLLM、SGLang,支持OpenAI风格的API部署 |
| 界面工具 | 自带Gradio Web UI(LlamaBoard),零基础也能点鼠标训练 |
🏭 支持的模型家族(节选)
| 模型系列 | 规模 | 模板名称 |
|---|---|---|
| Llama 3-3.3 | 1B/3B/8B/70B | llama3 |
| Qwen3 | 0.6B-235B | qwen3/qwen3_nothink |
| DeepSeek-R1 | 1.5B-671B | deepseekr1 |
| Gemma 3 | 270M-27B | gemma3 |
| GLM-4 / GLM-Z1 | 9B-355B | glm4/glmz1 |
| Phi-4 | 3.8B/14B | phi4_mini/phi4 |
| InternVL 2.5-3.5 | 1B-241B | intern_vl |
| MiniCPM-o 2.6 | 8B | minicpm_o |
💡小提示:对于"base"基础模型,template可以选
default、alpaca等;对于"instruct/chat"对话模型,必须用对应的template,训练和推理时要保持一致。
🛠️ 安装配置
方式一:源码安装(推荐)
# 克隆仓库gitclone--depth1https://github.com/hiyouga/LlamaFactory.gitcdLlamaFactory# 安装核心依赖pipinstall-e.# 安装评估指标依赖(可选)pipinstall-rrequirements/metrics.txt方式二:Docker一键启动
dockerrun-it--rm--gpus=all--ipc=host hiyouga/llamafactory:latest镜像基于Ubuntu 22.04 + CUDA 12.4 + Python 3.11 + PyTorch 2.6.0,开箱即用。
Windows用户特别注意
需要手动安装GPU版PyTorch:
pip uninstall torch torchvision torchaudio pipinstalltorch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126 python-c"import torch; print(torch.cuda.is_available())"# 输出True即成功🚀 快速上手:三步跑通LoRA微调
以Qwen3-4B-Instruct为例:
第一步:微调
llamafactory-cli train examples/train_lora/qwen3_lora_sft.yaml第二步:推理测试
llamafactory-cli chat examples/inference/qwen3_lora_sft.yaml第三步:合并导出
llamafactory-cliexportexamples/merge_lora/qwen3_lora_sft.yaml🖥️ 可视化界面(新手友好)
llamafactory-cli webui启动后浏览器打开本地地址,可以:
- 📂 选择模型和数据集
- 🎚️ 拖动滑块调整学习率、批次大小等参数
- 📊 实时监控训练loss曲线
- 💾 一键导出训练好的模型
📊 显存需求参考
| 方法 | 精度 | 7B模型 | 14B模型 | 70B模型 |
|---|---|---|---|---|
| 全量微调 | bf16/fp16 | 120GB | 240GB | 1200GB |
| 全量微调 | pure_bf16 | 60GB | 120GB | 600GB |
| Freeze/LoRA | 16bit | 16GB | 32GB | 160GB |
| QLoRA | 8bit | 10GB | 20GB | 80GB |
| QLoRA | 4bit | 6GB | 12GB | 48GB |
| QLoRA | 2bit | 4GB | 8GB | 24GB |
💡QLoRA 4bit是平民玩家的福音:7B模型只需6GB显存即可微调,让个人开发者也能玩转大模型。
🌐 部署为API服务
API_PORT=8000llamafactory-cli api examples/inference/qwen3.yamlinfer_backend=vllmvllm_enforce_eager=true启动后,你可以像调用ChatGPT API一样调用自己的模型:
importrequests response=requests.post("http://localhost:8000/v1/chat/completions",json={"model":"your-model","messages":[{"role":"user","content":"你好"}]})🏗️ 二、archify —— AI驱动的架构图生成器
仓库:github.com/tt-a1i/archify
定位:Agent Skill(智能体技能插件)
支持平台:Claude Code、Cursor、Codex CLI、OpenCode、Raven、Warp、Zed等
📖 它是什么?
archify是一个给AI编程助手用的"画图技能"。
传统画架构图,你需要打开draw.io或Excalidraw,手动拖拽方框、连线、调颜色。而有了archify,你只需要对AI说一句话:
“Use archify to map this repository’s runtime architecture.”
AI就会自动分析代码结构,生成一张可交互的、带深色/浅色主题的系统架构图。
🎨 能画什么图?
archify支持五种专业级技术图表:
| 图表类型 | 英文名称 | 用途说明 |
|---|---|---|
| 🏛️ 架构图 | Blueprint | 展示系统模块划分与依赖关系 |
| ⏱️ 时序图 | Sequence | 展示模块间调用顺序与时间线 |
| 🌊 数据流图 | Signal Flow | 展示数据在系统中的流动路径 |
| 🔄 工作流图 | Workflow | 展示业务流程与状态转换 |
| ♻️ 生命周期图 | Lifecycle | 展示资源或对象的生命周期管理 |
🌟 核心亮点
1. 自然语言输入,专业图表输出
不需要懂任何绘图工具,用大白话描述系统,AI帮你转换成规范的架构图。
2. 五种视觉预设,一键切换
Blueprint:工程蓝图风格,适合技术文档Signal Flow:信号流风格,适合展示数据走向Classic:经典简洁风格,适合分享Dark/Light:深色/浅色主题,适配不同场景
3. 可交互,非静态图片
生成的不是死的PNG,而是自包含的HTML文件:
- 🔍 点击节点查看详情
- 🔗 追踪上游/下游依赖
- 🎬 播放"引导故事",按步骤讲解系统
- 📐 对比"变更前/变更后"的架构差异
4. 多格式导出
支持导出为:
- HTML(可交互)
- PNG / SVG(静态图片,插入文档)
- WebM(视频演示)
- 1200×630 分享卡片(适合发社交媒体)
🛠️ 安装方式
方式一:命令行安装(需网络通畅)
npx skillsaddtt-a1i/archify-g-g表示全局安装,所有项目可用。
方式二:手动安装(网络受限时使用)
# 1. 下载源码并解压到本地,假设路径为 /path/to/archify# 2. 复制到Agent的skills目录# Claude Code 示例:cp-r/path/to/archify ~/.claude/skills/archify# Cursor 示例:cp-r/path/to/archify ~/.cursor/skills/archify⚠️注意路径:确保
SKILL.md位于skills/archify/SKILL.md,不要嵌套成skills/archify/archify/SKILL.md。
🚀 使用示例
场景一:分析现有仓库
# 在Claude Code中直接说:Use archify to map this repository's runtime architecture.场景二:根据描述生成
# 描述你的系统,让AI生成架构图Use archify to create a blueprint of a microservices system with API Gateway, Auth Service, Order Service, Payment Service, and a PostgreSQL database.场景三:对比架构变更
# 对比两个版本的架构差异Use archify to compare the architecture before and after adding a Redis cache layer.📁 输出内容
archify生成的是一个自包含的HTML文件,里面包含:
- 类型化的JSON IR(中间表示)
- 确定性校验(确保图表与代码一致)
- 完整的CSS/JS(无需外部依赖,离线可打开)
✅ 三、no-mistakes —— Git提交的AI质检网关
仓库:github.com/kunchenguid/no-mistakes
定位:本地Git代理 + AI驱动的验证流水线
核心理念:让每一次提交都经过AI检查,防止"手滑"把Bug推上生产环境
📖 它是什么?
no-mistakes是一个安装在本地、工作在Git层面的"安检门"。
传统开发中,你写完代码直接git push,Bug可能就这样溜进了远程仓库。no-mistakes在中间加了一层代理:
你 → git push no-mistakes → AI检查流水线 → 通过 → 推送到远程 ↓ 未通过 → 本地拦截,显示问题🔄 完整工作流程
| 步骤 | 动作 | 说明 |
|---|---|---|
| 1 | git push no-mistakes <branch> | 开发者推送代码到本地代理 |
| 2 | 创建隔离Worktree | 在干净环境中运行检查,不影响你的工作区 |
| 3 | AI代码审查 | 检查代码质量、潜在Bug、安全问题 |
| 4 | 自动测试 | 运行测试套件,确保没有回归 |
| 5 | 文档检查 | 确认相关文档已更新 |
| 6 | Lint检查 | 代码风格、格式校验 |
| 7 | 推送到远程 | 全部通过后,自动推送到origin |
| 8 | 自动开PR | 可选:自动在GitHub/GitLab创建Pull Request |
🛠️ 安装配置
跨平台安装
# macOS / Linuxcurl-fsSLhttps://raw.githubusercontent.com/kunchenguid/no-mistakes/main/docs/install.sh|sh# Windows (PowerShell)# 下载release包或手动安装项目初始化
# 进入你的项目目录cdyour-project# 初始化no-mistakes网关no-mistakes init如果是给上游仓库提PR,需要指定fork地址:
no-mistakes init --fork-url https://github.com/your-username/your-fork.git🚀 日常使用
推送代码(改用no-mistakes):
gitpush no-mistakes main# 或gitpush no-mistakes feature/new-login查看检查结果(TUI界面):
no-mistakes会打开一个终端交互界面,显示:
- ✅ 通过的检查项
- ❌ 失败的检查项及详细错误
- 📝 AI给出的修复建议
查看帮助:
no-mistakes--help🎯 适用场景
| 场景 | 价值 |
|---|---|
| 👤 个人开发者 | 给自己加一道质量保险,减少"提交后才发现Bug"的尴尬 |
| 👥 小团队 | 没有专人做Code Review时,AI先帮你筛一遍 |
| 🎓 学习者 | 培养良好的提交习惯,理解什么是"干净的提交" |
| 🏢 企业团队 | 在CI/CD之前增加本地预审,减少流水线排队压力 |
🔌 支持的AI Agent
no-mistakes可以接入多种AI编程助手做审查:
- Claude
- Codex
- Cursor
- 其他支持OpenAI接口的模型
📊 三剑客对比总结
| 维度 | LlamaFactory | archify | no-mistakes |
|---|---|---|---|
| 核心定位 | 大模型微调框架 | 架构图生成Skill | Git提交质检网关 |
| 目标用户 | AI开发者/研究员 | 全栈工程师/架构师 | 所有使用Git的开发者 |
| 上手难度 | ⭐⭐⭐ 中等 | ⭐⭐ 简单 | ⭐⭐ 简单 |
| 是否需要GPU | 训练时需要 | ❌ 不需要 | ❌ 不需要 |
| 主要输出 | 微调后的模型权重 | 可交互的HTML架构图 | 干净的Git提交 |
| 安装方式 | pip / Docker | npx skills add / 手动复制 | curl安装脚本 |
| 社区活跃度 | 🔥🔥🔥 极高 | 🔥🔥 高 | 🔥🔥 高 |
🎯 写在最后
这三个项目代表了AI辅助开发的三个不同维度:
- LlamaFactory让你有能力定制AI——用自己的数据训练专属模型
- archify让你有能力可视化AI的理解——把抽象的代码结构变成直观的图表
- no-mistakes让你有能力约束AI的产出——确保AI生成的代码在提交前是干净的
它们可以单独使用,也可以组合成一套完整的工作流:
用 archify 理解项目架构 ↓ 用 Claude Code + AI 编写代码 ↓ 用 no-mistakes 检查提交质量 ↓ 用 LlamaFactory 微调专属模型技术工具的价值不在于它有多复杂,而在于它能否真正解决你工作中的痛点。希望这三个项目能给你的开发工作带来一些便利。
💬你在用哪些提升效率的开源工具?欢迎在评论区分享交流!
⭐ 觉得有用的话,点赞收藏不迷路,我们下篇见!