三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

上手LLaMA-Factory进行6B小模型微调

上手LLaMA-Factory进行6B小模型微调

学习大模型定制开发一定绕不开微调。如果用原生代码微调,不仅繁琐而且适配成本高,最终微调效果也不一定好。今天我们上手LLaMA-Factory模型微调框架,了解其中的原理与实操步骤,掌握单卡微调流程。

本文主要涵盖框架原理、LoRA核心技术、环境部署、数据集制作、训练调参、模型测试与权重合并全流程。

一、为什么选LLaMA-Factory微调ChatGLM3?

==================================

  1. 1什么是LLaMA-Factory?

LLaMA-Factory是当下主流的开源轻量化大模型统一微调框架,核心优势是一站式、低代码、多模型兼容,内置ChatGLM、LLaMA、Qwen等主流模型适配方案,无需改写底层代码,彻底简化微调流程。对比原生Transformers手写代码,它解决了三大核心痛点:

  • 低代码门槛:封装了模型加载、数据预处理、训练调度、日志记录等底层逻辑,无需手写PyTorch代码
  • 极致显存优化:原生支持LoRA、QLoRA、全量微调等多种模式,单卡即可微调6B、13B级大模型
  • 标准化流程:统一数据集格式、参数配置、训练脚本,复现性极强,适合快速落地
  1. 2为什么选择学习微调ChatGLM3-6B?

ChatGLM3-6B是智谱AI开源的轻量化中文大模型,中文理解与对话能力优异、推理速度快、算力门槛低,6B参数量完美适配个人开发者与中小企业轻量化微调的首选底座模型。原生ChatGLM3-6B具备不错的通用对话能力,但在垂直领域(金融、医疗、教育、企业知识库)问答精准度不足,而通过LLaMA-Factory微调,可低成本让模型适配专属业务场景。

二、核心原理:微调到底在“调什么”?

======================

  1. 1全量微调的弊端

传统全量微调会更新大模型全部参数,ChatGLM3-6B拥有60亿参数,全量微调需要数十GB高端显存,算力成本极高。同时易出现灾难性遗忘,模型学习新领域知识的同时,丢失原生通用对话能力,实用性极差。

  1. 2核心微调技术:LoRA原理与背景

LoRA(Low-Rank Adaptation,低秩自适应),是目前性价比最高的大模型高效微调方案,由微软研究院于2021年正式提出,属于主流PEFT(参数高效微调)技术,完美适配单卡微调6B、13B级大模型,也是LLaMA-Factory框架的默认优选微调模式。

LoRA核心基础原理:大模型预训练权重存在大量冗余,微调所需的参数更新仅存在于低维子空间中。基于这一特性,LoRA冻结预训练模型原始所有权重,不改动模型基座参数,在Transformer注意力层的Query/Key/Value核心矩阵中,插入两个小型可训练低秩矩阵A、B。训练过程仅更新这两个极小矩阵的参数,通过矩阵乘积模拟模型权重增量更新,间接实现模型场景能力适配。

LoRA核心优势(对应实操价值)

  • 显存极低:6B模型微调仅需8G-12G显存,普通消费级显卡即可运行
  • 降低遗忘:原模型参数完全冻结,保留通用对话能力,仅新增领域能力
  • 训练极快:参数量仅原模型的千分之一,训练轮次少、收敛速度快
  • 可复用性强:LoRA权重体积小(几十MB),可随时替换、叠加不同领域微调权重
  1. 3 LLaMA-Factory微调整体架构原理

LLaMA-Factory能兼容百种大模型、实现标准化微调,核心依托三层模块化架构,全程适配ChatGLM3模型特性:

  1. 模型加载层:自动识别ChatGLM3模型架构,加载预训练权重与Tokenizer,适配模型专属对话模板

  2. 数据处理层:自动完成数据集清洗、分词、padding、格式对齐,适配ChatGLM3输入输出规范

  3. 训练调度层:集成LoRA/QLoRA、混合精度训练、梯度累积、学习率调度,自动优化训练过程

三、实操前置准备:环境与硬件要求

====================

  1. 1硬件要求

本次采用LoRA微调,硬件门槛极低:

  • 最低配置:RTX 3060/4060(8G显存)
  • 推荐配置:RTX 3090/4090(24G显存,训练更稳定)
  • 内存:16G及以上,避免加载模型卡顿
  1. 2环境部署

适配Python3.9+、CUDA11.7+,完整部署命令如下:

克隆源码git clone https://github.com/hiyouga/LLaMA-Factory.gitcd LLaMA-Factory# 安装依赖pip install -e ".[torch,metrics]"# 额外适配ChatGLM3依赖pip install torch transformers accelerate peft bitsandbytes sentencepiece
  1. 3模型权重准备

提前下载ChatGLM3-6B模型,保存到本地目录,后续配置路径直接调用,避免在线下载卡顿。https://www.modelscope.cn/models/ZhipuAI/chatglm3-6b

四、关键步骤:自定义数据集制作

===================

微调效果的70%取决于数据集质量,LLaMA-Factory支持JSON格式问答数据集,格式极简、适配ChatGLM3对话逻辑。
  1. 1数据集标准格式

新建custom_data.json,统一采用「指令-输入-输出」结构,适配中文垂直场景:

[ { "instruction": "回答用户的垂直领域问题", "input": "什么是基金定投?", "output": "基金定投是指在固定的时间以固定的金额投资到指定的开放式基金中,无需择时,长期持有可平滑投资风险,适合新手投资者。" }, { "instruction": "回答用户的垂直领域问题", "input": "基金定投适合哪些人群?", "output": "基金定投适合没时间盯盘、投资经验不足、风险承受能力中等、想要长期理财的普通投资者,不适合短期投机、追求高收益的风险偏好者。" }]

如果你没有数据集,可以使用开源项目 BELLE 整理的数据集,这是一个涵盖多领域的中文训练数据集项目,下载你想使用的数据集然后通过AI工具转成上述格式即可使用。

下载地址:https://github.com/LianjiaTech/BELLE

  1. 2数据集配置生效

  1. 将制作好的 custom_data.json放入LLaMA-Factory/data目录

  2. 修改同目录下 dataset_info.json,添加自定义数据集配置:

{ "custom_data": { "file_name": "custom_data.json", "columns": { "instruction": "instruction", "input": "input", "output": "output" } }}

配置完成后,框架即可自动识别、加载自定义数据集。

五、核心实操:LLaMA-Factory微调ChatGLM3-6B完整命令

=========================================

采用命令行微调(稳定、可复现、适合落地),以下为适配ChatGLM3-6B的最优LoRA微调参数,可直接复制使用。

CUDA_VISIBLE_DEVICES=0 python src/train.py /--stage sft /--model_name_or_path /本地ChatGLM3-6B权重绝对路径 /--dataset custom_data /--template chatglm3 /--finetuning_type lora /--lora_target query_key_value /--lora_rank 8 /--lora_alpha 16 /--learning_rate 5e-5 /--num_train_epochs 3 /--per_device_train_batch_size 4 /--gradient_accumulation_steps 4 /--lr_scheduler_type cosine /--fp16 /--logging_steps 10 /--save_strategy epoch /--output_dir ./chatglm3-6b-lora-output /--overwrite_cache /--do_train
  1. 1参数逐行解析(看懂才会调参)

  • –stage sft:监督微调模式,是对话模型定制的标准模式
  • –template chatglm3:适配ChatGLM3专属对话模板,必须指定,否则格式错乱
  • –finetuning_type lora:启用LoRA微调,低显存、高效能
  • –lora_target query_key_value:锁定ChatGLM3注意力层核心矩阵,微调效果最优
  • –lora_rank 8/alpha 16:LoRA核心超参,8秩适配6B模型,兼顾效果与稳定性
  • –learning_rate 5e-5:6B模型学习率,避免不收敛/过拟合,可根据实际情况调整
  • –num_train_epochs 3:小数据集3轮足够,过多容易过拟合
  • –per_device_train_batch_size 4:每块GPU在一次前向传播和反向传播中读取训练数据的条数,可根据显存大小调整
  • –fp16:半精度训练,大幅降低显存占用,提速不减效果
  1. 2训练过程监控

启动训练后,终端会实时输出 loss 损失值:

正常状态:loss持续稳步下降,逐步收敛

异常排查:loss不变→学习率过高/数据集格式错误;loss震荡剧烈→批次大小过小

训练完成后,会在./chatglm3-6b-lora-output生成LoRA权重文件(仅几十MB)。

六、模型测试与权重合并

===============

  1. 1微调效果测试

通过框架自带推理脚本,加载LoRA权重测试对话效果:

python src/infer_demo.py /--model_name_or_path 本地ChatGLM3-6B权重路径 /--adapter_name_or_path ./chatglm3-6b-lora-output /--template chatglm3 /--finetuning_type lora
  1. 2 LoRA权重合并

LoRA微调不会修改原始模型参数,而是额外生成一组小规模Adapter权重。实际部署时,可以保持Adapter独立加载,也可以将Adapter与基础模型合并,生成完整模型用于部署:

python src/export_model.py /--model_name_or_path 本地ChatGLM3-6B权重路径 /--adapter_name_or_path ./chatglm3-6b-lora-output /--finetuning_type lora /--export_dir ./chatglm3-6b-final /--export_size 2 /--export_legacy_format False

合并完成后,chatglm3-6b-final即为最终可直接部署的定制化模型,可用于推理、API服务、知识库对接。

七、常见问题避坑指南

  • 显存溢出:降低batch_size、开启fp16、改用梯度累积,8G显存可稳定运行

  • 微调效果无提升:数据集质量差、问答对不标准、训练轮次不足或过拟合

  • 模型回答错乱:未指定chatglm3模板,模型对话格式不匹配

  • 训练loss不下降:学习率设置异常、数据集未正确加载、lora_target配置错误

    这里给大家精心整理了一份全面的AI大模型学习资源包括:AI大模型全套学习路线图(从入门到实战)、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等,资料免费分享

👇👇扫码免费领取全部内容👇👇

1. 成长路线图&学习规划

要学习一门新的技术,作为新手一定要先学习成长路线图方向不对,努力白费

这里,我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。

2. 大模型经典PDF书籍

书籍和学习文档资料是学习大模型过程中必不可少的,我们精选了一系列深入探讨大模型技术的书籍和学习文档,它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础(书籍含电子版PDF)

3. 大模型视频教程

对于很多自学或者没有基础的同学来说,书籍这些纯文字类的学习教材会觉得比较晦涩难以理解,因此,我们提供了丰富的大模型视频教程,以动态、形象的方式展示技术概念,帮助你更快、更轻松地掌握核心知识

4. 2026行业报告

行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5. 大模型项目实战

学以致用,当你的理论知识积累到一定程度,就需要通过项目实战,在实际操作中检验和巩固你所学到的知识,同时为你找工作和职业发展打下坚实的基础。

6. 大模型面试题

面试不仅是技术的较量,更需要充分的准备。

在你已经掌握了大模型技术之后,就需要开始准备面试,我们将提供精心整理的大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

7. 资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

← 返回列表