【LLM】第一章:知识体系框架概览
大模型,具体说就是大语言模型,LLM,large language model,这个领域其实就是NLP,所以本专栏也是NLP专栏的延续,是NLP的高阶内容。
我的NLP专栏的链接是: https://blog.csdn.net/friday1203/category_12833594.html?spm=1001.2014.3001.5482
想真正学习的同学,建议从NLP看起,如果NLP也看不懂就从机器学习看起。正确的学习路径是:机器学习-深度神经网络-->卷积神经网络-->NLP-->transformer-->LLM,这样一个环环相扣、逻辑链条完整的路径。
一、大模型研发的演化史和竞争态势
在transformer之前,NLP领域都是基于深度神经网络RNN、LSTM、GRU等架构,学习文本数据的特征向量。2017年transformer横空出世后,极大的提升了文本数据的理解和生成能力,迅速成NLP领域绝对主流的网络架构。目前市面上的所有大模型基本都是从transformer进化而来的,当前大热的GPT、BERT、Llama、Claude、文心一言等大语言模型(Large Language Model,LLM)都以Transformer或者其变种作为主干网络。
所以本专栏默认你对transformer的边边角角的细节都是非常清晰的。我NLP专栏中的Transformer总共写了10万多字,相关细节数100个都不为过,所以没有Transformer底子的同学,最好是先补基础,再图进阶。
(一)国际大模型的研发态势
1、从0到1:谷歌的transformer横空出世
2017年,谷歌机器翻译团队发表的《Attention is all you need》论文,以seq2seq架构(编码器-解码器,Encoder-Decoder)为基础、完全基于自注意力机制,提出了全新的Transformer模型架构。Transformer迅速成为自然语言处理领域绝对主流的网络架构。
2、OpenAI押宝生成技术:进入GPT时代
OpenAI是2015年12月由萨姆·奥尔特曼、埃隆·马斯克等在美国旧金山创立的人工智能研究公司,核心使命是开发安全的通用人工智能(AGI),其实这个公司和微软有关,是微软投资的。核心产品有:ChatGPT系列、GPT-4/GPT-5系列大模型、Sora(文生视频)、DALL·E 3(文生图)、Whisper(语音识别)等。
事实上,Transformer之后,大家对人工智能的技术发展方向也是迷茫的,彼时谷歌认为首先要让模型像人类一样对自然语言能够理解,所以未来的技术方向应该是编码器。新贵OpenAI为了和老牌谷歌形成错位竞争,押注了解码器方向,也就是自然语言生成方向,也就是transformer的生成部分,于2018年6月提出了第一个生成模型:GPT。人们第一次看到对话模型的智能,GPT迅速在C端的对话领域火爆起来,开启了普通大众对人工智能的无限憧憬和遐想。同时OpenAI也第一个系统性提出预训练+微调范式的语言模型。
3、谷歌押宝编码方向:开启自然语言理解的bert时代
同一时期,谷歌押注的是transformer的编码部分。2018年10月,Google发布BERT,走的是模型对自然语言的理解路线,也就是语义表示路线。也是预训练+微调的范式。
BERT自诞生起就横扫NLP领域11项目任务的最佳成绩!在BERT出现之前,NLP领域占据统治地位的是LSTM和GRU模型,但是BERT出世后,基本就是NLP领域的标配了。其强大的自然语言表示能力,被广泛应用于文本分类、序列标注,比如命名实体识别、句子匹配等场景。但缺点是通用性比较差,不同任务得不同的任务头,不同任务头得继续训练,所以通用性比较差。
4、大一统:T5时代
尽管BERT也取得了极大的成功,但BERT主要成果是在B端,大众无法直接感知,不像GPT那样火爆在媒体的聚光灯下,谷歌作为transformer的造物主,也改变了之前技术路线的押宝策略,于2019年火速推出Text-To-Text Transfer Transformer (T5)模型,将所有NLP任务统一为文本生成问题。就是所有NLP任务都可以被转换为统一的文本到文本格式,任务的输入和输出始终是文本字符串,开启了模型统一的时代。并且开启了transformer + 预训练 + prompt的范式的训练,实现了“通用模型上的多任务”的实现方式。特点是:自监督、一次训练多任务。主打降成本、一模型多用处。
5、大模型研发进入多模态混战时代
(1)谷歌推出Gemini全能系列,可以同时处理文字、图像、声音等信息。大模型竞争进入多模态时代,听说读写样样都可以,文字、视频、声音、图像, 都是可以处理的。
(2)OpenAI除了继续在聊天领域发力,同时积极寻找细分领域发力,比如编码、数学等细分领域,进行错位竞争。
此时,自然语言大模型和人工智能、通用人工智能AGI深度绑定,大家一致任务AI/AGI的技术方向就是大模型,于是资本纷纷入场,有实力的大厂和实验室开始研发自己的大模型,后起之秀主要有:Meta的Llama系列开源大语言模型、Anthropic的Claude系列大模型、亚马逊的Nova系列多模态模型。
(3)Meta的Llama系列
Meta,元宇宙,前身FaceBook,作为后来者,以低训练成本、开源对话模型为定位,切入大模型竞争。2023年发布Llama系列开源大语言模型,用极低的成本接近GPT-3.5的问答效果。核心创新是小基座+少量指令数据,就可以做出可聊天AI,引爆开源大模型生态,用极低的门槛、不依赖OpenAI闭源API,普通人、小团队也能自制对话AI,开启了全球开源大模型"百模大战"。Llama 405b在对话领域效果是仅次于OpenAI的。Meta凭借高性能和开放策略迅速成为开源社区的核心基座模型。截至2026年7月,该系列已迭代至Llama 4,并在多模态处理、推理效率及终端侧部署上取得了显著突破。
(4)Anthropic的Claude系列
Anthropic是一家主打“安全优先”的美国旧金山的一家人工智能公司,由OpenAI前高管达里奥·阿莫迪(Dario Amodei)和丹妮拉·阿莫迪(Daniela Amodei)兄妹于2021年创立,核心团队多来自OpenAI的GPT-2、GPT-3研发阵营 。核心产品是Claude系列大模型。公司主打解决大模型幻觉问题:Claude系列是在生成的基础上添加了价值导向,就是不会给你胡编乱造。
(5)亚马逊的Nova系列
2024年,亚马逊推出的Nova系列多模态模型,Nova Pro性能接近Claude 3.5, 多模态的概念现在已经从文生图、文生视频,进化为Any to Any, 将多模态推到极致。
6、多领域混战
在某个细分领域发力。比如有的专注聊天领域、编码领域、数学领域等。比如:
(1)聊天领域的:OpenAI的ChatGPT
(2)coding能力最强的模型:也就是编码能力,OpenAI o1 -- Claude 3.5 Sonnet -- GPT-4o
(3)数学领域最强的模型:OpenAI o1 -- GPT-4o -- Nova Pro
(4)解决推理能力的:多任务推理能力(Multitask Reasoning)最强的是OpenAI的O系列,这个领域openai公司的模型是遥遥领先的,其O1,O2的推理能力非常强,O3正在开发中。推理能力就是"模型在回答问题的时候,会有一个推理的过程"。O系列的推理能力非常强。
(二)国内的大模型竞争态势
1、从技术创新上看,国内的技术贡献是专家模型,MoE系列,mixture of expert,以及与之对应的负载均衡技术。
2、从细分领域来看:
(1)对话模型:最好的是字节的doubao-pro-32k模型,其次是百度的文心4.0(ERNIE 4.0 Turbo),Turbo采用混合专家系统(MoE)架构,通过动态路由机制将任务分配至2048个专家子网络。
(2)视觉模型:最好的GPT-4o-20241120, 其次是Doubao-Pro-Vision-32k-24102b、Claude-3.5-Sonnet-20241022
(3)文成图模型:最好的是华为的Hunyuan-Image, 其次是Doubao Image v2.1
(4)开源模型:阿里的通义千问Qwen2.5-72b-Instruct, 其次是Deepseek-V2.5、Llama-3.1-405B-Instruct。国内小团队利用开源模型做开发、部署,基本也就是上面这3款基座模型可选。
3、国内开源的有:通义千问的Qwen-Turbo、质谱的GLM-4-plus、deepseek-chat。其中:
(1)质谱AI
2019年成立,源自清华计算机系知识工程实验室,核心团队是清华唐杰教授、张拔院士团队,位于中关村,港股上市,是全球首个大模型上市公司,chatGLM、质谱清言、CogVLM多模态、CodeGeeX都是质谱公司的。
(2)deepseek
DeepSeek-V2:通用对话大模型
DeepSeek-R1:深度推理模型,对标OpenAI o1
DeepSeek-Coder代码专用模型
DeepSeek-VL多模态视觉模型
deepseek是由量化私募幻方量化创始人梁文锋,于2023年7月在杭州独立创办的,是幻方专门拆分出来做通用大模型的全资AI子公司。绝大多数模型开源、允许商用。
说明:上面提到的大模型都是已经有比较大用户量的模型,其实现在每天都有数百上千的大模型在发布。
(三)大模型的终极目标:AGI
大模型的终极目标是AGI,通用智能,Artificial General Intelligence, 具备多领域能力、自主意识、硅基生命。
今年年初美国投资5000亿美金启动星际之门计划,解决开发大模型需要的算力、电力、数据等问题,目标是实现AGI。
二、大模型的研发技术
1、NLP建模范式的变化
大模型的建模范式和我们之前的任务都不一样,下面从建模范式出发梳理一下大模型的两个相关概念:预训练模型(Pre-trained Model)、迁移学习(Transfer Learning)。
何为大模型?大模型不仅仅是大语言模型这么单一的定义,从技术角度看,大模型其实就是一个预训练模型。那么又何为预训练模型?
预训练模型是指模型已经在大规模数据集上训练好了。就是这个模型已经见过几乎所有的样本了,而且在这些样本上已经收敛的很好了。
模型已经见过几乎所有的样本,就是这个模型已经是这个领域的通用模型了,因为它学习了几乎所有的样本。
模型已经在这些样本上收敛的很好了,就是说这个领域的基本的、普遍的、大众的规律,这个模型已经掌握了,就是这个模型可以提取这个领域的普适特征和规律了。
这就好比一个让一个识字的人去看医书,这个识字的人就是一个预训练模型,或者说是一个通用模型。这个识字的人学习医术的过程就叫迁移学习(Transfer Learning),就是把一个大型数据集上学习到的知识迁移到另一个相关但不同的任务上。
如果你让一个不识字的人去看医书,这个人还得从先识字开始学,识完字了才能学医,那这个人就不是一个预训练模型。这个人得从0开始学习,就要费劲很多。
所以我们都喜欢预训练模型,因为让一个预训练模型去学习医学、法律、会计、计算机等等专业领域,它起步很高,能很快在这些专业方向学出规律,省劲儿并高效嘛。
简言之:预训练模型就是一个通用模型,迁移学习就是微调,微调的目的是让通用模型变成专业模型,赋能各行各业。
2、大模型研发:预训练阶段
大模型研发指的就是如何训练一个预训练模型。上面大模型演化史中提到的所有大模型其实都是预训练模型。而要训练一个预训练模型,得有强大的算力支持、得有海量且巨量的训练数据,这些都不是小团队可以做到的,所以大模型的研发基本都是大厂或者有实力的科研单位的专属,小公司小团队基本没戏。
然而除了强大的财力支持,前沿的技术支持也是必不可少的,各大厂穷尽才思,各种五花八门的训练技术、降本增效方法层出不穷:
比如在提升模型对自然语言的理解方面,通过在大规模没有标注的语料上,通过挖空,让模型填坑的方式,或者通过比如前面任务中的使用滑窗自动生成特征和标签的方式,亦或者通过输入一个序列,让模型rightshift一个位置,原封不动输出这个序列的方式,让模型学习大规模语料中的词汇、句法和上下文等通用的语言规律。
比如在降低成本方面,通过自动语料生成、构建大规模预料库等任务,来降低训练大模型的成本。
3、预训练模型的分类
目前市面上的预训练模型的基础架构基本上都是Transformer。我们知道Transformer是编码器-解码器的架构,其中编码器是进行特征提取或者特征压缩的过程,解码器是进行特征还原或者特征解压的过程。所以编码器可以做情感分类、文本分析等任务,而解码器可以生成任务。所以根据使用Transformer的不同方式,预训练模型分:
(1)编码器(Encoder-only)模型:仅使用Transformer的编码器,代表模型为BERT, Bidirectional Encoder Representations from Transformers,由Google于2018年10月提出,论文是《BERT:Pre-training of Deep Bidirectional Transformers for Language Understanding》。就是一个上下文相关的词表示模型。
(2)解码器(Decoder-only)模型:仅使用Transformer的解码器,代表模型为GPT,Generative Pre-trained Transforer,由OpenAI于2018年6月提出,论文是《Improving Language Understanding by Generative Pre-Training》。
(3)编码器-解码器(Encoder-Decoder)模型:同时使用Transformer的编码器和解码器,代表模型是T5,Text-to-Text Transfer Transformer, 由Google于2019年10月提出,论文是《Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer》。这里的Transfer就是迁移学习的意思,也就是预训练模型+微调的意思。
也所以此后我们直接将transformer的编码器叫BERT,transformer的解码器叫GPT。后面我会对GPT、BERT、T5这三个模型分别整理一个篇章,详细写这三个模型的细节问题。这3个模型是整个AI领域的原理基础,彻底理解了这3个模型,理解AI领域的其他大模型就非常简单了,因为此后的大模型基本就是在这3个模型的基础上堆参数、堆数据量,scaling出来的。
自GPT、BERT、T5等模型发布以来,基于Transforer的预训练模型呈爆发态势,大家争先恐后的在模型架构上增加层数,扩大模型深度,增加模型参数,也就是后来的Scaling竞赛,大力出奇迹,大模型的预测能力也持续提升,直到Scaling不动才消停。下图是2008年至2023年间具有代表性的预训练模型及其发展脉络:
4、大模型效果评价平台
GLUE Benchmark是自然语言处理(NLP)领域用来给AI模型“打分”的一套标准考试题,全称为The General Language Understanding Evaluation(通用语言理解评估)。它由纽约大学等机构在2018年推出,目的是通过不同的任务,全面测试模型能不能读懂人类语言,比如判断句子情感、逻辑关系或语义相似度 。如果你想查看官方榜单或下载数据,可以访问GLUE官网:GLUE Benchmark
本系列后面将讲的一些模型,比如BERT、T5等,它们的benchmark都是使用该网站上的数据集测评出来的分值:如果你对你的模型非常自信的话,就用上面的数据集去测试一下,能排到前列是非常牛的。
三、大模型的微调技术
微调fine-tune,为什么要微调,其实前面已经说过了,微调是让模型从通用模型变成专业模型。这里我再从大模型的痛点角度阐述一下为什么要微调,因为当下几乎所有的微调技术都是为了应对大模型的痛点而诞生的,所以从这个角度我们可以深刻理解,为什么会出现五花八门、各种各样的微调技术。
(一)预训练模型的痛点
预训练模型只是见过几乎所有的语言样本,而且在这些样本上已经收敛得很好了,也就是说,预训练模型仅仅只是理解了自然语言的语言规律,至于语言承载的意识,大模型是无能为力的。所以大模型(也就是预训练模型)的痛点有下面几点:
(1)无法访问实时数据。预训练时,被投喂的是啥数据,就学的是啥数据,对新数据、实时数据,大模型是不会的。
(2)大模型生成的内容,是无法符合人类价值观的。比如生成黄色内容、不道德内容等。
(3)大模型是会胡乱生成内容的,比如是会胡说八道的,我们也叫模型幻觉。
(4)大模型更是无法直接操作外部工具的。
上述的痛点限制了大模型的使用场景,似乎大模型只能聊天,这严重制约了大模型赋能各行各业的美好期愿。所以针对这些痛点,人们研发了对应的微调技术。
(二)大模型的微调技术
1、学习新知识方面
(1)添加任务头的微调Fine-tuning,也叫有监督的微调SFT。
在前面NLP专栏里,我写过两个实操项目,从中可以看出:针对不同的任务,我们要根据具体任务的特点,开发出适配这个任务的任务头,然后再训练模型,直到模型达到任务预设的精度,才算是完成了任务。
所以SFT就是将预训练模型迁移至具体任务,比如医疗、法律等专业领域。具体操作就是使用这些专业领域的少量标注数据微调(fine-tune)模型,直到模型效果达到预期,从而赋能专业领域。也就是前面说的预训练+微调的建模范式,目前这种建模范式已经成为当前NLP的主流技术路线,广泛应用于文本分类、问答系统、翻译、对话等任务中。
然而这种微调方式成本也非常高,因为:一是任务头需要用大量专业数据微调模型,而且每种任务需要的数据和标签都不一样,数据和标签又是严重依赖人工标注的,那这个时间成本和资金成本就非常高昂了。二是需要计算资源GPU,三是全参微调的时间成本也是非常高的。所以市面上又出现了低成本微调技术:
(2)低成本微调:lora低秩微调
lora是微调技术的基石,是入门微调的基础技能。 低秩微调lora-->Qlora(用量化解决显存问题)-->AdaLoRA(解决的是秩分配均匀的问题)-->DoRA(提高模型性能的),这是lora微调及其变体,此外还有下面等策略:
a、基座模型+lora适配器
b、不调基座模型的参数,只训练lora适配器
c、不同任务训练不同的lora适配器
2、实时知识更新方面
SFT和lora微调都是一次训练,但不能解决实时感知的问题,就是无法进行实时知识更新。所以又诞生了下面的微调技术:
(1)RAG
可以很好的解决实时知识更新的问题,把专业数据或者实时数据loading--chunking--embedding到vector database, 当用户输入问题时rag 系统先通过问题在vector database中索引可能的答案,然后把索引结果和用户问题打包成data augmented prompt发给大模型,大模型生成答案,返回给用户。这就可以很好的解决私有数据、实时数据的问题。
(2)嵌入embedding
成本较低,比较灵活,不需要训练,相当于给大模型做了个外挂,需要的时候才调用这个外挂,所以一定程度上可以解决实时感知新信息的问题。比如今年最新的数学题,你可以通过embedding的方式存储到其他地方,需要的时候再调用。
3、模型价值观问题
(1)RLHF强化学习(对齐) 通过引入强化学习,让模型学习人类的偏好,这样模型生成的内容就会更加的遵守人类的指令。
用一个小数据集跑强化学习的成本也是非常高的,所以强化学习都是大厂在搞。
4、模型幻觉问题
就是解决模型胡说八道的问题,最轻量的解决方式是Prompt engineering, 提示词工程。
(1)硬提示词
(2)软提示词soft prompt
就是更改输入数据的前面部分维度,进行全参微调。比如提示词前缀微调方法prefix tuning、比如百倍效率提升的微调方法P-Tuning V2。
5、操作外部工具,更智能一点
Al agent-->人形机器人-->具身智能,就是给硬件(机器人)安装智能体agent,让硬件自己去感知周围、自己去学习,从而让硬件具备思考推理能力。也就是用AI agent做下游开发和应用。
四、大模型的下游应用开发
(一)大模型行业应用
基座大模型--->行业垂直大模型--->AI-Native开发大模型应用To B/C--->app+API
1、基座大模型:就是目前各大有实力的大厂和实验室在做。
2、行业垂直大模型:比如滴滴、大众点评等,有大量行业数据沉淀的公司有数据,可以做。
3、AI-Native开发大模型应用To B/C:互联网公司、科技公司、科创公司最爱干的事情
C端:notion ai智能体辅助写作,比如调格式、错误检查
B端:所有的saas都会被重构。
FDC,前沿部署,Forward Deployed Engineer,主打大模型分布式分离部署、离线私有化落地,将AI模型落地到企业的具体场景。
4、app+API:就是如果你不会coding,你还想搭建一个应用,那你用特定的app,比如百度的coz, 用拖拽的方式来搭建。也就是调用api来搭建。这种方式不能自定义,但可以实现你的粗框架。这就是基于低代码平台的快速工作流。快速开发产品原型,MVP。
(二)下游应用选择大模型的原则
这是做AI开发,我们首先要面对的问题。不同企业有不同的考虑和关注点,比如:
效率:部署的时间、响应的速度
成本:时间成本、人力成本、GPU资源(高性能显卡)、技术能力、成本和收入问题
任务场景:是做对话应用、需要识别语音、图片视频的多模态、上下文窗口的大小
1、政府、金融机构、大型企业,及其重视隐私和安全的企业,适合开源大模型私有化部署,或者自主开发闭源大模型。比如滴滴、大众点评等,有大量行业数据沉淀的公司有数据,而且数据隐私非常重要,这类公司不倾向用别人做好的模型,倾向于自己开发模型,或者对开源模型进行私有化部署,这样模型和数据是隔离的。
2、中小企业,不太介意隐私和安全问题,可以使用羊驼或HuggingFace上的开源模型,用自己的数据进行微调即可。
3、大模型下游应用公司,不介意隐私和安全的应用,可以快速开发产品原型(MVP)、通用服务,使用GPT或Gemini等API。
Minimum Viable Product,用最小成本做出核心功能版本,快速推向市场验证想法是否可行,再根据用户反馈迭代优化。
4、大模型下游应用公司,但是介意隐私和安全,可以使用闭源API+厂商服务,或者本地开源部署,开箱即用,让自己的隐私数据进行隔离。
(三)大模型资源
1、闭源: 申请质谱系列大模型,获取API KEY
通过代理站申请海外大模型API KEY
2、开源:
使用Ollama,本地部署羊驼8B
使用LLM Studio + HG来部署开源大模型
(四)大模型开发平台
1、HuggingFace
HuggingFace是一个提供开源预训练模型和相关工具链的平台,目前已经是一个完整的AI开发生态系统,支持NLP、计算机视觉、语音处理、多模态任务等多个领域。我们使用HF可以简化预训练模型的使用,加速项目的开发和落地。
2、Vellum
Vellum是一个开发平台,用于构建LLM应用。它提供了快速工程、语义搜索、版本控制、测试和监控等工具,兼容主要的LLM提供商。Vellum可以帮助用户将LLM功能带入生产环境,支持迅速开发和部署LLM模型,同时提供质量测试和性能监控等功能。
Vellum也是一个大模型评测机构,评测的基本都是国外的大模型,总体来说,评测结果是以open ai为领头羊,其次是claude。所以我们选择模型时最好也是首选open ai,其次是claude,效果会好一点。
(五)硬件配置
你的电脑配置得跟得上,内存至少得大于等于12GB,英伟达的显卡GPU,至少大于等于6GB,你才能训练或者微调一下大模型。哪怕是最古老的1060显卡都可以凑合跑大模型。但是如果你完全没有GPU,只用CPU,那一个bert-base模型训练一轮一般就得20多个小时,这种训练效率会让你瞬间丧失继续学习的兴趣。
一个8B参数大模型,推理时至少需要24GB以上的显存来推理,所以你没有GPU,训练大模型是不可能的,微调的难度也是极大的。也所以现在发布的大模型已经没有训练的必要了,现在的重点是如何在特定领域中使用目前已经开源的大模型。如果自己部署大模型,那你电脑的单卡,GPU显卡得在3060以上,这是最低的硬件要求。
五、本系列专栏的内容介绍
1、因为AI大模型的平台是HuggingFace,所以我们会先简单介绍一下HuggingFace的基本操作。
2、此后我们会详细讲解GPT\BERT\T5这三个经典预训练模型的架构、输入输出、根据下游具体任务的微调方式,并配上一些小案例。虽然这3个大模型已经很老了,但它们是你入门大模型原理的必备基础。
3、介绍一些比较经典的大模型微调技术,比如LoRA、RLFH等。
4、大模型训练和开发不是个人有实力来做的,但是大量的下游应用开发必然逃不过AI agen这个方向。所以智能体开发会介绍一下。