【AI大模型应用开发】【项目实战】14.RAG智慧问答项目-(二)项目工具之OllamaLangChainMilvus向量数据库
一.Ollama大模型高效管理工具
具体使用见【聊天机器人项目】4.Ollama的安装与使用
二.LangChain基础知识
1.LangChain基础知识
具体使用见:【AI大模型应用开发】【基础】7.LangChain基础知识入门
2.LangChain核心包
- langchain-core:聊天模型和其他组件的基础抽象。
集成包(例如 langchain-openai、langchain-anthropic 等):重要的集成被拆分为轻量级的独立包,由 LangChain 团队和集成方共同维护
langchain:包含链(chains)、智能体(agents)和检索策略,这些构成了应用的认知架构
langchain-community:由社区维护的第三方集成
langgraph:一个编排框架,用于将 LangChain 组件组合成可用于生产的应用,支持持久化、流式处理及其他关键特性
3.环境准备
本项目以LangChain+Qwen进行学习,需要提前安装
pip install openai pip install langchain pip install modelscope
借助阿里云-百炼平台(需要申请API Key 以及Secret Key):
大模型服务平台百炼控制台
三.Milvus向量数据库
目标
- 理解什么是向量数据库
- 理解Milvus和Mysql的区别和联系
- 掌握Milvus数据库的增删改查
mysql的索引:深入理解mysql索引机制
1.什么是Milvus数据库
Milvus 是一款开源的向量数据库(2019年提出),其唯一目标是存储、索引和管理由深度神经网络和其他机器学习(ML)模型生成的大规模 嵌入向量
作为一个专门设计用于处理输入向量查询的数据库,它能够处理万亿级别的向量索引。与现有的关系型数据库主要处理遵循预定义模式的结构化数据不同,Milvus 从底层设计用于处理从非结构化数据转换而来的嵌入向量。
随着互联网的发展和演变,非结构化数据变得越来越常见,包括电子邮件、论文、物联网传感器数据、Facebook 照片、蛋白质结构等等。为了使计算机能够理解和处理非结构化数据,使用嵌入技术将它们转换为向量,Milvus 存储和索引这些向量,Milvus 能够通过计算它们的相似距离来分析两个向量之间的相关性,如果两个嵌入向量非常相似,则意味着原始数据源也很相似
作用:专门设计用于处理输入向量查询的数据库,它能够处理万亿级别的向量索引
使用场景:存储【向量】数据,并进行【相似度】查询
2.关键概念
分类:
结构化:里面的数据,字段固定,内容固定
半结构化:【json、xml】等,有结构,但是内容不固定
非结构化:【图片、音频、视频、文本】等数据
在现实世界,80%+的数据是非结构化数据,而这些数据如果想进行检索,就需要转化为向量后使用向量数据库存储和查询
(1).非结构化数据
非结构化数据包括图像、视频、音频和自然语言等信息,这些信息不遵循预定义的模型或组织方式。这种数据类型占据了世界数据的约 80%,可以使用各种人工智能(AI)和机器学习(ML)模型将其转换为向量
(2).嵌入向量
嵌入向量是对非结构化数据(如电子邮件、物联网传感器数据、Instagram 照片、蛋白质结构等)的特征抽象,数学上,嵌入向量是一个浮点数或二进制数的数组。,现代的嵌入技术被用于将非结构化数据转换为嵌入向量
比如:
输入: ["自然语言处理很有趣"] -> 输出: [[0.023, -0.128, 0.845, -0.031, 0.215, ...]] # 384维向
(3).向量相似度搜索
向量相似度搜索是将向量与数据库进行比较,以找到与查询向量最相似的向量的过程,使用近似最近邻搜索算法加速搜索过程,如果两个嵌入向量非常相似,那么原始数据源也是相似的
(4).Collection 和 Field
与传统数据库引擎类似,可以在Milvus中创建数据库,并为某些用户分配权限来管理它们,那么这些用户就有权管理数据库中的集合,一个 Milvus 集群最多支持64 个数据库
在关系数据库中,表和字段的结构可以与Milvus中的Collection和Field进行对应:
| Milvus | 关系数据库 | 描述 |
|---|---|---|
| Collection | 表 | 集合相当于关系数据库中的表,用于组织数据 |
| Field | 字段 | 字段Schema相当于表中的列 |
| is_primary | 主键 | 在Field Schema中标记为主键对应该列的主键 |
| dtype | 数据类型 | 字段的数据类型,如INT, VARCHAR等 |
| max_length | 最大长度 | 对应VARCHAR类型字段的最大字符数 |
| dim | - | 向量字段的维度没有直接对应,但可以视为特殊数据处理 |
注意:1个collection最多支持4个向量Field
创建一个collection要分两步:
创建一个collection schema,指定collection的一些属性,比如是否开启动态字段等
给collection schema添加field schema
1).Field schema
Field schema是字段的逻辑定义,在定义集合架构和管理集合之前需要定义的第一件事就是定义Field schema
Milvus 集合中仅支持一个主键字段
| 属性 | 描述 | 备注 |
|---|---|---|
name | 要创建的集合中的字段名称 | String,必填 |
dtype | 字段的数据类型 | 必填 |
description | 字段描述 | String,选填 |
is_primary | 是否设置该字段为主键字段 | Boolean (true or false) 主键字段必填 |
auto_id(主键字段必填) | 切换以启用或禁用自动 ID(主键)分配 | True或False |
max_length(VARCHAR 字段必需) | 允许插入的字符串的最大长度。 | [1, 65,535] |
dim | 向量的维数 | ∈[1, 32768] |
is_partition_key | 该字段是否是分区键字段 | 布尔值(true 或 false) |
2).collection schema
collection schema是collection的逻辑定义,需要在定义collection schema之前定义field schema
| 属性 | 描述 | 备注 |
|---|---|---|
field | 集合中要创建的字段 | 必填 |
description | 集合描述 | String,选填 |
partition_key_field | 设计用作分区键的字段的名称 | String, 选填 |
enable_dynamic_field | 是否启用动态模式 | Boolean (true or false) |
partition_key_field:分区字段,数据量比较大时用于物理隔离数据,让检索性能更快(一般用不到)
enable_dynamic_field:是否允许动态模式, 允许用户在插入数据时添加 Schema 中未预定义的字段,这些字段会自动存储为 JSON 格式,无需预先声明结构
3.为什么选择 Milvus?
- 在处理大规模数据集的向量搜索时具有高性能
- 开发者优先的社区,提供多语言支持和工具链
- 云扩展性和高可靠性,即使出现故障也不会受到影响
- 通过将标量过滤与向量相似度搜索配对,实现混合搜索
4.支持哪些索引和度量?
索引(Milvus的索引是加载到内存中的, 因为在使用Milvus时开销很大, 只有在内存中速度才能提升起来)是数据的组织单位,在搜索或查询插入的实体之前,必须声明索引类型和相似度度量,如果未指定索引类型,则 Milvus 将默认使用暴力搜索
索引类型
要知道索引类型相关知识,需要先了解 KMeans算法以及监督学习
监督学习:有标注的标签, 常见:分类、回归
无监督学习:没有标注的标签,常见:聚类算法、 word2vec
半监督学习:有一部分有标签,一部分没有标签
自监督学习:数据集中取出一部分作为标签训练模型(MLM、NSP)
大多数由 Milvus 支持的向量索引类型使用近似最近邻搜索(ANNS),包括:
FLAT:FLAT最适合在小型,百万级数据集上寻求完全准确和精确搜索结果的场景
这是最简单的索引方式,进行暴力搜索(brute-force),可以保证精确度,但效率低,尤其在数据量大时,适合场景:在小型、百万级数据集上寻求完全精确的搜索结果
IVF_FLAT:是一种基于倒排的索引方法,广泛用于在大规模数据集上实现高效的近似最近邻搜索,它适用于在精度和查询速度之间寻求平衡的场景
- 聚类 :IVF_FLAT通过聚类算法(如k-means)将高维空间中的向量划分为多个子空间(簇),每个簇包含一组相似的向量,并且每个簇会有一个代表向量,通常是簇的中心点
- 倒排索引 :为每个簇创建倒排索引,每个向量会被映射到它所属的簇,这样在查询时,系统只需关注与查询向量相似的簇,而不需要搜索整个高维空间,从而显著降低搜索的时间复杂度。
- 查询处理 :
查询时,IVF_FLAT首先将查询向量分配到距离最近的簇中心(即子空间)
然后在该簇内执行精确的线性搜索,从而查找与查询向量相似的向量
- <