AutoSchemaKG与Neo4j集成指南:高效存储和管理知识图谱数据
【免费下载链接】AutoSchemaKGThis repository contains the implementation of AutoSchemaKG, a novel framework for automatic knowledge graph construction that combines schema generation via conceptualization.项目地址: https://gitcode.com/gh_mirrors/au/AutoSchemaKG
AutoSchemaKG是一个创新的知识图谱构建框架,它通过概念化生成模式,实现自动知识图谱构建。本指南将详细介绍如何将AutoSchemaKG与Neo4j集成,实现知识图谱数据的高效存储和管理,帮助新手和普通用户快速上手这一强大的组合。
为什么选择AutoSchemaKG与Neo4j集成?
AutoSchemaKG提供了自动构建知识图谱的能力,而Neo4j作为领先的图数据库,为知识图谱提供了高效的存储和查询支持。两者结合可以充分发挥各自优势,实现知识图谱的自动化构建、高效存储和灵活查询。
AutoSchemaKG标志:融合了知识图谱网络与齿轮元素,象征自动化知识图谱构建能力
快速开始:使用预构建的Neo4j服务器
下载预配置的Neo4j服务器
最简单的开始方式是下载预配置的Neo4j服务器,其中已经导入了数据。您可以从Huggingface Dataset下载特定的数据集:
| Dataset | File Name | Size | Description |
|---|---|---|---|
| Common Crawl | neo4j-server-cc.zip | ~213 GB | Large-scale web crawl data. |
| Wiki | neo4j-server-wiki.zip | ~74.1 GB | Wikipedia-based knowledge graph. |
| Pes2o | neo4j-server-pes2o.zip | ~53.2 GB | Academic papers dataset. |
使用以下命令通过CLI下载:
# 安装huggingface-cli pip install huggingface_hub # 下载特定文件(例如Wiki) hf download gzone0111/AutoSchemaKG 'ATLAS Neo4j Server Zip/neo4j-server-wiki.zip' --local-dir . --repo-type dataset启动Neo4j服务器
解压下载的文件后,使用以下命令启动服务器:
# 将{dataset-name}替换为wiki、pes2o或cc ./neo4j-server-{dataset-name}/bin/neo4j start从源代码构建:完整集成步骤
1. 设置Neo4j环境
我们提供了脚本用于下载Neo4j Community Edition,安装所需插件(APOC、GDS)并配置环境:
cd neo4j_scripts sh get_neo4j_cc.sh # 用于Common Crawl sh get_neo4j_pes2o.sh # 用于Pes2o sh get_neo4j_wiki.sh # 用于Wiki配置Neo4j
- 将
AutoschemaKG/neo4j_scripts/neo4j.conf复制到neo4j-server-{dataset}/conf/neo4j.conf - 更新
dbms.default_database为您所需的数据集名称(例如wiki-csv-json-text) - 配置端口(Bolt、HTTP、HTTPS)以避免运行多个服务器时的冲突
2. 准备数据
下载数据
从Huggingface Dataset下载CSV转储:
hf download gzone0111/AutoSchemaKG --include "ATLAS Neo4j Dump/*" --local-dir . --repo-type dataset解压缩数据
运行decompress_csv_files.sh脚本将所有zip文件并行解压缩到decompressed目录,然后将文件移动到Neo4j服务器的./import目录。
存储要求:确保您有足够的磁盘空间。导入和解压缩后的大致大小:
| 目录 | 大小 |
|---|---|
./neo4j-server-wiki | 342 GB |
./neo4j-server-cc | 907 GB |
./neo4j-server-pes2o | 249 GB |
./import(原始CSV) | 2.3 TB |
3. 导入数据到Neo4j
使用neo4j-admin import加载CSV文件,这比CypherLOAD CSV处理大型数据集快得多。
示例:导入Wiki图谱
./neo4j-server-wiki/bin/neo4j-admin database import full wiki-csv-json-text \ --nodes=./import/text_nodes_en_simple_wiki_v0_from_json_with_numeric_id.csv \ ./import/triple_nodes_en_simple_wiki_v0_from_json_without_emb_with_numeric_id.csv \ ./import/concept_nodes_en_simple_wiki_v0_from_json_without_emb.csv \ --relationships=./import/text_edges_en_simple_wiki_v0_from_json.csv \ ./import/triple_edges_en_simple_wiki_v0_from_json_without_emb_full_concept_with_numeric_id.csv \ ./import/concept_edges_en_simple_wiki_v0_from_json_without_emb.csv \ --overwrite-destination \ --multiline-fields=true \ --id-type=string \ --verbose --skip-bad-relationships=true托管RAG API
Neo4j服务器运行后,您可以托管ATLAS RAG API以执行检索:
python example/example_scripts/neo4j_kg/atlas_api_server_demo.py确保在脚本中配置LargeKGConfig以指向您的Neo4j实例(URI、用户名、密码)和正确的FAISS索引。
使用示例:查询知识图谱
您可以使用OpenAI兼容的客户端查询托管的RAG API(参考example/example_scripts/neo4j_kg/atlas_api_client_demo.py):
from openai import OpenAI # 指向您托管的API base_url = "http://0.0.0.0:10089/v1/" client = OpenAI(api_key="EMPTY", base_url=base_url) message = [ { "role": "system", "content": "You are a helpful assistant that answers questions based on the knowledge graph.", }, { "role": "user", "content": "Question: Who is Alex Mercer?", } ] response = client.chat.completions.create( model="llama", messages=message, max_tokens=2048, temperature=0.5, extra_body = { "retriever_config": { "topN": 5, "number_of_source_nodes_per_ner": 1, "sampling_area": 10 } } ) print(response.choices[0].message.content)管理Neo4j服务器的实用脚本
项目提供了一系列脚本用于管理Neo4j服务器,位于neo4j_scripts/目录:
start_neo4j_demo.sh: 启动演示用Neo4j服务器stop_neo4j_wiki.sh: 停止Wiki数据集的Neo4j服务器stop_all_neo4j.sh: 停止所有运行的Neo4j服务器
总结
通过本指南,您已经了解了如何将AutoSchemaKG与Neo4j集成,实现知识图谱的高效存储和管理。无论是使用预构建的服务器快速开始,还是从源代码构建完整的解决方案,AutoSchemaKG与Neo4j的组合都能为您提供强大的知识图谱构建和查询能力。
要深入了解更多功能,请参考项目文档和示例脚本,开始您的知识图谱之旅吧! 🚀
【免费下载链接】AutoSchemaKGThis repository contains the implementation of AutoSchemaKG, a novel framework for automatic knowledge graph construction that combines schema generation via conceptualization.项目地址: https://gitcode.com/gh_mirrors/au/AutoSchemaKG
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考