KES 全文搜索与文本处理实战:文本检索、分词与高性能搜索
📅 2026/8/4 8:51:23
👁️ 阅读次数
📝 编程学习
KES 全文搜索与文本处理实战:文本检索、分词与高性能搜索
前言
文本搜索是应用系统中最常见的需求之一。从简单的关键词匹配到复杂的全文检索,搜索功能的实现质量直接影响用户体验。KES提供了强大的全文搜索能力,结合tsvector和tsquery类型,可以实现高效的文本检索。
本篇内容深入讲解KES的全文搜索功能,详细讲解文本检索原理、分词配置、索引优化以及高级搜索技巧。全文以实际操作为主,结合大量真实案例。如果你需要实现复杂的搜索功能,或者希望提升文本检索性能,相信这篇内容对你会有帮助。
一、全文搜索基础
理解全文搜索的基本概念是构建高效搜索系统的前提。
全文搜索数据类型
-- tsvector:文档的优化表示SELECTto_tsvector('chinese','KES是一个强大的关系型数据库系统');-- 返回:'kes':1 '关系型':4 '数据库':6 '系统':8 '强大':3-- tsquery:搜索查询的优化表示SELECTto_tsquery('chinese','KES & 数据库');-- 返回:'kes' & '数据库'-- 匹配操作符 @@SELECTto_tsvector('chinese','KES数据库')@@ to_tsquery('chinese','KES');-- 返回:true基础文本搜索
-- 创建文章表CREATETABLEarticles(idSERIALPRIMARYKEY,titleVARCHAR(200),contentTEXT,authorVARCHAR(100),created_atTIMESTAMPDEFAULTnow());-- 插入示例数据INSERTINTOarticles(title,content,author)VALUES('KES性能优化指南','本文介绍KES数据库的性能优化方法,包括索引优化、查询优化等','张三'),('KES高可用架构','讲解KES主备复制、读写分离等高可用方案','李四'),('KES备份恢复实战','详细介绍KES的备份策略和恢复方法','王五');-- 简单文本搜索SELECTtitle,authorFROMarticlesWHEREto_tsvector('chinese',content)@@ to_tsquery('chinese','性能');二、全文搜索索引
合理的索引是提升搜索性能的关键。
GIN索引
-- 创建tsvector列ALTERTABLEarticlesADDCOLUMNsearch_vector tsvector;-- 更新tsvector数据UPDATEarticlesSETsearch_vector=to_tsvector('chinese',coalesce(title,'')||' '||coalesce(content,''));-- 创建GIN索引CREATEINDEXidx_articles_searchONarticlesUSINGgin(search_vector);-- 使用索引查询SELECTtitle,authorFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','性能 & 优化');-- 自动更新tsvector的触发器CREATEORREPLACEFUNCTIONupdate_search_vector()RETURNSTRIGGERAS$$BEGINNEW.search_vector :=to_tsvector('chinese',coalesce(NEW.title,'')||' '||coalesce(NEW.content,''));RETURNNEW;END;$$LANGUAGEplpgsql;CREATETRIGGERtrg_update_search_vector BEFOREINSERTORUPDATEONarticlesFOR EACH ROWEXECUTEFUNCTIONupdate_search_vector();GiST索引
-- 创建GiST索引(支持排序)CREATEINDEXidx_articles_search_gistONarticlesUSINGgist(search_vector);-- 使用排序查询SELECTtitle,ts_rank(search_vector,query)ASrankFROMarticles,to_tsquery('chinese','数据库')ASqueryWHEREsearch_vector @@ queryORDERBYrankDESC;三、分词配置与优化
分词质量直接影响搜索效果,合理的分词配置至关重要。
分词器配置
-- 查看可用分词器SELECTcfgnameFROMsys_ts_config;-- 创建自定义分词器CREATETEXTSEARCH CONFIGURATION chinese_parser(COPY=simple);-- 查看分词结果SELECT*FROMts_debug('chinese','KES数据库性能优化');-- 使用pg_trgm进行模糊匹配CREATEEXTENSION pg_trgm;CREATEINDEXidx_articles_trgmONarticlesUSINGgin(title gin_trgm_ops);-- 模糊搜索SELECTtitleFROMarticlesWHEREtitle%'KES';-- 相似度匹配停用词处理
-- 查看停用词文件SELECT*FROMsys_ts_configWHEREcfgname='english';-- 创建自定义停用词文件-- 在 $SHAREDIR/tsearch_data/ 目录下创建 my_stopwords.txt-- 添加自定义停用词-- 创建自定义词典CREATETEXTSEARCH DICTIONARY my_dict(TEMPLATE=snowball,LANGUAGE=english,STOPWORDS=my_stopwords);-- 使用自定义词典CREATETEXTSEARCH CONFIGURATION my_config(PARSER=default);ALTERTEXTSEARCH CONFIGURATION my_configALTERMAPPINGFORasciiwordWITHmy_dict;四、高级搜索技巧
布尔搜索
-- AND搜索:同时包含多个词SELECTtitleFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','KES & 性能');-- OR搜索:包含任一词SELECTtitleFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','性能 | 优化');-- NOT搜索:排除某个词SELECTtitleFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','KES & !备份');-- 短语搜索:精确匹配短语SELECTtitleFROMarticlesWHEREsearch_vector @@ phraseto_tsquery('chinese','性能优化');权重搜索
-- 为不同字段设置权重CREATETABLEproducts(idSERIAL,nameVARCHAR(200),descriptionTEXT,brandVARCHAR(100));-- 创建带权重的tsvectorUPDATEproductsSETsearch_vector=setweight(to_tsvector('chinese',coalesce(name,'')),'A')||setweight(to_tsvector('chinese',coalesce(brand,'')),'B')||setweight(to_tsvector('chinese',coalesce(description,'')),'C');-- 权重排序SELECTname,ts_rank(search_vector,query,0)ASrankFROMproducts,to_tsquery('chinese','Apple')ASqueryWHEREsearch_vector @@ queryORDERBYrankDESC;高亮显示
-- 搜索结果高亮SELECTtitle,ts_headline('chinese',content,to_tsquery('chinese','性能'),'StartSel=<b>, StopSel=</b>, MaxWords=50, MinWords=10')AShighlighted_contentFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','性能');五、实战案例解析
场景一:电商商品搜索
某电商平台需要实现商品搜索功能。
-- 创建商品表CREATETABLEproducts(idSERIALPRIMARYKEY,nameVARCHAR(200),categoryVARCHAR(100),brandVARCHAR(100),descriptionTEXT,priceNUMERIC(10,2),search_vector tsvector,created_atTIMESTAMPDEFAULTnow());-- 创建索引CREATEINDEXidx_products_searchONproductsUSINGgin(search_vector);CREATEINDEXidx_products_priceONproducts(price);-- 插入示例数据INSERTINTOproducts(name,category,brand,description,price,search_vector)VALUES('iPhone 15 Pro','手机','Apple','最新款iPhone,性能强劲',8999,to_tsvector('chinese','iPhone 15 Pro 手机 Apple 最新款 性能强劲')),('MacBook Pro 14','笔记本','Apple','专业级笔记本电脑',14999,to_tsvector('chinese','MacBook Pro 14 笔记本 Apple 专业级'));-- 搜索功能CREATEORREPLACEFUNCTIONsearch_products(p_keywordTEXT,p_categoryTEXTDEFAULTNULL,p_min_priceNUMERICDEFAULTNULL,p_max_priceNUMERICDEFAULTNULL)RETURNSTABLE(product_idINT,product_nameVARCHAR,product_priceNUMERIC,rankFLOAT)AS$$BEGINRETURNQUERYSELECTp.id,p.name,p.price,ts_rank(p.search_vector,query)ASrankFROMproducts p,to_tsquery('chinese',p_keyword)ASqueryWHEREp.search_vector @@ queryAND(p_categoryISNULLORp.category=p_category)AND(p_min_priceISNULLORp.price>=p_min_price)AND(p_max_priceISNULLORp.price<=p_max_price)ORDERBYrankDESC,p.priceASC;END;$$LANGUAGEplpgsql;-- 使用搜索函数SELECT*FROMsearch_products('Apple','手机',5000,10000);场景二:日志全文检索
某系统需要对应用日志进行全文检索。
-- 创建日志表CREATETABLEsystem_logs(idSERIALPRIMARYKEY,log_levelVARCHAR(20),messageTEXT,stack_traceTEXT,created_atTIMESTAMPDEFAULTnow(),search_vector tsvector);-- 创建索引CREATEINDEXidx_logs_searchONsystem_logsUSINGgin(search_vector);CREATEINDEXidx_logs_timeONsystem_logs(created_atDESC);-- 自动更新触发器CREATETRIGGERtrg_logs_update_vector BEFOREINSERTORUPDATEONsystem_logsFOR EACH ROWEXECUTEFUNCTIONupdate_log_search_vector();CREATEORREPLACEFUNCTIONupdate_log_search_vector()RETURNSTRIGGERAS$$BEGINNEW.search_vector :=to_tsvector('chinese',coalesce(NEW.message,'')||' '||coalesce(NEW.stack_trace,''));RETURNNEW;END;$$LANGUAGEplpgsql;-- 日志搜索SELECTlog_level,message,ts_headline('chinese',message,to_tsquery('chinese','错误'),'MaxWords=30')AShighlightFROMsystem_logsWHEREsearch_vector @@ to_tsquery('chinese','错误')ANDcreated_at>now()-INTERVAL'1 day'ORDERBYcreated_atDESCLIMIT50;场景三:智能搜索建议
实现搜索建议功能,提升用户体验。
-- 创建搜索建议表CREATETABLEsearch_suggestions(idSERIALPRIMARYKEY,keywordVARCHAR(100)UNIQUE,search_countINTDEFAULT0,last_searchedTIMESTAMPDEFAULTnow());-- 记录搜索关键词CREATEORREPLACEFUNCTIONrecord_search(p_keywordTEXT)RETURNSVOIDAS$$BEGININSERTINTOsearch_suggestions(keyword,search_count,last_searched)VALUES(p_keyword,1,now())ONCONFLICT(keyword)DOUPDATESETsearch_count=search_suggestions.search_count+1,last_searched=now();END;$$LANGUAGEplpgsql;-- 获取搜索建议CREATEORREPLACEFUNCTIONget_suggestions(p_prefixTEXT,p_limitINTDEFAULT10)RETURNSTABLE(keywordVARCHAR,countINT)AS$$BEGINRETURNQUERYSELECTs.keyword,s.search_countFROMsearch_suggestions sWHEREs.keywordILIKEp_prefix||'%'ORDERBYs.search_countDESC,s.last_searchedDESCLIMITp_limit;END;$$LANGUAGEplpgsql;-- 使用搜索建议SELECT*FROMget_suggestions('KES');总结与展望
全文搜索是KES的重要功能。通过合理的索引设计和分词配置,可以实现高效的文本检索。
核心原则:
- 根据搜索需求选择合适的索引类型
- 合理配置分词器,提升搜索质量
- 使用权重机制优化搜索结果排序
- 建立搜索建议机制,提升用户体验
- 定期分析搜索性能,持续优化
KES的全文搜索功能强大,能够满足各种复杂的搜索场景。在实际应用中,建议根据业务特点设计合理的搜索方案,充分发挥全文搜索的优势。
期望本篇内容能够帮助你掌握KES全文搜索的核心技术,为构建高效的搜索系统提供技术支撑。
编程学习
技术分享
实战经验