ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

KES 全文搜索与文本处理实战:文本检索、分词与高性能搜索

KES 全文搜索与文本处理实战:文本检索、分词与高性能搜索

KES 全文搜索与文本处理实战:文本检索、分词与高性能搜索

前言

文本搜索是应用系统中最常见的需求之一。从简单的关键词匹配到复杂的全文检索,搜索功能的实现质量直接影响用户体验。KES提供了强大的全文搜索能力,结合tsvector和tsquery类型,可以实现高效的文本检索。

本篇内容深入讲解KES的全文搜索功能,详细讲解文本检索原理、分词配置、索引优化以及高级搜索技巧。全文以实际操作为主,结合大量真实案例。如果你需要实现复杂的搜索功能,或者希望提升文本检索性能,相信这篇内容对你会有帮助。

一、全文搜索基础

理解全文搜索的基本概念是构建高效搜索系统的前提。

全文搜索数据类型

-- tsvector:文档的优化表示SELECTto_tsvector('chinese','KES是一个强大的关系型数据库系统');-- 返回:'kes':1 '关系型':4 '数据库':6 '系统':8 '强大':3-- tsquery:搜索查询的优化表示SELECTto_tsquery('chinese','KES & 数据库');-- 返回:'kes' & '数据库'-- 匹配操作符 @@SELECTto_tsvector('chinese','KES数据库')@@ to_tsquery('chinese','KES');-- 返回:true

基础文本搜索

-- 创建文章表CREATETABLEarticles(idSERIALPRIMARYKEY,titleVARCHAR(200),contentTEXT,authorVARCHAR(100),created_atTIMESTAMPDEFAULTnow());-- 插入示例数据INSERTINTOarticles(title,content,author)VALUES('KES性能优化指南','本文介绍KES数据库的性能优化方法,包括索引优化、查询优化等','张三'),('KES高可用架构','讲解KES主备复制、读写分离等高可用方案','李四'),('KES备份恢复实战','详细介绍KES的备份策略和恢复方法','王五');-- 简单文本搜索SELECTtitle,authorFROMarticlesWHEREto_tsvector('chinese',content)@@ to_tsquery('chinese','性能');

二、全文搜索索引

合理的索引是提升搜索性能的关键。

GIN索引

-- 创建tsvector列ALTERTABLEarticlesADDCOLUMNsearch_vector tsvector;-- 更新tsvector数据UPDATEarticlesSETsearch_vector=to_tsvector('chinese',coalesce(title,'')||' '||coalesce(content,''));-- 创建GIN索引CREATEINDEXidx_articles_searchONarticlesUSINGgin(search_vector);-- 使用索引查询SELECTtitle,authorFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','性能 & 优化');-- 自动更新tsvector的触发器CREATEORREPLACEFUNCTIONupdate_search_vector()RETURNSTRIGGERAS$$BEGINNEW.search_vector :=to_tsvector('chinese',coalesce(NEW.title,'')||' '||coalesce(NEW.content,''));RETURNNEW;END;$$LANGUAGEplpgsql;CREATETRIGGERtrg_update_search_vector BEFOREINSERTORUPDATEONarticlesFOR EACH ROWEXECUTEFUNCTIONupdate_search_vector();

GiST索引

-- 创建GiST索引(支持排序)CREATEINDEXidx_articles_search_gistONarticlesUSINGgist(search_vector);-- 使用排序查询SELECTtitle,ts_rank(search_vector,query)ASrankFROMarticles,to_tsquery('chinese','数据库')ASqueryWHEREsearch_vector @@ queryORDERBYrankDESC;

三、分词配置与优化

分词质量直接影响搜索效果,合理的分词配置至关重要。

分词器配置

-- 查看可用分词器SELECTcfgnameFROMsys_ts_config;-- 创建自定义分词器CREATETEXTSEARCH CONFIGURATION chinese_parser(COPY=simple);-- 查看分词结果SELECT*FROMts_debug('chinese','KES数据库性能优化');-- 使用pg_trgm进行模糊匹配CREATEEXTENSION pg_trgm;CREATEINDEXidx_articles_trgmONarticlesUSINGgin(title gin_trgm_ops);-- 模糊搜索SELECTtitleFROMarticlesWHEREtitle%'KES';-- 相似度匹配

停用词处理

-- 查看停用词文件SELECT*FROMsys_ts_configWHEREcfgname='english';-- 创建自定义停用词文件-- 在 $SHAREDIR/tsearch_data/ 目录下创建 my_stopwords.txt-- 添加自定义停用词-- 创建自定义词典CREATETEXTSEARCH DICTIONARY my_dict(TEMPLATE=snowball,LANGUAGE=english,STOPWORDS=my_stopwords);-- 使用自定义词典CREATETEXTSEARCH CONFIGURATION my_config(PARSER=default);ALTERTEXTSEARCH CONFIGURATION my_configALTERMAPPINGFORasciiwordWITHmy_dict;

四、高级搜索技巧

布尔搜索

-- AND搜索:同时包含多个词SELECTtitleFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','KES & 性能');-- OR搜索:包含任一词SELECTtitleFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','性能 | 优化');-- NOT搜索:排除某个词SELECTtitleFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','KES & !备份');-- 短语搜索:精确匹配短语SELECTtitleFROMarticlesWHEREsearch_vector @@ phraseto_tsquery('chinese','性能优化');

权重搜索

-- 为不同字段设置权重CREATETABLEproducts(idSERIAL,nameVARCHAR(200),descriptionTEXT,brandVARCHAR(100));-- 创建带权重的tsvectorUPDATEproductsSETsearch_vector=setweight(to_tsvector('chinese',coalesce(name,'')),'A')||setweight(to_tsvector('chinese',coalesce(brand,'')),'B')||setweight(to_tsvector('chinese',coalesce(description,'')),'C');-- 权重排序SELECTname,ts_rank(search_vector,query,0)ASrankFROMproducts,to_tsquery('chinese','Apple')ASqueryWHEREsearch_vector @@ queryORDERBYrankDESC;

高亮显示

-- 搜索结果高亮SELECTtitle,ts_headline('chinese',content,to_tsquery('chinese','性能'),'StartSel=<b>, StopSel=</b>, MaxWords=50, MinWords=10')AShighlighted_contentFROMarticlesWHEREsearch_vector @@ to_tsquery('chinese','性能');

五、实战案例解析

场景一:电商商品搜索

某电商平台需要实现商品搜索功能。

-- 创建商品表CREATETABLEproducts(idSERIALPRIMARYKEY,nameVARCHAR(200),categoryVARCHAR(100),brandVARCHAR(100),descriptionTEXT,priceNUMERIC(10,2),search_vector tsvector,created_atTIMESTAMPDEFAULTnow());-- 创建索引CREATEINDEXidx_products_searchONproductsUSINGgin(search_vector);CREATEINDEXidx_products_priceONproducts(price);-- 插入示例数据INSERTINTOproducts(name,category,brand,description,price,search_vector)VALUES('iPhone 15 Pro','手机','Apple','最新款iPhone,性能强劲',8999,to_tsvector('chinese','iPhone 15 Pro 手机 Apple 最新款 性能强劲')),('MacBook Pro 14','笔记本','Apple','专业级笔记本电脑',14999,to_tsvector('chinese','MacBook Pro 14 笔记本 Apple 专业级'));-- 搜索功能CREATEORREPLACEFUNCTIONsearch_products(p_keywordTEXT,p_categoryTEXTDEFAULTNULL,p_min_priceNUMERICDEFAULTNULL,p_max_priceNUMERICDEFAULTNULL)RETURNSTABLE(product_idINT,product_nameVARCHAR,product_priceNUMERIC,rankFLOAT)AS$$BEGINRETURNQUERYSELECTp.id,p.name,p.price,ts_rank(p.search_vector,query)ASrankFROMproducts p,to_tsquery('chinese',p_keyword)ASqueryWHEREp.search_vector @@ queryAND(p_categoryISNULLORp.category=p_category)AND(p_min_priceISNULLORp.price>=p_min_price)AND(p_max_priceISNULLORp.price<=p_max_price)ORDERBYrankDESC,p.priceASC;END;$$LANGUAGEplpgsql;-- 使用搜索函数SELECT*FROMsearch_products('Apple','手机',5000,10000);

场景二:日志全文检索

某系统需要对应用日志进行全文检索。

-- 创建日志表CREATETABLEsystem_logs(idSERIALPRIMARYKEY,log_levelVARCHAR(20),messageTEXT,stack_traceTEXT,created_atTIMESTAMPDEFAULTnow(),search_vector tsvector);-- 创建索引CREATEINDEXidx_logs_searchONsystem_logsUSINGgin(search_vector);CREATEINDEXidx_logs_timeONsystem_logs(created_atDESC);-- 自动更新触发器CREATETRIGGERtrg_logs_update_vector BEFOREINSERTORUPDATEONsystem_logsFOR EACH ROWEXECUTEFUNCTIONupdate_log_search_vector();CREATEORREPLACEFUNCTIONupdate_log_search_vector()RETURNSTRIGGERAS$$BEGINNEW.search_vector :=to_tsvector('chinese',coalesce(NEW.message,'')||' '||coalesce(NEW.stack_trace,''));RETURNNEW;END;$$LANGUAGEplpgsql;-- 日志搜索SELECTlog_level,message,ts_headline('chinese',message,to_tsquery('chinese','错误'),'MaxWords=30')AShighlightFROMsystem_logsWHEREsearch_vector @@ to_tsquery('chinese','错误')ANDcreated_at>now()-INTERVAL'1 day'ORDERBYcreated_atDESCLIMIT50;

场景三:智能搜索建议

实现搜索建议功能,提升用户体验。

-- 创建搜索建议表CREATETABLEsearch_suggestions(idSERIALPRIMARYKEY,keywordVARCHAR(100)UNIQUE,search_countINTDEFAULT0,last_searchedTIMESTAMPDEFAULTnow());-- 记录搜索关键词CREATEORREPLACEFUNCTIONrecord_search(p_keywordTEXT)RETURNSVOIDAS$$BEGININSERTINTOsearch_suggestions(keyword,search_count,last_searched)VALUES(p_keyword,1,now())ONCONFLICT(keyword)DOUPDATESETsearch_count=search_suggestions.search_count+1,last_searched=now();END;$$LANGUAGEplpgsql;-- 获取搜索建议CREATEORREPLACEFUNCTIONget_suggestions(p_prefixTEXT,p_limitINTDEFAULT10)RETURNSTABLE(keywordVARCHAR,countINT)AS$$BEGINRETURNQUERYSELECTs.keyword,s.search_countFROMsearch_suggestions sWHEREs.keywordILIKEp_prefix||'%'ORDERBYs.search_countDESC,s.last_searchedDESCLIMITp_limit;END;$$LANGUAGEplpgsql;-- 使用搜索建议SELECT*FROMget_suggestions('KES');

总结与展望

全文搜索是KES的重要功能。通过合理的索引设计和分词配置,可以实现高效的文本检索。

核心原则:

  1. 根据搜索需求选择合适的索引类型
  2. 合理配置分词器,提升搜索质量
  3. 使用权重机制优化搜索结果排序
  4. 建立搜索建议机制,提升用户体验
  5. 定期分析搜索性能,持续优化

KES的全文搜索功能强大,能够满足各种复杂的搜索场景。在实际应用中,建议根据业务特点设计合理的搜索方案,充分发挥全文搜索的优势。

期望本篇内容能够帮助你掌握KES全文搜索的核心技术,为构建高效的搜索系统提供技术支撑。

返回列表