ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RAG中数据清洗与预处理阶段具体如何做?

RAG中数据清洗与预处理阶段具体如何做? 1.基本思路2.数据预处理全流程拆解原始数据多格式 │ ├─ 格式转换提取纯文本 │ ├─ PDF → PyPDF2提取文本 │ ├─ HTML → BeautifulSoup解析正文 │ └─ Excel → Pandas读取表格内容 │ ├─ 清洗降噪 │ ├─ 去除重复相邻重复段落检测 │ ├─ 过滤噪声正则表达式去除标点、特殊符号 │ └─ 敏感信息处理PII检测库删除隐私数据 │ ├─ 智能分块核心步骤 │ ├─ 动态切分按“标题→段落→句子”优先级切分如先按“### 第三章”分章节再按句号分句 │ ├─ 长度校验单块不超过模型最大token数的60%预留空间给用户问题和提示词 │ └─ 重叠处理相邻块保留10%重叠如块1结尾100字作为块2开头避免切断跨段语义 │ ├─ 语义增强 │ ├─ 元数据标注 │ │ ├─ 规则提取用正则匹配“2024年”“张三”等实体 │ │ └─ LLM提取用GPT-4生成“核心关键词”“所属部门”等标签 │ └─ 向量化 │ ├─ 通用模型Sentence-BERT快速上线 │ └─ 领域模型BGE-M3多语言、ColBERTv2长文本优化 │ └─ 存储索引 ├─ 向量库Milvus高并发 └─ 关键词库ElasticsearchBM25算法 元数据索引支持过滤查询3.追问
返回列表