ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

用EdgeQuake构建智能问答应用:从PDF摄取到GraphRAG查询的端到端完整教程

用EdgeQuake构建智能问答应用:从PDF摄取到GraphRAG查询的端到端完整教程 用EdgeQuake构建智能问答应用从PDF摄取到GraphRAG查询的端到端完整教程【免费下载链接】edgequakeEdegQuake High-performance GraphRAG inspired from LightRag written in Rust; Transform documents into intelligent knowledge graphs for superior retrieval and generation项目地址: https://gitcode.com/gh_mirrors/ed/edgequakeEdgeQuake是一个用 Rust 编写的高性能 GraphRAG 框架它把 PDF 等文档摄取为知识图谱实体 关系再通过向量 图混合检索实现智能问答回答还带来源引用。本教程带你走完完整链路一键部署 → PDF 摄取 → 图谱查询10 分钟就能拥有自己的文档问答应用。为什么需要 GraphRAG 智能问答传统 RAG 只靠向量相似度找文档片段遇到这类问题就失灵跨文档关联“这两份文件里提到的同一个产品功能有什么区别”关系推理“A 公司 CEO 之前在哪里工作”全局主题“这些文档整体在讲什么”EdgeQuake 的解法是把文档拆解成知识图谱——LLM 从每个文本块中提取实体人物、组织、产品……和关系查询时同时走向量空间和图结构兼顾速度与推理能力。快速开始一键安装 EdgeQuake 问答服务无需 Rust、无需 Node.js只用 Docker 即可。先克隆仓库git clone https://gitcode.com/gh_mirrors/ed/edgequake cd edgequake sh quickstart.sh交互式向导会引导你选择模型提供商OpenAI / Ollama和模型然后自动拉起完整服务栈。启动后访问http://localhost:3000即可使用Quickstart 默认免登录。 想固定版本EDGEQUAKE_VERSION0.32.0 sh quickstart.sh服务地址一览Web UI:3000、REST API:8080、Swagger 文档:8080/swagger-ui。验证服务是否就绪curl -s http://localhost:8080/health | python3 -m json.tool看到status: healthy就说明一切正常。完整的安装细节见 快速开始指南 和 安装文档。第一次进入 WebUI上传页面与知识图谱打开 WebUI 后左侧边栏有 Dashboard、Documents文档、Knowledge Graph知识图谱、Query问答等入口。文档上传页支持拖拽 PDF、TXT、MD 等文件单文件最大 100MB还可以为本次上传单独指定 PDF 解析器当文档摄取完成后在Knowledge Graph页面就能看到自动生成的知识图谱——不同颜色代表不同实体类型人物、组织、产品、概念等点击节点可查看详情PDF 摄取4 步把文档变成知识图谱EdgeQuake 的 PDF 摄取采用两阶段流水线先把 PDF 转成 MarkdownPdfProcessing任务再进行知识图谱摄取Insert任务。整个过程大致分三步第 1 步上传 PDF最简单的方式是在 WebUI 的 Documents 页拖拽上传用 API 的话只需一条 curlcurl -X POST http://localhost:8080/api/v1/documents/pdf \ -H X-Workspace-ID: default \ -F fileyour-paper.pdf \ -F titleResearch Paper接口会立即返回task_id和estimated_time_seconds预估耗时摄取是异步的无需阻塞等待。第 2 步选择 PDF 解析后端EdgeQuake 内置 4 种解析后端pdf_parser_backend后端适用场景vision默认复杂版面双栏、表格、图表由视觉大模型逐页识读edgeparse纯文本数字 PDFCPU 解析快速省钱edgeparse-ocr扫描件EdgeParse Tesseract OCRauto按文本密度自动选择快路径解析失败的 vision 路径会自动回退到文本抽取不会卡死。第 3 步跟踪摄取进度轮询进度也可用 SSE 或 WebSocket 实时推送curl -s http://localhost:8080/api/v1/documents/pdf/progress/$TASK_ID文档状态会依次经历converting转 Markdown→extracting实体抽取→embedding向量化直到display_status变为completed即可查询。中途想放弃一条命令取消curl -X POST http://localhost:8080/api/v1/tasks/$TASK_ID/cancel第 4 步查看抽取结果curl -s http://localhost:8080/api/v1/graph/entities | python3 -m json.tool curl -s http://localhost:8080/api/v1/graph/stats你会看到类似MARIE_CURIEPERSON、RADIUMCONCEPT这样的实体以及 “discovered” 这类关系边。抽取细节含多轮 Gleaning 补漏详见 LightRAG 算法解析。GraphRAG 查询6 种模式怎么选进入 WebUI 的Query页面输入问题即可获得带来源引用的回答。EdgeQuake 提供 6 种查询模式覆盖不同问法模式适合问题原理Naive关键词式查找最快纯向量相似度Local具体实体相关问题定位实体 → 遍历邻居Global主题/全局性问题社区摘要 高层关键词Hybrid默认复杂综合问题Local Global 结合Mix自定义平衡全模式加权融合Bypass纯 LLM 对话不经过 RAG用 API 查询只需curl -X POST http://localhost:8080/api/v1/query \ -H Content-Type: application/json \ -d {query: 文档中提到的关键发现是什么, mode: hybrid}响应包含answer自然语言回答和sources引用片段 相似度分数每个回答都可追溯到具体文档实操示例同一问题的三种问法假设你摄入了三篇公司介绍文档示例见 第一个 RAG 应用教程“谁创立了 TechCorp”→ 用hybrid模式答案直接给出两位创始人及各自职务“CEO 之前在哪里工作”→ 用local模式图谱沿实体关系边找到 “Google DeepMind”“这几份文档整体在讲什么”→ 用global模式基于社区摘要输出主题归纳这就是 GraphRAG 相比传统 RAG 的核心优势关系类问题靠图遍历主题类问题靠社区摘要而不是硬靠向量相似度硬凑。常见问题速查表症状检查方法解决办法文档卡在converting视觉模型服务是否在线检查 Ollamacurl http://localhost:11434/api/tags或改用pdf_parser_backendedgeparse查询返回泛泛的答案文档是否completed轮询至display_statuscompleted再查401 未授权生产模式需登录Quickstart 为免登录生产环境先登录取 token批量上传慢租户并发上限查看GET /api/v1/pipeline/queue-metrics本地 Ollama 默认每租户 1 个并发任务更多排查思路见 常见故障排查 和 PDF 摄取教程。下一步让问答应用更强大多租户为不同项目/客户隔离工作区 → 多租户教程自定义实体类型医疗、法律等 5 套领域预设 → 实体抽取概念知识注入注入术语表、缩写表提升抽取精度 → 知识注入教程SDK 集成Python / TypeScript / Go / Java 等 11 种语言 SDK → SDK 总览API 全量契约REST API 参考 · 架构总览从sh quickstart.sh到第一条带引用的智能回答EdgeQuake 全程只需不到 10 分钟。现在就把你的 PDF 丢进去问问它吧 【免费下载链接】edgequakeEdegQuake High-performance GraphRAG inspired from LightRag written in Rust; Transform documents into intelligent knowledge graphs for superior retrieval and generation项目地址: https://gitcode.com/gh_mirrors/ed/edgequake创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表