ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

MiroFish-Offline实体抽取原理:用本地LLM做本体引导的NER/RE,告别云端NER API

MiroFish-Offline实体抽取原理:用本地LLM做本体引导的NER/RE,告别云端NER API MiroFish-Offline实体抽取原理用本地LLM做本体引导的NER/RE告别云端NER API【免费下载链接】MiroFish-OfflineOffline multi-agent simulation prediction engine. English fork of MiroFish with Neo4j Ollama local stack.项目地址: https://gitcode.com/gh_mirrors/mi/MiroFish-OfflineMiroFish-Offline 是一款完全本地化的多智能体模拟与预测引擎它用 Neo4j Ollama 本地技术栈替代了原版 MiroFish 依赖的 Zep Cloud。它的实体抽取NER/RE不依赖任何云端 NER API而是由本地大模型在本体Ontology引导下完成数据全程不出内网。为什么实体抽取要先谈本体传统 NER 工具spaCy、云端 NER API返回的是通用标签人名、地名、机构。但对社会舆论模拟来说这种无差别抽取远远不够——你希望从一份学术不端事件的报道中精准抽取出学生教授高校媒体机构以及就读于报道了这类关系。MiroFish-Offline 的解法是先由 LLM 为当前文档量身定制一套本体再用这套本体约束后续的实体/关系抽取。第一步LLM 自动设计本体本体生成由 ontology_generator.py 中的OntologyGenerator完成。它把文档内容截断到 5 万字符内连同模拟需求一起交给本地 LLM产出一份 JSON 本体定义包含10 个实体类型前 8 个是根据文档内容设计的具体类型如Student、Professor、University最后 2 个固定为兜底类型Person和Organization确保任何人物/机构都有归宿见 ontology_generator.py6~10 个关系类型如STUDIES_AT、REPORTS_ON并声明源/目标实体类型约束属性定义每类 1~3 个关键属性且避开name、uuid等系统保留字生成的本体会以 JSON 形式持久化到 Neo4j 的 Graph 节点上ontology_json属性存储与读取逻辑在 neo4j_storage.py。这一步是引导式抽取的前提本体即图纸后续抽取必须按图施工。第二步分块文本送进 NER 抽取器建图流程由 graph_builder.py 编排用TextProcessor.split_text把全文切成约 500 字符、带 50 字符重叠的文本块text_processor.py每个文本块交给抽取器做 NER/RE再批量生成向量写入 Neo4j见 graph_builder.py真正的抽取器是 ner_extractor.py 里的NERExtractor核心思想是**结构化 Prompt JSON 输出**系统提示词注入本体把实体类型、关系类型、属性约束完整写进 system prompt并明确规则——只抽取本体中定义的类型、实体名归一化、宁可漏抽不可乱抽见 ner_extractor.py低温调用保证稳定通过LLMClient.chat_json()以temperature0.1调用 Ollama 上的本地模型如 qwen2.5:32b压低随机性、换取抽取精度ner_extractor.py失败自动重试JSON 解析失败或接口异常时最多重试 2 次仍失败则返回空列表而不中断建图输出清洗与兜底按实体名去重、校验关系两端实体是否存在若 LLM幻觉出一条缺少端点的关系会自动补建Entity类型的占位节点ner_extractor.py抽取结果如何进入 Neo4j 图谱Neo4jStorage.add_text()是落库入口NER 完成后实体摘要与关系事实被批量向量化本地nomic-embed-text模型随后写入图谱实体按graph_id 小写名称做MERGE 去重同一实体在多个文本块中只保留一个节点属性增量更新neo4j_storage.py每个文本块生成一个Episode节点保存原文方便溯源本地方案相比云端 NER API 的优势维度云端 NER API / Zep CloudMiroFish-Offline 本地方案网络依赖必须联网数据出境零云依赖文档不出内网领域适配通用标签需二次过滤本体引导抽取类型随文档定制成本按调用量计费Ollama 本地推理一次性投入可控性黑盒Prompt、重试、清洗逻辑全部开源可见对涉及敏感文档内部报告、政策草稿、财务文件的场景抽取过程完全在本地往往是一票否决项——这正是该 fork 的核心价值。快速体验整个流程不需要你手写任何抽取代码。拉取仓库后用 Docker 一键启动git clone https://gitcode.com/gh_mirrors/mi/MiroFish-Offline cd MiroFish-Offline cp .env.example .env docker compose up -d然后把 LLM 与向量模型拉到本地 OllamaREADME.mddocker exec mirofish-ollama ollama pull qwen2.5:32b docker exec mirofish-ollama ollama pull nomic-embed-text打开http://localhost:3000上传一份报告走完图谱构建步骤即可在可视化页面看到实体类型图例、节点关系与抽取出的事实句子——那正是本地 LLM 本体引导抽取的产物。想深入阅读源码重点看这三个文件本体生成backend/app/services/ontology_generator.py抽取器backend/app/storage/ner_extractor.py建图编排backend/app/services/graph_builder.py一句话总结MiroFish-Offline 把本体设计 → 本体引导抽取 → 向量落库三步全部搬到本地 LLM 上用一份精心设计的 Prompt 换掉了云端 NER API既省了费用又让实体抽取真正懂你的业务领域。【免费下载链接】MiroFish-OfflineOffline multi-agent simulation prediction engine. English fork of MiroFish with Neo4j Ollama local stack.项目地址: https://gitcode.com/gh_mirrors/mi/MiroFish-Offline创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表