ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

网安研途 · 技术报告文档

网安研途 · 技术报告文档 网安研途 · 技术报告文档系统架构、关键技术模块与工作流程解析1. 系统总体架构「网安研途」采用Dify 可视化工作流Workflow架构整体是一条「输入 → 条件路由 → 多分支处理 → RAG 检索 → LLM 生成 → 输出」的有向无环图DAG。其核心范式是用户输入(query1 / user_pdf) │ ▼ [条件分支 if-else] ← 基于 query1 的关键词/等值匹配路由 │ ├─(F1–F9 分支)──► [代码节点生成检索词] ─► [知识检索] ─► [LLM 生成] │ │ └─(F10 默认)────► [安全护栏 LLM] ─► [意图解析] ─► [知识检索] ─► [推荐 LLM] ▲ 部分分支经 [迭代 Iteration] 批量检索编排层Dify Workflow Graph节点type包括start、if-else、code、knowledge-retrieval、llm、document-extractor、iteration、end。模型层统一调用本地qwen3:4bLLM、qwen3-embedding:4bEmbedding、bge-reranker-v2-m3重排。知识层两个本地向量知识库Dataset通过 Dify 知识检索节点接入。安全层独立「防护检测器」节点F10 前置做恶意意图判定。2. 运行环境与依赖依赖类型版本用途ollama模型插件0.1.2提供 LLMqwen3:4b与 Embeddingqwen3-embedding:4bxinference模型插件0.0.9提供重排模型bge-reranker-v2-m3全局参数所有 LLM 节点temperature0.7modechat均关闭视觉vision.enabledfalse。特性开关file_upload关闭、retriever_resource开启、sensitive_word_avoidance关闭、speech_to_text/text_to_speech关闭、suggested_questions关闭。知识库Dataset冷知识库用于 F1检索配置开启重排reranking_modelbge-rerankertop_k5score_threshold0。主论文库用于 F2–F10 绝大多数检索节点采用weighted_score关键词权重 0.5 向量权重 0.5embeddingqwen3-embedding:4btop_k4–10 不等其中通用检索F10向量权重更高0.3/0.7。3. 关键技术模块3.1 条件路由模块if-else入口节点对query1做 10 路判定trueGive me surprise等值、Give me idea、什么样的人/关注什么领域/我的研究方向、创新点、展望、总结、查新、上传总结、上传文、false兜底。实现了「一句话即服务」的低门槛交互。3.2 代码节点Code / Python3承担三类职责是整个工作流的「结构化胶水」随机选词F1/F2/F3 用random从预置英文关键词列表中抽样制造惊喜感与多样性。JSON 稳健解析多个代码节点代码执行 5/6/7/8/9/11/12实现extract_json_from_response()先剔除think.../think推理标签再按json或最外层花括号提取 JSON并做类型/长度校验关键词上限 10、核心词上限 8。这是对本地小模型输出不稳定的关键容错。查询构造F10 将意图 JSON 拼装为search_query字符串带降级保底词network security。3.3 知识检索模块knowledge-retrieval支持两种检索策略多路加权weighted_score关键词检索与向量检索各占权重适用于主论文库。重排reranking冷知识库启用bge-reranker对 top 结果二次精排提升趣味冷知识的准确性。3.4 迭代模块IterationF4/F6/F7/F8/F9 的「深度玩法」核心。以多组检索词如search_keyword_groups、expanded_queries、idea_phrase、queries为迭代器parallel_nums10在迭代体内对每个词执行一次知识检索并聚合最后由综述/查新 LLM 统一整合。显著提升召回广度与综述覆盖面。3.5 LLM 生成模块共约 22 个 LLM 节点按角色分工领域专家型冷知识生成、创新点生成、可行性评估、学术画像、文献综述、愿景展望、现状分析、查新对比、论文解析。中间件型意图分析输出 JSON、检索词生成、英文摘要、检索查询生成。安全型防护检测器判定malicious/benign。多个节点强制要求「基于检索上下文、禁止凭空想象」并内置引用标注规范如【标题xxx】、[ID: xxx]。3.6 文档提取模块document-extractorF8/F9 入口。接收user_pdf变量抽取论文纯文本后送入摘要/关键词 LLM再进入检索与对比链。3.7 安全护栏模块F10 前置LLM 20「防护检测器」依据六类恶意意图定义泄露知识库/系统提示、有害内容、提示注入、攻击技术细节、资源滥用等输出{judgment, reason}若malicious直接终止输出拦截原因否则放行至意图解析。对正常科研讨论含攻击原理、漏洞分析判定为benign避免误伤。4. 端到端工作流程以 F4「创新点」与 F10「通用检索」为例F4 创新点构思链query1(含创新点) → LLM5 科研意图分析 (JSON: intent_category, core_keywords) → 代码5 解析 → LLM6 检索关键词生成 (search_keyword_groups) → 代码6 解析 → 迭代(逐词) → 知识检索4 → 聚合 → LLM7 文献综述 (integrated_knowledge JSON) → LLM8 创新研究顾问 (3–5 创新点) → 输出(ability5)F10 通用检索链默认兜底 安全query1(其他) → LLM20 防护检测 (judgment/reason) → 代码11 解析 → if-else2: malicious → 输出拦截原因 benign → LLM21 意图解析 (JSON) → 代码12 构造 search_query → 知识检索10 → LLM22 检索推荐 (结构化论文列表) → 输出(last)5. 已实现节点与接线备注结构观察节点规模Start(1) if-else(2) code(12) knowledge-retrieval(10) llm(22) document-extractor(2) iteration(6) end(11)合计约 66 个节点是一张功能密集的工作流。接线缺口重要条件分支展望当前直接连到「文献综述 LLMLLM7」而专门设计的「愿景展望」子链LLM9 领域识别 → 迭代2 → 知识检索5 → LLM10 愿景展望 → 输出5future未接入主 if-else 路由处于不可达orphaned状态。这意味着 F5 实际复用的是综述/创新顾问链并非独立的愿景展望生成。该现象应在部署前修正接线或清理冗余节点。多路复用「主论文库」被 9 个检索节点共享代码执行 6出现同名两个节点分别解析search_keyword_groups与domain_keywords属历史复制不影响运行但增加维护成本。单轮无记忆Workflow 模式无conversation_variables持久化每次调用独立无法跨轮引用上下文。6. 技术小结「网安研途」本质上是一个「路由 RAG 多 Agent 角色编排」的本地化科研助手用 if-else 做意图粗分用代码节点做结构化解析与容错用迭代节点把「多视角检索」工程化用不同角色 LLM 实现从灵感到查新的科研全链路覆盖并用独立护栏保障安全。其工程亮点在对本地小模型输出不稳定的 JSON 容错与迭代增强检索主要技术债在接线缺口、小模型能力上限与缺少记忆。
返回列表