Agent 实操入门 10:让 Agent 说你公司的“话“——知识库与 RAG 入门
前九篇,你学会了怎么用、怎么用得安全、怎么避开坑、怎么持续进阶。
但有一个问题一直悬在头顶:通用的 Agent 不懂你的公司。
它不知道你们的产品叫什么、流程怎么走、客户政策是什么——于是它只能"编"。这一篇,给你一把解药:知识库 + RAG。它能让 Agent 基于"你给的资料"回答,少瞎编、能溯源。
这也是你从"个人提效"走向"企业方案"最关键的一步。
一、为什么通用 Agent 会"不懂装懂"?
回想第 8 篇讲的"幻觉":Agent 底层是语言模型,它的知识来自训练数据,有截止日期、没有你的内部信息。
所以当你问它:“我们公司的退货政策是怎样的?”“客户 A 的实施方案里第三步是什么?”
它会有两种反应:
- 编一个:听起来很像,但完全是错的(最危险)
- 说不知道:因为训练数据里根本没有你公司的资料
一句话:没有资料的 Agent,就像一个没看过员工手册就上岗的实习生——只能靠猜。
第 8 篇教你怎么"识别幻觉、人工把关"。这一篇教你怎么"从根上减少幻觉"——把资料喂给它。
二、知识库是什么?(大白话版)
知识库 = 你给 Agent 的"专属资料包"。
| 类比 | 说明 |
|---|---|
| 实习生的入职培训手册 | 新人上岗前,HR 给他一堆资料:公司介绍、产品手册、流程规范 |
| 你的私人书架 | 你把自己的笔记、文档、模板全摆出来,Agent 需要时就去翻 |
| 带索引的档案柜 | 不是堆在一起,而是分好类、能快速找到某一页 |
没有知识库的 Agent:靠脑子(训练数据)硬答 → 容易编。
有知识库的 Agent:先翻你的资料再答 → 靠谱、可溯源。
注意:知识库不是"把文件传上去就完事"。它是一套**“存资料 + 能检索”**的机制,下面讲 RAG 时会明白为什么。
三、RAG 是什么?(核心概念,慢慢看)
RAG = Retrieval-Augmented Generation,检索增强生成。
名字唬人,拆开就三件事:先检索(Retrieval)、再增强(Augmented)、后生成(Generation)。
3.1 普通 Agent 的回答流程
你提问 → 模型凭训练记忆硬答 → 输出(可能编)模型脑子里没有你的资料,只能"猜"。
3.2 RAG Agent 的回答流程
你提问 → ① 检索:去你的知识库里,找出和最相关问题相关的几段资料 → ② 增强:把"问题 + 搜到的资料"一起交给模型 → ③ 生成:模型基于这些资料作答,并标注出处 → 输出(基于真实资料,少瞎编)关键区别:普通 Agent 是"凭记忆答",RAG Agent 是"先查资料再答"。这就像考试——开卷考试(RAG)总比闭卷硬编(普通)靠谱。
3.3 一张图记住 RAG
┌─────────────┐ │ 你的知识库 │ (产品手册/流程/政策/历史方案) └──────┬──────┘ │ ① 检索相关片段 ▼ 提问 ──→ [ 检索器 ] ──→ 相关段落 A、B、C │ ② 拼进问题 ▼ [ 大模型生成 ] ──→ ③ 基于 A/B/C 作答 + 标注来源 │ ▼ 最终答案(可溯源)四、一个真实例子:差别有多大?
场景:客户问"你们的标准实施周期是多长?"
没有知识库的 Agent
“根据行业标准,一般实施周期为 2~4 周。”(它编的,你们公司实际是 6~8 周,还说"行业标准"显得很权威)
→ 你拿去回客户,承诺了 4 周,实际要 8 周,埋雷。
有知识库(RAG)的 Agent
“根据《XX 产品实施规范 V3》第 2.1 条,标准实施周期为6~8 周,其中需求确认占 1 周、部署占 3 周……(来源:实施规范 V3 / 第 2.1 条)”
→ 答案来自真实文档,还标了出处,你一眼能核实。
这就是 RAG 的价值:把"编的"变成"有出处的"。
五、你能怎么搭一个最小知识库 Agent?(三步走)
不需要学编程。主流平台(WorkBuddy、Coze、Dify 等)都内置了知识库功能。核心三步:
Step 1:准备资料(最重要,也最容易被忽略)
把你要 Agent 依据的资料整理好:
| 该放什么 | 例子 |
|---|---|
| 产品/服务手册 | 功能说明、定价、版本差异 |
| 流程规范 | 实施流程、审批流程、SOP |
| 政策制度 | 退货政策、售后条款、合规要求 |
| 历史方案/案例 | 脱敏后的成功案例、模板 |
| 常见问答 | 客户常问的 50 个问题及标准答案 |
⚠️复习第 8 篇:放进知识库的资料,同样要脱敏!客户名、金额、个人信息先处理掉。知识库不是"保险箱",别把红线区信息塞进去。
Step 2:上传并建立索引
在平台里新建一个知识库,上传文件。平台会自动做两件关键的事(你不用懂原理,知道它在干啥就行):
- 切片:把长文档切成小段落(一段一段存,方便精准检索)
- 向量化:把每段话转成一串"语义指纹",让"意思相近"的内容能被找出来(比如你搜"退货",它能找到写"退款"的那段)
这一步你唯一要操心的:切片别太碎也别太长。太碎会丢失上下文,太长会引入无关内容。多数平台有默认设置,先跑通再用真实效果微调。
Step 3:写提问规则,强制"带出处"
在专家/助手的指令里加一句(呼应第 4 篇五要素中的"要求"):
回答时只能基于知识库内容。 每条结论必须标注来源(出自哪个文件的哪一部分)。 如果知识库中没有相关信息,明确回答"资料中未提及",不要编造。这等于给 Agent 上了双保险:既限制它用资料,又逼它亮出证据。
六、知识库不是万能的:四个坑要避开
RAG 能大幅减少幻觉,但它有边界。新手最常踩的四个坑:
| 坑 | 表现 | 怎么避 |
|---|---|---|
| 资料过期 | 知识库里是旧版手册,Agent 按旧的答 | 建立"资料更新机制",重要文档改了就重新上传 |
| 切片质量差 | 一段话被切成两半,检索时只找到半句,答非所问 | 上传前把文档结构理顺,标题层级清晰 |
| 检索不到 | 问题措辞和资料不一样,搜不到相关内容 | 在提问规则里允许 Agent 先"改写问题再检索" |
| 过度依赖 | 以为有知识库就绝对不会错,不再核查 | 第 8 篇的验证清单照用不误——带出处的答案也要抽检 |
记住:知识库让 Agent"更可能答对",但不等于"一定答对"。它把错误率从"经常编"降到"偶尔错",但人工把关那一关不能撤。
七、和前面几篇的呼应
这一篇不是孤立的,它把前面学的串了起来:
- 第 8 篇(安全):知识库资料要脱敏,带出处的答案仍要验证 → 本篇 Step 1、第六节
- 第 4 篇(指令):"只基于知识库、标注来源、不知道就说"是五要素"要求"的高级写法 → 本篇 Step 3
- 第 9 篇(进阶 L4):知识库 / RAG 正是"解决方案构建者"的核心能力 → 本篇是 L4 的第一块地基
第8篇 防幻觉(人工把关) ↑ 治标 第10篇 知识库+RAG(从根上减少幻觉) ↑ 治本 + 企业级能力八、系列完整地图(1~10 篇)
| 篇 | 主题 | 一句话总结 |
|---|---|---|
| 01 | Agent 是什么 | 会思考 + 会动手的 AI,能感知、规划、执行 |
| 02 | 工具怎么挑怎么用 | 七大功能,新建任务是真正让它动手 |
| 03 | Markdown 格式 | 结构化文本是 Agent 的通用语言,还省积分 |
| 04 | 指令写作 | 五要素框架:角色+任务+背景+要求+示例 |
| 05 | 专家+技能+自动化 | 把好指令固化,一次调好反复用 |
| 06 | 多 Agent 协作 | 复杂任务拆步骤,多 Agent 分工配合 |
| 07 | 实战场景拆解 | 五个真实场景跑通全流程 |
| 08 | 安全与验证 | 知道什么能给、怎么防幻觉、怎么验证输出 |
| 09 | 避坑与进阶 | 避开六个误区,按 L1→L4 路线持续成长 |
| 10 | 知识库与 RAG | 喂资料给 Agent,让它基于真实内容答、可溯源 |
九、写在最后
你现在已经掌握了"个人提效"的全部基本功,又补上了通往"企业方案"最关键的一块拼图——让 Agent 说你公司的"话"。
回顾这十篇,一条清晰的成长线就出来了:
懂概念(01)→ 会工具(02~03)→ 写指令(04)→ 固化复用(05)→ 协作编排(06~07)→ 安全靠谱(08)→ 避坑进阶(09)→ 企业级能力(10)
下一步,如果你真想往"解决方案架构师"走,可以挑你们公司一份真实、脱敏过的文档(比如一份实施 SOP),按本篇三步法,搭一个最小知识库助手试试。跑通的那一刻,你就不再只是"Agent 的使用者",而是能用 Agent 解决真实业务问题的人。
本文是《Agent 入门学习指南》系列第十篇(知识库篇)。
通用的 Agent 是"聪明的陌生人",有知识库的 Agent 才是"懂你公司的自己人"。
从这一篇起,你开始具备交付企业方案的能力。