ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

售后知识助手落地笔记:蓝耘元生代上哪些不用自己干

售后知识助手落地笔记:蓝耘元生代上哪些不用自己干 起因很普通一个做小家电的朋友售后团队两个人在售型号四十多个说明书和常见问题散在几个共享文件夹里。客户问一句这个滤芯多久换一次客服得先确认是哪个型号再翻对应的手册来回三四分钟他想做个能自动回答的入口。我列了张清单文档切片、向量库、embedding 服务、重排模型、一套常驻的问答服务再加一份调用日志写满小半页纸。真动手以后发现这半页纸上大部分条目蓝耘元生代的控制台里已经有了下面按我实际走过的顺序讲每一节都是同一个结构我原本准备自己干什么后来发现不用干以及这件事的边界在哪。一、一个凭证撑起文字和图片两条输入朋友的问答会遇到两类输入一类是客户打字的文字问题另一类是客户拍的产品铭牌照片他想让客服直接拍照不用手输型号前者走文本模型后者得能看图按我以前的习惯这两类要各申请一份凭证再写两套鉴权代码。蓝耘元生代这边则是一份凭证管住全部模型模型名只是请求体里的一个字段接口地址也只有一个fromopenaiimportOpenAIimportos clientOpenAI(base_urlhttps://maas-api.lanyun.net/v1,api_keyos.environ[LANYUN_API_KEY],)answerclient.chat.completions.create(modelqwen3.8-max,messages[{role:user,content:question}],)chat.completions这套方法、消息结构、流式返回、工具调用一行都不用改。从接入角度看改动量就是base_url和model两个字符串。少一份凭证省掉的不只是一次申请。配额要分两处看、用量要对两遍账、轮换密钥要停两次服务这些都是常态化的维护成本现在这一行直接从清单上划掉了。边界也在这儿一份 Key 能调平台上的全部模型一旦泄出去损失面比原来大得多凭证少了不等于风险小了是风险集中了所以这份 Key 只从环境变量读代码里不出现明文开发和生产分开两份换的时候按环境换。二、检索那段没自己写创建表单只有三项我原本打算自己搭检索做法都想好了把四十多份手册切成小块算向量存进向量库查询时先检索再拼上下文效果不够就再挂一个重排模型这套东西写起来不算难难的是它得一直活着向量库要备份embedding 服务要扛住并发手册更新了要重跑一遍切片。实际动手时发现蓝耘的控制台里「数据管理 知识库」点一下新建表单只有三个字段。知识库名称填到一百字知识库描述填到两百字向量化模型从下拉里选一个确定就完了。向量库、切片逻辑、embedding 服务全在后面列表页会给每个库标出切片数量和文档数量状态和更新时间也是一列。向量库和 embedding 服务这两样我一样都不用部署选一个向量化模型整条检索链路就通了对照我那张清单划掉的是切片逻辑、向量库的选型与运维、embedding 服务的部署和扩容。边界落在文档量级上这套做法适合资料在几十份到几百份、问题以查事实为主、不需要复杂排序的场景朋友那四十多份手册正好落在区间里如果文档到了十万份这个量级或者要按人员权限做隔离、要混合检索加重排序那还是得自己搭它给的是能跑起来的下限不是能力上限。三、对话层有现成模板但那是默认答案不是唯一答案蓝耘的「模型服务 智能路由」这一页我看得比较久页面顶部写着一句原文「平台提供内置路由策略支持直接调用或复制后调整模型优先级与异常处理规则。」页面分两排。上排是分类标签办公协同、客服工单、研发分析、文档数据、营销多媒体。下排是十张按业务场景预置的模板卡片通用、智能客服与工单、邮件与即时消息辅助、企业知识库问答、合同与法务审阅、公文与文档写作、财务票据与报表处理、代码开发与评审、数据分析与商业智能、营销文案与多媒体创作常见的企业业务类型基本都覆盖到了。朋友这个场景正好落在客服工单这一类里每张卡片都预置了一组默认模型三个主模型加两个备用模型还标了适用任务卡片底部三个动作调用标识、立即调用、复制编辑调用标识就是拿去当模型名用的东西代码里把它填进model字段请求就落到这套策略上。这里有个容易搞混的地方我一开始也想错了。模型广场里那个叫 AutoModel 的看着也是不用自己选模型但它和智能路由不是一回事AutoModel 是广场里的一个模型填进模型名就把选型权交出去了代价是响应里只回automodel这个名字不告诉你实际路由到了谁。智能路由则是模型服务下的一个独立入口拿到的是一个任务标识策略和模型集能在线改任务详情里带账单。这一页真正有用的地方是它把复制编辑摆在了明面上平台给的是默认答案不是唯一答案。预置的模型组如果不合适复制一份出来改模型优先级、改异常处理规则改完在线生效不用发版朋友这个规模我打算先用默认的等真出现某一类问题答不好再复制一份出来动。边界提前记一笔模型集带着自己的限流配额撞到配额的表现是请求被拒而不是变慢所以备模型不能是摆设得真的能顶上去。四、模型不是越贵越好得看这次任务被什么决定客服问答是短问短答输入是客户一句话加上检索回来的几段资料输出是两三句解释这类任务的量级不大。蓝耘同一份凭证下的模型单价差得并不小输入从每百万 token 两块钱到十二块钱都有输出从三块到三十六块都有输出那一项能差出十倍以上。所以选型的第一件事不是挑最便宜的而是先看这次任务的成本被输入还是被输出决定客服问答两头都轻中档模型足够像把一整年的工单导出来做归类这种输出量大、结构要求高才值得往上走一档。有一个可以带走的判断输出量是你说了算的输入量是资料说了算的输出多的任务先想办法压输出限字段、限条数、只让它回结构化的东西压完再考虑换模型。输入多的任务先想办法少喂检索命中准一点少拼几段无关资料比换模型省得多。五、想把口径改掉我算了一笔账问过几轮之后会冒出一个念头能不能让模型学会朋友家的说法。四十多个型号的换件周期、耗材规格、常见故障这些内容是固定的全塞进提示词太长靠文档检索又未必每次都能命中。「模型服务 模型微调」就是冲这件事来的蓝耘把它收进了一个表单底座模型从平台上的模型里选训练方式是 LoRA参数是 Epoch、Learning rate、batch_size、LoRA Rank、LoRA Alpha、LoRA Dropout 六个。数据集从「数据管理 数据集」里挑那边分 SFT 微调、DPO、继续预训练三种格式是 jsonl。往下是选算力型号是 NVIDIA H200一卡一小时十六元两卡三十二四卡六十四八卡一百二十八按卡数和时长线性走。我在这儿停下来算了一下朋友那边一天的咨询量就算全交给模型推理开销也是分这个量级。而训练的最低下限是一卡一小时十六元这两者差着一个数量级不是省着用就能拉平的。所以这一节我没往下走微调对朋友这个规模还不是现在该做的事等工单攒到几千条、某个环节反复出错、并且这个能力要在多个业务里重复用摊销的分母才够大。入口我还是记下来了它解决的是想做这件事的时候不用先解决有没有机器的问题买不到卡、抢不到时段、环境配不明白这三样真到微调那一步都会拦人。一处细节如实记下训练费用那一栏显示的是抵扣后的数字页面上写着存在卡券会优先使用卡券所以看到零不代表不花钱得连账户里的券和余额一起看。六、常驻那一步选两个下拉框就够了问答要能被人用得有个地方常驻我原本的打算是租一台小服务器装好运行环境用进程守护跑起来前面挂反向代理配好证书。实际在蓝耘上走了一遍流程是三个选择加一次点击先选模式OpenClaw 或者 Hermes 二选一这两个都是开源项目平台把它们做成了可以直接创建的容器。再选套餐日常开发那档是每月二十九元、两核四G内存、五十G系统盘尝鲜那档是每月九块九、两核两G、二十G选完挂载哪个模型、买多长时间点创建。整个过程没有出现部署脚本、没有出现 Dockerfile、也没有出现反向代理配置。这一节我也没往下走原因很直接朋友那边还没有真实咨询量现在迁过去只是把一台空跑的机器从我这挪到平台上每月照样付一份钱我的做法是先在本机把问答链路跑顺等真的有人用了、量起来了再迁那时候选套餐也有依据知道该选两核还是四核。边界说清楚九块九那档是两核两G客服问答这种并发不高的场景够用。但要记住它是按月计费的常驻成本跟按 token 走的推理费用是两笔账一笔随用量走一笔不管用不用都要付。七、账本有两本维度不一样跑起来之后要盯的是两件事钱花在哪和为什么慢。蓝耘的调用记录里单独有一列 TTFT首字延迟。这一列的价值在于把慢拆成了两段从发出请求到吐出第一个字的等待和之后流式输出的过程这两段的原因完全不同前者是排队和调度后者是输出 token 的数量。没有这一列你只知道一次对话花了八秒至于是模型卡住还是答案太长只能靠猜。平台那本账按模型、调用方式、API Key、统计周期几个维度切切到哪个模型花了多少就到头了它回答不了哪一步花了多少因为一次业务动作中间可能调了好几次模型平台看到的是几次独立请求。所以我另外记了一本按阶段记检索、生成、复核各占多少 token。两本账不是重复劳动平台那本管结算我记的那本管优化哪一步值得改只能从自己那本里看出来。八、清单上还剩什么回到开头那张清单四十多个型号、两个客服、一堆散着的手册这件事现在有了可行的做法接一个接口建一个知识库套一张客服模板先在本机跑通。这半页清单上的活蓝耘元生代接走了一大半划掉的是向量库、embedding 服务、切片逻辑、多份凭证、训练环境、部署脚本留下的是提示词怎么写、检索命中率高不高、答错了怎么发现这些事没人能替你干工具只负责把重复的部分收走。
返回列表