
影刀RPA实操指南内容合规审核自动化——违禁词检测与拦截发出去的内容出了违规问题轻则删文限流重则店铺整改而人肉审核几百条待发文案既慢又漏——这是每个做电商内容、社媒运营的人都体会过的痛。我用影刀RPA搭了一套内容合规审核流程待发内容批量采集进来违禁词逐条检测、命中即拦截再由大模型做二次复核有风险的推飞书群让人确认。这篇从零讲到跑通参数、指令、坑全给你。整个流程在影刀RPA里就是采集→检测→拦截→通知四段核心是违禁词检测的判断逻辑和大模型复核的接入方式两个重点都会掰开讲细。认识影刀RPA安装与流程骨架影刀RPA的安装很简单官网下载客户端社区版免费一路下一步装完再按提示装好Chrome或Edge浏览器插件网页自动化才有基础。新建应用后先在画布上搭出骨架四个子流程区域分别对应采集、检测、拦截、通知。右侧指令面板搜索框找指令拖到画布填参数就能用全程不写代码。动手前把顶部工具栏的Python图标点亮点击等待初始化完成违禁词检测的判断逻辑用Python协同写最干净后面会给出代码。元素定位四合一把待审内容抓准审核的对象是待发内容可能是商品详情文案、笔记草稿或评论区列表抓取靠元素定位四件套元素捕获、XPath、CSS选择器、正则表达式。操作路径点击顶部工具栏捕获元素按钮浏览器跳转后鼠标移到目标上出现橙色边框点击确认。列表型内容抓到单条后用获取相似元素列表配合相似元素循环批量取。文案场景常用的定位写法# 捕获元素编辑器内的正文文本框contenteditable场景 //div[classeditor-content] # 捕获元素列表页每条商品的标题节点 //*[classgoods-list]//div[classitem]//p[classtitle] # 模糊匹配定位包含规格文字的配置区块 //*[contains(text(),规格)] # 参照物定位价格取标题节点的下一个兄弟元素 //*[contains(class,title)]/following-sibling::*[1]XPath与CSS的选择原则按属性和层级用CSSdiv.item p.title按文本特征、找父级兄弟用XPath。正则表达式留在文本清洗环节比如剔除表情符号和空行后再送检。class是动态哈希时千万别捕获它换文本或层级定位不然流程活不过三天。变量与数据类型违禁词库怎么存违禁词检测的核心数据结构有两个选对结构流程就成功一半。违禁词库用列表存[“最便宜”, “第一”, “国家级”, “根治”, “纯天然”]每行一个词最好放Excel单独一个Sheet加载时用读取区域指令读进列表变量运营加词不用动流程。检测结果用字典存{“内容”:原文, “命中词”:“根治”, “风险等级”:“高”, “状态”:“已拦截”}写表、推通知都从这个字典取值。字符串操作贯穿全程检测前的统一转小写英文违禁词场景、去空格换行命中后的文本截取定位。JSON则是大模型复核环节的载体——API响应是JSON文本用【转换成Json对象】转成字典再取值这个指令和配套的【转换成文本】是处理JSON的两个基本件。字典取值的老规矩先判断键是否存在再取复核接口偶尔返回缺字段的响应不防御就会随机中断。流程控制与违禁词检测主逻辑检测逻辑本身是三件套的组合相似元素循环或ForEach列表循环遍历内容If条件判断命中情况Try-Catch兜住异常。违禁词匹配我用Python协同写嵌套循环加位置标记比拖一堆指令清晰# 输入content(待审文本, str)、banned_list(违禁词列表, list)# 输出hit_words(命中的违禁词, list)、risk_level(风险等级, str)hit_words[]forwordinbanned_list:# 逐个违禁词检查ifwordandwordincontent:# in 判断文本是否包含该词hit_words.append(word)iflen(hit_words)2:# 命中2个及以上判高风险risk_level高eliflen(hit_words)1:risk_level中else:risk_level低输入是待审文本和词库列表输出是命中词列表和风险等级直接给If分支用。分支处理低风险放行写入已通过中风险写入待复核并保留原文位置高风险执行拦截——不发布、写表标记、触发通知。这里有个容易忽略的坑违禁词库里如果有第一这类短词第一时间这种正常表达会误伤我后来按词义给词库加了白名单字段命中后先查白名单再定级。异常处理标配Try块包检测逻辑Catch块用【打印日志】记下第几条内容和报错信息Finally清场【End Try】收尾保证一条内容出错不拖垮整批。网页自动化待审内容采集的底座内容从哪来如果是后台待发布的商品或笔记采集环节就是标准网页自动化。三个必备处理等待用【等待元素】等列表节点出现别用固定等待硬熬弹窗按五步流程处理——判断元素存在、捕获关闭按钮、点击关闭、Esc兜底、继续主流程懒加载页面小红书草稿列表这类用滚动一屏高度变化判断index去重把内容滚全。翻页的判断写法循环点下一页用按钮class里是否含disabled判断尾页这是官方文档翻页场景的标准解法。窗口如果在新标签页打开用切换窗口指令按标题切换别模拟点击标签页。鼠标键盘和图像在这条流程里是备胎DOM拿不到的内容才用OCR增值服务通用文字识别0.1元/次起图片素材里的文字合规也靠OCR转文本后进检测桌面软件里的内容用图像识别配合等待图像出现、点击图像操作。数据处理检测结果回写与标红审核结果要落到Excel让人看得见。表头设计内容摘要、命中词、风险等级、状态、处理时间。用【设置单元格内容】逐格写入高风险行的状态列用Excel指令把单元格底色标红打开表格一眼看到问题行。汇总用Python协同统计总条数、各等级数量、高风险内容清单写进汇总Sheet。这里顺便提Excel的三个经典报错写入数字变文本先把单元格格式设为常规循环Excel报Array to String是二维列表当一维用了日期偏移一天是序列号转日期的偏移问题处理日期列时留意。如果词库或结果需要多人协作编辑数据也可以存SQLite或MySQL数据库连接的三步是查询、批量插入、用完关闭连接字符串写错是最常见的报错来源。大模型二次复核HTTP 请求接入API词库检测解决显性违禁隐性风险打擦边球的表述、暗示性用语要靠大模型复核。接入方式和前面大模型API那篇同源这里只讲审核场景的关键点。用【HTTP 请求】指令方法选POSTURL填大模型服务商接口地址协议头按Authorization: Bearer 你的Key格式填鉴权协议体放待审文本提示词明确要求“你是内容合规审核员判断以下内容是否有违禁风险输出’通过’或’拦截’加一句话理由”。响应保存到变量后先判断status_code是否为2开头成功再用【转换成Json对象】解析content取出结论。连接超时秒数给到60以上大模型生成需要时间。词库判中风险、大模型也说有问题的最终拦截两者结论打架的标待人工推群讨论。API Key别写在流程明文里放环境变量或凭据管理泄露了别人拿你的Key烧钱。系统联动与工程化拦截了怎么通知高风险内容拦截后要立刻让人知道【飞书群通知】是最好接的机器人地址填群机器人的webhook消息格式选文本类型支持联系人机器人开了签名校验就把密钥填进签名校验参数。消息里带上命中词和内容摘要值班的人看到马上处理。再配上客户端计划任务定时跑每天九点、十五点各审一轮待发内容风险在发布前就被拦下。工程化三条检测、复核、通知拆成独立子流程流程参数传递结果字典词库更新不用碰流程命名用02_违禁词检测这类编号加动词调试时打断点单步执行配合变量面板看命中词列表的实际内容误判问题基本都出在词库和输入文本上断点一走就现形。易错速查表现象原因解决正常内容被误拦短词误伤正常表达词库加白名单命中先查白名单复核接口报401协议头鉴权格式错检查Bearer与Key确认Key有效取模型结论报错JSON没转换直接取值转换成Json对象后再取键审到一半流程停单条异常无兜底Try-Catch日志记录继续下一条英文违禁词漏检大小写不一致检测前统一转小写标红/写表格式乱单元格格式问题写入前把格式设为常规学习资源官方文档里【HTTP 请求】的参数说明和飞书群通知的消息格式说明建议先读再动手能省掉大半调试时间。完整流程源码我放在代码仓库 home.linyan.cloud违禁词检测、大模型复核、飞书拦截通知的子流程都在可以直接参考改造。#影刀RPA #RPA自动化 #违禁词检测 #内容审核 #电商作者林焱