ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

影刀RPA实操指南:中文与拼音处理——首字母、简繁与全半角

影刀RPA实操指南:中文与拼音处理——首字母、简繁与全半角 影刀RPA实操指南中文与拼音处理——首字母、简繁与全半角做跨境和内容运营的朋友对这类需求一定不陌生商品标题要生成拼音首字母做SKU编码、面向港澳台客户的页面要做简繁转换、从Excel里粘出来的数据全是全角逗号和全角空格导致匹配失败。这些中文特有的处理用影刀RPA都有现成指令根本不用装第三方库。我实操两年把文字转拼音、简繁转换、全角半角这三件事的做法和坑整理成这一篇照着拖指令就能落地。先说结论影刀RPA的文本处理指令集里有三条专门为中文设计的指令——文字转拼音、简体繁体转换、中文全角转半角加上输入法控制中文处理的完整拼图就凑齐了。下面逐条拆开讲。准备工作装好客户端和浏览器插件影刀RPA客户端从官网下载安装装完第一次打开会引导安装浏览器插件Chrome和Edge各装一次。编辑器界面左边是指令面板顶部搜索框最常用中间流程区本文的指令都在文本处理和系统操作分类下社区版全部可用。案例主线照旧用电商场景一份商品资料表包含中文标题、规格、备注我们要给每个商品生成拼音编码、输出繁体版本、清洗全角符号最后汇总成一份标准SKU表。文字转拼音全拼与首拼一条指令搞定指令面板搜文字转拼音两个输入项带转换文本填汉字内容或字符串变量转换方式下拉选首拼或全拼输出是转换结果变量。需求转换方式输入示例输出示例SKU编码首拼蓝牙耳机lyerj文件命名全拼蓝牙耳机lanyangerji拼音索引首拼保温杯bwb实操流程读Excel循环商品标题每条拖一个文字转拼音指令转换方式选首拼输出结果拼接上品类编号就是SKU码。多音字它处理得比我预想好重庆会正确给cq而不是zq但生僻字和人名偶尔会翻车批量跑之前拿样本表先试十条。简繁转换一条指令覆盖港澳台场景指令面板搜简体繁体转换参数同样简单带转换文本填内容转换方式下拉里有繁体、简体等多个选项输出转换结果。做TEMU、Shopee面向港台站点的Listing时我把这套流程固定成了子流程主流程采集简体标题进子流程转换成繁体再写入另一个工作表。两个实际经验一是转换是逐字映射鼠标转过去没问题但个别两岸用词差异软件/软体、视频/影片它不会做本地化改写正式发布前要人工过一遍二是转换结果直接喂给后续指令没问题但写入Excel时记得列宽调大一点繁体字形占位略宽。全角半角数据匹配失败的头号元凶这个坑我见每个新手都踩一次Excel里人工录入的全角数字、“”全角逗号、全角空格肉眼看和半角一模一样拿去做If条件判断永远是falsevlookup永远匹配不上。我当时排查了一下午最后是打开调试变量面板逐字符比对才发现输入框里躺着全角空格。解法就是中文全角转半角指令搜索框直接输入指令名文本参数填待处理内容或变量输出转换后的文本。文档里的示例就是把文本里的全角空格转成半角空格数字、字母、标点一并处理。清洗的标准动作清单建议存下来抓取或读取的文本先过一遍中文全角转半角再点亮Python图标加.strip()清首尾空白数字字段补一道float()转换确认类型全部做完才允许进入拼接、判断、写入环节顺序别乱先转全角再strip否则全角空格strip不掉等于白清。与键盘输入、输入法的配合中文输入的经典坑中文处理不止数据层面还有输入层面。做Windows桌面自动化时比如往老系统里录单键盘输入指令和输入法的配合是重灾区输入法开着你让它输英文它蹦汉字输数字出来全角字符。官方文档给出的方案分三层全部实测有效设置输入法指令先把当前激活窗口的输入法切到英文再执行键盘输入支持的输入法包括搜狗拼音、搜狗五笔、百度、QQ拼音、QQ五笔、Bing输入法强制加载美式键盘键盘输入指令的高级选项里勾选确保模拟输入不受中文输入法状态影响遇到冷门输入法切不动时用它驱动输入的边界驱动输入方式用于网银密码框这类特殊场景但它不支持输入中文和全角字符中文内容必须走普通方式反过来往网页搜索框输入中文关键词时优先用填写输入框指令直接写入它绕过输入法不存在中文变形问题只有目标软件不认直接写入时才退回键盘输入加输入法控制的组合。另外一个小细节需要在文本里写换行时点亮Python图标用\r\n表示引号必须用半角引号。XPath与正则中文文本定位的加分技巧中文场景的元素定位有些独特写法配合本文主题列几个实用的# 捕获元素页面中包含价格二字文本的元素 //*[contains(text(),价格)] # 捕获元素繁体页面上的按钮简繁混用站点 //button[contains(text(),搜尋) or contains(text(),搜索)] # 捕获元素参照物定位销量标签右边的兄弟元素 //*[contains(text(),销量)]/following-sibling::*[1]从中文文本里抠数据用从文本中提取内容指令提取方式选提取数字、提取手机号码或自定义正则只找第一个匹配项不勾选时返回所有结果的列表。¥59起提取数字得到59配合前面讲的全角清洗和类型转换中文页面的数据就完全可用。鼠标键盘与图像中文输入的图像兜底往不支持直接写入的桌面软件里录中文是中文处理的最后一个硬骨头。组合拳是点击元素聚焦输入框设置输入法切到中文再用键盘输入逐段发送录完获取元素文本回读比对。某些软件连文本回读都不支持就截图后走OCR识别识别结果和源字符串比对不一致重录。图像识别中文的准确率比数字低一档图片清晰度和分辨率影响很大截图区域尽量收紧到单行文本。OCR识别回的文本同样要先过全半角清洗再比对否则全角空格会让明明一样的两个字符串判成不同。进阶技能HTTP与Python补齐指令盲区三条中文指令覆盖不到的边角需求用Python补。点亮Python图标后几个常用片段# 判断字符串里有没有汉字过滤纯英文商品名跳过拼音转换has_cnany(\u4e00ch\u9fffforchintext)# 取每个字的Unicode码点做校验和简易防重编码checksum(ord(ch)forchintext)%100# 全半角转换的Python实现指令覆盖不到的混合场景halftext.translate(str.maketrans( 。, ,.))需要批量转换港台站数据时HTTP请求调翻译类接口也是个思路但要注意接口对汉字长度的限制超长文本先切片。接口返回的JSON里若带繁体字段直接取用可比本地转换更准代价是多一次请求耗时。平台实战各平台的中文数据形态不同平台抓回来的中文形态差别不小处理策略也要跟着换。淘宝商品标题里的规格信息常用方括号包着如【官方标配】正则【[^】]*】整段提取拼多多标题爱堆关键词拼音首拼做SKU时先去重TEMU面向海外标题本身是英文繁体列反而要反向补中文源数据。小红书笔记的中文处理重点在评论区表情符号混在文本里转拼音前先点亮Python图标用正则[^\u4e00-\u9fa5a-zA-Z0-9]清一遍否则拼音指令遇到emoji会输出奇怪的结果。这些清洗动作全部封装进10_中文标准化子流程各平台流程共用一套。完整案例流程与数据处理落地把三条中文指令装进SKU生成流程打开商品资料ExcelForEach列表循环逐行读取标题、规格标题先中文全角转半角清洗再文字转拼音首拼生成编码繁体列用简体繁体转换生成三列结果用点亮Python图标的format拼接成整行写入单元格落回Excel新表。数据量大的话清洗和转换这段封装成子流程10_中文标准化输入原始文本输出三个字段主流程只管循环和写入。调试时在转换指令上打断点变量面板里能看到全角空格的真实形态比肉眼盯Excel高效得多。系统联动与工程化建议生成的SKU表如果多个部门要用接飞书把汇总文本用发送飞书消息推送到群附件走邮件指令发给对应同事流程挂定时任务每天同步一次。版本选择上社区版跑这种轻量流程完全够只有挂机采集才需要考虑创业版的时长限制。工程化习惯提两条中文指令的输出变量命名带上含义如title_pinyin、title_tw别用result1、result2这种三个月后自己也看不懂的名字转换规则变化时比如要求SKU前加店铺码只改子流程主流程不动。易错速查If判断永远false数据里混着全角字符先过中文全角转半角再strip最后才比较vlookup匹配不上单元格藏着全角空格或首尾空格清洗后重新写入再匹配键盘输入中文变成乱串输入法状态干扰先设置输入法切英文或勾选强制加载美式键盘中文内容优先用填写输入框直接写入驱动输入输不了中文驱动方式不支持中文及全角字符中文必须用普通方式拼音首拼个别字不对多音字生僻字偶有翻车批量前拿样本先验证关键场景人工抽检繁体版本用词不地道逐字转换不做两岸用词本地化发布前人工过一遍学习资源与延伸阅读本文三条中文指令在官方文档里都有独立页面参数和示例截图配得比较全搜指令名就能找到。完整的中文标准化加SKU生成流程源码我放在代码仓库 home.linyan.cloud可以直接参考改造三条中文指令的位置我都在注释里标好了换成你的表格路径就能跑。#影刀RPA #RPA自动化 #文本处理 #跨境电商 #Excel作者林焱
返回列表