影刀RPA文本数据提取方法三:指令提取

📅 2026/8/1 12:17:01 👁️ 阅读次数 📝 编程学习
影刀RPA文本数据提取方法三:指令提取

影刀RPA文本数据提取方法三:指令提取

作者:林焱 | 适合人群:不会正则也不会JSON,但需要用影刀内置指令处理文本的新手

什么情况用什么

你从网页上抓了一段文本,要从中提取特定内容,但不会写正则,数据也不是JSON格式。

影刀RPA提供了一组文本处理指令,可以不用写代码就完成大部分文本提取任务。

什么情况用指令提取:

  • 要提取的内容有固定前缀或后缀(比如"价格:99元"里的"99")
  • 要做字符串替换、拼接、截取
  • 要判断文本是否包含某个关键词
  • 你不会正则,也不想学

怎么做

核心指令一览

指令功能例子
查找文本返回关键词在字符串里的位置找"价格:"的位置
截取文本按位置截取一段字符串从第5个字符开始取10个
替换文本把A替换成B把"¥"替换成""
分割文本按分隔符切成列表按",“分割"a,b,c”
去除空白字符去掉首尾空格清洗用户输入

案例1:提取"价格:99元"里的数字

步骤:

  1. 「查找文本」→ 在"价格:99元"里找":"的位置 → 返回2
  2. 「查找文本」→ 找"元"的位置 → 返回5
  3. 「截取文本」→ 从第3个字符开始,取2个字符 → “99”

拼多多店群自动化报活动上架!

更简单的做法:
5. 「替换文本」→ 把"价格:“替换成”" → “99元”
6. 「替换文本」→ 把"元"替换成"" → “99”

案例2:从URL里提取参数值

URL:"https://www.taobao.com/item.htm?id=123456&type=normal"

目标:提取id参数的值123456

步骤:

  1. 「分割文本」→ 按"?"分割 → 取后面一段:"id=123456&type=normal"
  2. 「分割文本」→ 按"&"分割 → 取第一段:"id=123456"
  3. 「分割文本」→ 按"="分割 → 取第二段:"123456"

案例3:批量清洗手机号(去掉空格和横线)

文本列表:["138 0013 8000", "139-0013-9000", "13800138000"]

用「ForEach」循环,每次处理一个:

  1. 「替换文本」→ 替换空格成""
  2. 「替换文本」→ 替换横线成""
  3. 保存到清洗后的列表

有什么坑

坑1:查找文本返回的位置是从0开始还是从1开始

影刀的「查找文本」指令,返回的位置是从1开始的(不是从0)。

比如"价格:99元","价"的位置是1,“格"是2,”:"是3。

如果你用其他语言(比如Python)处理文本,位置是从0开始的。两边混用时要注意。

坑2:截取文本的位置和长度要算清楚

「截取文本」指令有两个参数:

  • 起始位置(从1开始)
  • 截取长度

如果你想取"价格:99元"里的"99":

  • 起始位置:4(“价”=1,“格”=2,“:”=3,所以数字从4开始)
  • 截取长度:2

如果截取到末尾,长度参数可以填一个很大的数(比如9999),影刀会自动截取到末尾。

坑3:分割文本后,取某一段要注意索引

「分割文本」返回的是一个列表

比如"a,b,c"按","分割成["a","b","c"]

取第一段:分割结果[0](影刀里列表索引从0开始)
取最后一段:分割结果[分割结果.size-1]

TEMU店群矩阵自动化运营核价报活动

坑4:替换文本是区分大小写的

「替换文本」指令默认区分大小写

比如把"apple"替换成"banana",不会匹配"Apple"或"APPLE"。

如果不想区分大小写,需要先「转小写」或「转大写」,再做替换。

坑5:去除空白字符只去掉首尾,中间的去不掉

「去除空白字符」指令只去掉字符串开头和结尾的空格、换行、Tab。

中间的空格去不掉。如果想去掉所有空格,用「替换文本」把空格替换成空字符串。

总结

指令提取适合简单的、格式固定的文本处理任务。如果格式不固定(比如价格有时是"99元",有时是"¥99.00"),还是要用正则或Python。

三种文本提取方法怎么选:

  1. 格式固定 → 用指令提取(最简单)
  2. 有固定模式但不固定格式 → 用正则提取(最灵活)
  3. 数据在JSON里 → 用JSON解析(最快)

下一篇讲文本数据提取方法四:Python字符串处理,应对那些指令和正则都搞不定的复杂场景。


作者:林焱