Skip to main content
QUICK REVIEW

[论文解读] Automated Discovery of Data Transformations for Robotic Process Automation

Volodymyr Leno, Marlon Dumas|arXiv (Cornell University)|Jan 3, 2020
Robotic Process Automation Applications参考文献 14被引用 13
一句话总结

本文提出了一种优化方法,通过分析机器人流程自动化(RPA)中的用户交互日志(UI logs),自动发现数据转换规则,利用字段内容模式(字母/数字标记)和基于目标的分组,显著提升效率。该方法将转换发现时间从数小时缩短至两分钟以内,且在真实世界的数据传输场景中实现100%准确率,相比直接应用Foofah的方法提速超过100倍。

ABSTRACT

Robotic Process Automation (RPA) is a technology for automating repetitive routines consisting of sequences of user interactions with one or more applications. In order to fully exploit the opportunities opened by RPA, companies need to discover which specific routines may be automated, and how. In this setting, this paper addresses the problem of analyzing User Interaction (UI) logs in order to discover routines where a user transfers data from one spreadsheet or (Web) form to another. The paper maps this problem to that of discovering data transformations by example - a problem for which several techniques are available. The paper shows that a naive application of a state-of-the-art technique for data transformation discovery is computationally inefficient. Accordingly, the paper proposes two optimizations that take advantage of the information in the UI log and the fact that data transfers across applications typically involve copying alphabetic and numeric tokens separately. The proposed approach and its optimizations are evaluated using UI logs that replicate a real-life repetitive data transfer routine.

研究动机与目标

  • 通过分析用户交互日志,解决在RPA中发现可自动化的数据传输流程的挑战。
  • 克服将最先进数据转换发现技术(如Foofah)直接应用于真实世界UI日志时的计算低效问题。
  • 通过利用源字段和目标字段中的结构与词汇模式,提升可扩展性和性能。
  • 从基于UI日志提取的输入-输出示例中,实现RPA机器人转换程序的自动生成。

提出的方法

  • 该方法将数据传输流程映射为基于示例的数据转换发现,将每个流程建模为从输入字段(源)到输出字段(目标)的映射。
  • 提出两项关键优化:按目标字段对转换示例进行分组,以隔离更小、可解的问题;分析字段中字母和数字标记的序列,以缩小搜索空间。
  • 利用UI日志结构识别字段级映射,并提取用于转换挖掘的输入-输出示例。
  • 在数据转换发现中应用Foofah算法,但通过字段内容模式和基于目标的分解来剪枝搜索空间。
  • 这些优化旨在处理常见的数据传输模式,如拆分(1对多)、合并(多对1)以及复杂重格式化(多对多)。
  • 该方法假设所有输出字段均源自显式复制的输入字段,并要求UI日志已分段,其中每个追踪记录对应一次单一任务执行。

实验结果

研究问题

  • RQ1数据转换发现技术能否有效应用于UI日志,以实现RPA流程提取的自动化?
  • RQ2为何Foofah的直接应用在真实世界RPA数据传输日志中实际失效?
  • RQ3如何在不损失准确率的前提下缩小转换发现的搜索空间?
  • RQ4字段级内容模式(字母/数字标记)和基于目标的分组在多大程度上提升了性能与可扩展性?
  • RQ5该方法在处理条件逻辑、循环或非复制式数据输入方面存在哪些局限性?

主要发现

  • 对完整UI日志直接应用Foofah的朴素方法因计算时间过长而未能发现任何转换,耗时3742.669秒后超时。
  • 优化1(按目标分组)将执行时间缩短至10,551.536秒,但仅发现9个转换中的5个,表明在复杂子问题上存在可扩展性问题。
  • 组合方法(优化1 + 优化2)在仅130.854秒内发现全部9个转换,相比基线提速100倍,且相比仅使用优化1的方案提升70%。
  • 优化方法成功识别出所有类型的转换——1对1、1对多、多对1及多对多,证明其在多种数据格式下的鲁棒性。
  • 该方法在处理电子表格与Web表单之间的结构化数据传输任务中表现有效,尤其适用于手动复制并重新格式化的数据。
  • 局限性包括无法检测基于视觉阅读(无复制操作)的转换、条件逻辑(如根据国家选择不同日期格式)或嵌套循环(如多行项目条目)的转换。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。