Skip to main content
QUICK REVIEW

[論文レビュー] Automated Discovery of Data Transformations for Robotic Process Automation

Volodymyr Leno, Marlon Dumas|arXiv (Cornell University)|Jan 3, 2020
Robotic Process Automation Applications参考文献 14被引用数 13
ひとこと要約

本稿では、ロボティック・プロセス・オートメーション(RPA)におけるユーザー操作ログ(UIログ)から、分野の内容パターン(アルファベット/数字トークン)とターゲットベースのグループ化を活用して、データ変換ルールを自動で発見する最適化手法を提案する。この手法により、実世界のデータ転送シナリオで100%の正確性を達成しながら、変換ルール発見時間を数時間から2分未塔に短縮した。Foofahの単純な適用より100倍以上の性能向上を達成した。

ABSTRACT

Robotic Process Automation (RPA) is a technology for automating repetitive routines consisting of sequences of user interactions with one or more applications. In order to fully exploit the opportunities opened by RPA, companies need to discover which specific routines may be automated, and how. In this setting, this paper addresses the problem of analyzing User Interaction (UI) logs in order to discover routines where a user transfers data from one spreadsheet or (Web) form to another. The paper maps this problem to that of discovering data transformations by example - a problem for which several techniques are available. The paper shows that a naive application of a state-of-the-art technique for data transformation discovery is computationally inefficient. Accordingly, the paper proposes two optimizations that take advantage of the information in the UI log and the fact that data transfers across applications typically involve copying alphabetic and numeric tokens separately. The proposed approach and its optimizations are evaluated using UI logs that replicate a real-life repetitive data transfer routine.

研究の動機と目的

  • ユーザー操作ログの分析により、RPAにおける自動化可能なデータ転送ルーチンを発見する課題に対処すること。
  • 実世界のUIログに最新のデータ変換ルール発見技術(例:Foofah)を直接適用した場合の計算上の非効率性を克服すること。
  • データ転送中のソースおよびターゲットフィールドにおける構造的・語彙的パターンを活用することで、スケーラビリティとパフォーマンスを向上させること。
  • UIログから得られる入出力例に基づき、RPAボット用の変換プログラムを自動生成すること。

提案手法

  • 本手法は、データ転送ルーチンを、入力フィールド(ソース)から出力フィールド(ターゲット)へのマッピングとしてモデル化し、例によるデータ変換ルール発見に結びつける。
  • 2つの主要な最適化を導入する:ターゲットフィールドごとに変換例をグループ化して、より小さな解決可能な問題に分離すること、およびフィールド内のアルファベットおよび数字トークンのシーケンスを分析して探索空間を削減すること。
  • UIログの構造を活用して、フィールドレベルのマッピングを特定し、変換マイニング用の入出力例を抽出する。
  • Foofahアルゴリズムをデータ変換ルール発見に適用するが、フィールドの内容パターンとターゲットベースの分解を用いて探索空間を制限する。
  • これらの最適化は、分割(1対多)、統合(多対1)、および複雑な書式変更(多対多)といった一般的なデータ転送パターンに対応するように設計されている。
  • 本手法は、すべての出力フィールドが明示的にコピーされた入力フィールドから派生すると仮定しており、各トレースが1回のタスク実行に対応するように分割されたUIログを必要とする。

実験結果

リサーチクエスチョン

  • RQ1データ変換ルール発見技術は、UIログに効果的に適用可能であり、RPAルーチン抽出を自動化できるか?
  • RQ2実世界のRPAデータ転送ログでは、Foofahの直接適用がなぜ実際には失敗するのか?
  • RQ3正確性を損なわずに、変換ルール発見の探索空間をどのように縮小できるか?
  • RQ4分野レベルのコンテンツパターン(アルファベット/数字トークン)とターゲットベースのグループ化は、パフォーマンスとスケーラビリティをどの程度向上させるか?
  • RQ5条件分岐、ループ、またはコピーに基づかないデータ入力処理を扱う際の本手法の限界は何か?

主な発見

  • Foofahを全UIログに単純に適用した場合、計算時間が膨大なため、3742.669秒でタイムアウトし、変換ルールが一切発見されなかった。
  • 最適化1(ターゲットごとのグループ化)を適用した場合、実行時間は10,551.536秒に短縮されたが、9つの変換のうち5つしか発見できず、複雑な部分問題に対するスケーラビリティの問題が明らかになった。
  • 両最適化を組み合わせた手法(最適化1+最適化2)では、わずか130.854秒で全9つの変換を発見した。これはベースライン比で100倍の高速化であり、最適化1単体よりも70%の性能向上を達成した。
  • 最適化された手法は、1対1、1対多、多対1、多対多のすべての変換タイプを正常に発見でき、多様なデータフォーマットに対しても堅牢であることが確認された。
  • 本手法は、スプレッドシートとWebフォーム間の構造化されたデータ転送ルーチンに有効であり、特に手動でコピーと書式変更が行われるケースに特に適している。
  • 限界として、視覚的読み取り(コピー操作なし)に基づく変換、条件分岐(例:国別に異なる日付フォーマット)、ネストされたループ(例:複数行の項目入力)の処理は検出できない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。