Skip to main content
QUICK REVIEW

[論文レビュー] Identifying candidate routines for Robotic Process Automation from unsegmented UI logs

Volodymyr Leno, Adriano Augusto|arXiv (Cornell University)|Aug 13, 2020
Robotic Process Automation Applications参考文献 20被引用数 7
ひとこと要約

本論文では、実世界の状況で一般的な非分割UIログから、自動的にロボティックプロセスオートメーション(RPA)ルーチンの候補を発見する手法を提案する。まず、制御フローグラフ(CFG)と支配木を用いてログをタスクに類似したシーケンスに分割し、その後、ノイズに強い逐次パターンマイニングを適用して頻度の高い一貫性のあるルーチンを抽出する。本手法は合成ログにおける埋め込みルーチンを正確に再発見でき、実生活のログにおいても関連性があり正しいルーチンを同定した。大規模なログ処理においても実行時間は1分未満であった。

ABSTRACT

Robotic Process Automation (RPA) is a technology to develop software bots that automate repetitive sequences of interactions between users and software applications (a.k.a. routines). To take full advantage of this technology, organizations need to identify and to scope their routines. This is a challenging endeavor in large organizations, as routines are usually not concentrated in a handful of processes, but rather scattered across the process landscape. Accordingly, the identification of routines from User Interaction (UI) logs has received significant attention. Existing approaches to this problem assume that the UI log is segmented, meaning that it consists of traces of a task that is presupposed to contain one or more routines. However, a UI log usually takes the form of a single unsegmented sequence of events. This paper presents an approach to discover candidate routines from unsegmented UI logs in the presence of noise, i.e. events within or between routine instances that do not belong to any routine. The approach is implemented as an open-source tool and evaluated using synthetic and real-life UI logs.

研究の動機と目的

  • ルーチンが複数のプロセスに散在し、事前にセグメンテーションされていない大規模組織における自動化可能なルーチンの特定という課題に対処すること。
  • 事前にセグメンテーションされたログや手動による区切り文字を必要とする従来のRPAマイニング手法の制限を克服すること。
  • ノイズや重複するタスクインスタンスを含む、非分割の生ログから、自動的に候補ルーチンを発見できるようにすること。
  • 制御フローグラフ解析とノイズに強いパターンマイニングを活用することで、RPAルーチン同一定位のスケーラビリティと正確性を向上させること。
  • 実世界での展開を想定した実用的でオープンソースのソリューションを提供すること。

提案手法

  • ノードをUI操作、エッジを実行順序として表す制御フローグラフ(CFG)を、非分割UIログから構築する。
  • CFGから支配木を構築し、制御フローフラット構造を分析することで、自然なルーチンインスタンスの境界を特定する。
  • 支配木に基づいて元のログを候補タスクシーケンスにセグメントし、繰り返し実行されるパスを分離する。
  • セグメント済みログに対して、ノイズに強い逐次パターンマイニングアルゴリズムを適用し、頻度の高い繰り返し発生する操作シーケンスを発見する。
  • 頻度、長さ、カバレッジ(ログのうちカバーされる割合)、結束度(内部の一貫性)の4つの品質基準を用いて、候補ルーチンをランク付けする。
  • 再現可能性および実世界での評価を目的に、パイプライン全体をオープンソースツールとして実装する。

実験結果

リサーチクエスチョン

  • RQ1本手法は、合成非分割UIログに事前に埋め込まれたルーチンを正確に再発見できるか?
  • RQ2事前にセグメンテーションされていない実生活の非分割UIログから、意味的かつ正確な候補ルーチンを同定できるか?
  • RQ3数十万件のUI操作を含む大規模ログを処理する際、本手法のスケーラビリティはどの程度か?
  • RQ4実世界のログにおけるノイズ、重複するルーチン、非一貫したルーチンの開始位置に対して、本手法の耐性はどの程度か?
  • RQ5アクションの順序が異なる場合でも、同じルーチンの異なるバージョンをどの程度正確に区別できるか?

主な発見

  • 合成ログS1において、本手法は埋め込みられたすべてのルーチンを高い正確性で再発見し、非分割データから既知のパターンを回復できる能力を確認した。
  • 実生活ログS1では、正しいルーチンバージョンと3つの代替実行バージョンが同定され、元のユーザーによる確認で正確な作業の表現であると確認された。
  • S1ログ(約2万件の操作)の処理時間は41.7秒であり、中程度の規模のログに対しても良好なスケーラビリティを示した。
  • S2ログでは、複数のシート間の頻繁な切り替えが原因でCFGの構築が乱れ、正しくセグメンテーションされず、正しいルーチンの発見に失敗した。
  • S2ログの処理時間は426.3秒にのぼり、ログ品質や行動の複雑さ、特に複数のワークブックを同時に使用する状況において、処理に敏感であることが示された。
  • 本手法は複数の開始点や重複するルーチンに対して感受性が高く、ルーチンが連続的に実行され、一貫した開始点を持つ場合に最も良好に動作する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。