Skip to main content
QUICK REVIEW

[論文レビュー] DroidBot-GPT: GPT-powered UI Automation for Android

Hao Wen, Hongming Wang|arXiv (Cornell University)|Apr 14, 2023
Advanced Malware Detection Techniques被引用数 7
ひとこと要約

DroidBot-GPT は、事前学習された大規模言語モデル(LLM)を用いて、アプリやモデルの変更なしに自然言語の指示に基づき Android アプリの操作を自動化する、新規の非教師ありフレームワークである。GUI の状態と操作を LLM が解釈できる自然言語のプロンプトに変換し、タスク固有の操作を生成・実行する。本手法は、17 つのアプリケーション、10 のカテゴリにまたがる 33 種類の実世界のタスクに対して、39.39% のタスク完了率と 66.76% の平均部分進捗率を達成した。

ABSTRACT

This paper introduces DroidBot-GPT, a tool that utilizes GPT-like large language models (LLMs) to automate the interactions with Android mobile applications. Given a natural language description of a desired task, DroidBot-GPT can automatically generate and execute actions that navigate the app to complete the task. It works by translating the app GUI state information and the available actions on the smartphone screen to natural language prompts and asking the LLM to make a choice of actions. Since the LLM is typically trained on a large amount of data including the how-to manuals of diverse software applications, it has the ability to make reasonable choices of actions based on the provided information. We evaluate DroidBot-GPT with a self-created dataset that contains 33 tasks collected from 17 Android applications spanning 10 categories. It can successfully complete 39.39% of the tasks, and the average partial completion progress is about 66.76%. Given the fact that our method is fully unsupervised (no modification required from both the app and the LLM), we believe there is great potential to enhance automation performance with better app development paradigms and/or custom model training.

研究の動機と目的

  • 事前学習済み LLM を用いて、アプリやモデルの変更なしにゼロショットで非教師ありで Android アプリのタスクを自動化すること。
  • 最小限の開発作業と自然言語入力で、多様なモバイルアプリケーションを自動化する課題に対処すること。
  • LLM が GUI 状態を解釈し、複雑で多段階のタスクに対して正確な操作シーケンスを生成できるかを検討すること。
  • LLM を用いた GUI 自動化の実用性とパフォーランスを、実世界の Android アプリにおいて評価すること。

提案手法

  • GUI 要素を、'編集可能'、'クリック済み'、'選択済み' などの構造化されたプロパティを用いて自然言語の記述に変換し、LLM の解釈性を向上させる。
  • 現在の GUI 状態、操作履歴、ユーザーのタスク記述を組み合わせたプロンプトを構築し、LLM が次の操作を選択する手がかりとする。
  • DroidBot を用いてデバイス上で GUI 状態を抽出し、操作を実行することで、アプリレベルの変更なしにエンドツーエンドの自動化を実現する。
  • GUI 操作(例:クリック、スクロール、編集)を LLM の推論と整合性を持つ自然言語の操作空間にマッピングする。
  • ファインチューニングを回避するため、ゼロショットプロンプティング戦略を採用し、LLM が事前学習済みのソフトウェア操作知識に依存する。
  • リアルタイムの GUI コンテキストに根ざした LLM 決定を強化するため、プロンプト工学のパイプラインを設計する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み LLM を、ファインチューニングやアプリの変更なしに、Android アプリの操作自動化に効果的に活用できるか。
  • RQ2GUI 状態の自然言語記述のみを用いて、LLM が多様な Android アプリや複雑で多段階のタスクに対してどれほど一般化できるか。
  • RQ3LLM による GUI 自動化の主な失敗モードは何か。また、GUI 要素の曖昧さや操作の不確実性とどのように関連しているか。
  • RQ4LLM が実世界のアプリインターフェースにおける非名前付き要素や暗黙の GUI 関係をどれほど処理できるか。
  • RQ5より良いプロンプト設計や将来的なモデルのファインチューニングによって、LLM による自動化のパフォーランスを向上させられるか。

主な発見

  • DroidBot-GPT は、10 のカテゴリにまたがる 17 つの Android アプリで実施された 33 種類の実世界タスクのデータセットにおいて、39.39% のタスク完了率を達成した。
  • 本システムは、複数の GUI 移行と事前知識を必要とするような複雑なタスク、例えばバイロイの休日を検索するタスクなどにおいても、良好な一般化性能を示した。
  • 平均部分進捗率は 66.76% に達し、完全なタスクが達成されない場合でも、LLM がしばしばほぼ正しい操作シーケンスを生成していることを示している。
  • 失敗事例の主な原因は、非名前付きの GUI 要素、曖昧な GUI 関係、および LLM 応答の確率的不安定性に起因していた。
  • 本手法は完全に非教師ありであり、ターゲットアプリや LLM にあらゆる変更を加える必要がないため、広範な適用可能性と低い導入障壁を示している。
  • 本研究では、非名前付き要素の認識や暗黙の GUI 関係の推論といった主な制限要因を特定し、将来的なファインチューニングや視覚的理解の向上による改善の可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。