Skip to main content
QUICK REVIEW

[論文レビュー] Enabling Conversational Interaction with Mobile UI using Large Language Models

Bryan Wang, Gang Li|arXiv (Cornell University)|Sep 18, 2022
AI in Service Interactions被引用数 4
ひとこと要約

本稿では、タスク固有のデータセットやトレーニングを必要とせず、1つの大規模言語モデル(LLM)を用いて多様な会話型モバイルUIインタラクションを可能にするプロンプトベースのアプローチを提案する。Android UIのビュー階層を構造的なHTMLテキスト表現に変換することで、4つの主要タスク—スクリーン質問生成、要約、質問応答、指示からアクションへのマッピング—において、タスクごとに2例のフェイシング例のみを用いて競争力のあるパフォーマンスを達成した。

ABSTRACT

Conversational agents show the promise to allow users to interact with mobile devices using language. However, to perform diverse UI tasks with natural language, developers typically need to create separate datasets and models for each specific task, which is expensive and effort-consuming. Recently, pre-trained large language models (LLMs) have been shown capable of generalizing to various downstream tasks when prompted with a handful of examples from the target task. This paper investigates the feasibility of enabling versatile conversational interactions with mobile UIs using a single LLM. We designed prompting techniques to adapt an LLM to mobile UIs. We experimented with four important modeling tasks that address various scenarios in conversational interaction. Our method achieved competitive performance on these challenging tasks without requiring dedicated datasets and training, offering a lightweight and generalizable approach to enable language-based mobile interaction.

研究の動機と目的

  • 1つの汎用モデルを用いて、多様な会話型モバイルUIインタラクションを可能にする課題に対処すること。
  • GUI理解が不十分で、UI固有の質問に答えられない既存のアシスタントの限界を克服すること。
  • 言語ベースのモバイルインタラクションに必要な高価なタスク固有のデータセットやトレーニングパイプラインへの依存を低減すること。
  • フェイシングプロンプトを用いて事前学習済みLLMをモバイルUIタスクに適応させる可能性を検討すること。
  • 迅速なプロトタイピングを可能にする軽量で汎用性の高いフレームワークを確立すること。

提案手法

  • 深さ優先探索走査を用いて、Android UIのビュー階層を構造的およびプロパティ情報を保持したテキストベースのHTML表現に変換する。
  • スクリーン質問生成、要約、質問応答、指示からアクションへのマッピングの4つの主要なモバイルUIインタラクションタスクを遂行するためのタスク固有のプロンプトテンプレートを設計する。
  • 微調整なしでLLMを適応させるために、タスクごとに2例のインラインフェイシング学習を活用する。
  • LLMの事前学習済み知識と一般化能力を活用し、UIの意味を推論し、文脈的に適切な応答を生成する。
  • 再現可能性と今後の拡張を可能にするために、HTML変換アルゴリズムと例示プロンプトをオープンソース化する。
  • 標準的な指標と人間評価を用いて性能を評価し、Screen2Wordsなどの既存モデルと比較する。

実験結果

リサーチクエスチョン

  • RQ11つの事前学習済みLLMをフェイシングプロンプトを用いて、複数のモバイルUI会話型インタラクションタスクに効果的に適応できるか?
  • RQ2専用のトレーニングデータがなくとも、スクリーン質問生成や質問応答のような新規タスクでLLMがどの程度のパフォーマンスを発揮できるか?
  • RQ3UI階層のHTML表現が、LLMがモバイルインターフェースについて推論するのに必要な構造的および意味的情報をどれほど保持しているか?
  • RQ4フェイシングLLMアプローチのパフォーマンスは、大規模データセットでトレーニングされた専用モデルと比べてどの程度か?
  • RQ5ビュー階層データにのみ依存する場合の限界は何か?また、視覚的またはマルチモーダルな手がかりが、LLMの信頼性にどのように影響するか?

主な発見

  • 提案されたプロンプト手法は、スクリーン質問生成、要約、質問応答、指示からアクションへのマッピングという4つの挑戦的なモバイルUIタスクにおいて、タスクごとに2例のフェイシング例のみを用いて競争力のあるパフォーマンスを達成した。
  • スクリーン質問生成という新規タスクに対して、先行研究で未だ検討がなかったタスクでベンチマークパフォーマンスを確立した。
  • 人間評価の結果、Screen2Words(数万例のトレーニング例で学習されたモデル)よりもLLMが生成したスクリーン要約の正確性が優れていた。
  • LLMは質問の組み合わせや知識の統合といったエメrgentな行動を示し、強力な推論力と一般化能力を示した。
  • 視覚的入力が欠如しているにもかかわらず、テキストベースのUIタスクで良好なパフォーマンスを発揮したため、ビュー階層に基づくHTML表現が多くのインタラクションシナリオにおいて有効であると示唆された。
  • 本アプローチにより、従来のパイプラインと比較して、データセット収集やモデルトレーニングの時間とコストを大幅に削減できる、言語ベースのモバイルインタラクションの迅速なプロトタイピングが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。