[論文レビュー] Mapping Natural Language Instructions to Mobile UI Action Sequences
本稿では、モバイルUI上の実行可能な行動シーケンスに自然言語の指示を対応付ける、新しいタスクを提案する。変換器を用いてまず指示から行動フレーズのタプル(操作、対象、引数)を抽出する二段階モデルを提案し、その後、文脈的なスクリーン表現を介してこれらのタプルをUIオブジェクトにマッピングする。このアプローチは、新しいデータセットPixelHelpにおいて、全行動シーケンス予測で70.59%の正確性を達成した。
We present a new problem: grounding natural language instructions to mobile user interface actions, and create three new datasets for it. For full task evaluation, we create PIXELHELP, a corpus that pairs English instructions with actions performed by people on a mobile UI emulator. To scale training, we decouple the language and action data by (a) annotating action phrase spans in HowTo instructions and (b) synthesizing grounded descriptions of actions for mobile user interfaces. We use a Transformer to extract action phrase tuples from long-range natural language instructions. A grounding Transformer then contextually represents UI objects using both their content and screen position and connects them to object descriptions. Given a starting screen and instruction, our model achieves 70.59% accuracy on predicting complete ground-truth action sequences in PIXELHELP.
研究の動機と目的
- ユーザーの干渉なしに、マルチステップの自然言語の指示をモバイルタッチUIで自動実行する課題に対処すること。
- 実際の英語の指示とモバイルUIエミュレータ上での対応する行動シーケンスをペアにした、新しいベンチマークデータセットPixelHelpを構築すること。
- Webから取得したHowToの指示を用いてフレーズ抽出用に、合成されたコマンド生成を用いて接地用に、トレーニングを分離・拡張可能にする。
- 長距離の指示において、モバイルUIの文脈の中で正確に行動フレーズのタプルを抽出・接地できるモデルを開発すること。
- 言語ベースのUI制御を通じて、視覚的または状況的障害を持つユーザーのためのアクセシブルで自動化されたタスク実行を可能にすること。
提案手法
- 変換器ベースのフレーズ抽出器は、和集合プーリングを含む3つのスパン表現戦略を用いて、長文の自然言語の指示から操作、対象、引数のスパンを特定する。
- 接地モデルは、コンテンツとスクリーン上の位置を介してUIオブジェクトを表現する文脈に配慮した変換器を用い、自然言語の記述と一致させる。
- システムは、2段階のタスクに分解される:(1) タプルのシーケンスを生成するフレーズ抽出、(2) これらのタプルを一連のUIスクリーン上の実行可能な行動にマッピングする接地。
- 合成データ生成パイプラインにより、25,000のモバイルUIスクリーンにまたがり、178,000の固有のUIオブジェクトをカバーする295,000の単一ステップコマンドが生成され、接地モデルの事前学習に用いられた。
- 接地モデルは、スクリーン遷移関数と構造的関係(例:View階層)を活用して、行動実行中のスクリーン状態の変化をモデル化する。
- 完全なパイプラインはエンドツーエンドでトレーニングおよび評価され、部分的および完全な行動シーケンスの正確性の両方で性能が測定された。
実験結果
リサーチクエスチョン
- RQ1二段階モデルは、長文でマルチステップの自然言語の指示から、行動フレーズのタプル(操作、対象、引数)を効果的に抽出できるか?
- RQ2文脈に配慮した変換器モデルは、モバイルタッチスクリーン環境において、抽出されたフレーズタプルを特定のUIオブジェクトに適切にマッピングできるか?
- RQ3本システムは、実世界のモバイルUIの指示に対して、完全な真値の行動シーケンスを予測する性能はいかほどか?
- RQ4スパン表現やオブジェクト符号化戦略の違いが、フレーズ抽出および接地の正確性に与える影響は?
- RQ5フレーズ抽出からの誤差が累積的に伝播することで、接地の性能に与える影響は?また、フレーズモデルの隠れ状態は、接地の頑健性を向上させられるか?
主な発見
- フレーズ抽出器は、スパン表現に和集合プーリングを用いた場合、HowToの指示データセットで完全な真値スパンシーケンスを85.56%の正確性で予測した。
- 本システムは、PixelHelpデータセットにおいて、自然言語の指示から全行動シーケンスを予測する際、完全正確性70.59%、部分正確性89.21%を達成した。
- 接地モデルは、フレーズデコーダーの隠れ状態を使用した場合、性能が著しく低下しており、合成データと実世界の指示データの間でドメインシフトが生じていることが示唆された。
- フレーズ抽出器は、PixelHelpの14のタスクで正しいステップを抽出できず、主に余分なステップ(11件)を生成したか、誤ったステップ(3件)を生成したが、一度もステップを飛ばすことはなかった。
- 定性的な分析から、指示内の場所関連語と対応するUIオブジェクトのスクリーン位置埋め込みとの間に強い相関関係が確認された。
- モデルの性能は、データセット間での言語スタイルの違いに対して感受性が高く、合成コマンドは簡潔を好み、実世界の指示はより多様な語彙を示していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。