[论文解读] Mapping Natural Language Instructions to Mobile UI Action Sequences
本文提出了一项新颖的任务,即将自然语言指令转化为移动UI上的可执行动作序列,提出一种两阶段模型:首先使用Transformer从指令中提取动作短语元组(操作,对象,参数),然后通过上下文感知的屏幕表征将这些元组定位到UI对象。该方法在新数据集PixelHelp上实现了70.59%的完整动作序列预测准确率。
We present a new problem: grounding natural language instructions to mobile user interface actions, and create three new datasets for it. For full task evaluation, we create PIXELHELP, a corpus that pairs English instructions with actions performed by people on a mobile UI emulator. To scale training, we decouple the language and action data by (a) annotating action phrase spans in HowTo instructions and (b) synthesizing grounded descriptions of actions for mobile user interfaces. We use a Transformer to extract action phrase tuples from long-range natural language instructions. A grounding Transformer then contextually represents UI objects using both their content and screen position and connects them to object descriptions. Given a starting screen and instruction, our model achieves 70.59% accuracy on predicting complete ground-truth action sequences in PIXELHELP.
研究动机与目标
- 解决在无需用户干预的情况下自动执行多步自然语言指令于移动触摸UI的挑战。
- 创建一个新的基准数据集PixelHelp,将真实世界英文指令与移动UI模拟器上的对应动作序列配对。
- 通过使用网络获取的HowTo指令进行短语提取,以及使用合成命令生成进行定位,实现训练的解耦与扩展。
- 开发一种模型,能够准确地从移动UI上下文中的长程指令中提取并定位动作短语元组。
- 通过基于语言的UI控制,实现对视觉或情境障碍用户更易访问和自动化的任务执行。
提出的方法
- 基于Transformer的短语提取器使用三种跨度表征策略(包括求和池化)从长篇自然语言指令中识别操作、对象和参数的跨度。
- 定位模型使用上下文感知的Transformer,通过内容和屏幕位置表征UI对象,实现与自然语言描述的对齐。
- 该系统将任务分解为两个阶段:(1) 短语提取以生成元组序列,(2) 定位以将这些元组映射为一系列UI屏幕上的可执行动作。
- 一个合成数据生成管道在25,000个移动UI屏幕中生成了295,000条单步命令,覆盖178,000个唯一UI对象,用于预训练定位模型。
- 定位模型利用屏幕状态转移函数和结构关系(如View层级)来建模动作执行过程中屏幕状态的演变。
- 整个流水线端到端进行训练与评估,性能在部分和完整动作序列准确率两个维度上进行衡量。
实验结果
研究问题
- RQ1两阶段模型能否有效从长篇多步自然语言指令中提取动作短语元组(操作,对象,参数)?
- RQ2上下文感知的Transformer模型在移动触摸屏环境中,对提取的短语元组定位到特定UI对象的性能如何?
- RQ3该完整流水线在真实世界移动UI指令上预测完整真实动作序列的性能如何?
- RQ4不同的跨度表征方式和对象编码策略对短语提取与定位准确率有何影响?
- RQ5短语提取中的级联错误在多大程度上影响定位性能?以及短语模型的隐藏状态是否能提升定位的鲁棒性?
主要发现
- 在HowTo指令数据集上,使用跨度表征的求和池化策略,短语提取器在预测完整真实跨度序列方面达到了85.56%的准确率。
- 在PixelHelp数据集上,完整系统在从自然语言指令预测完整动作序列方面实现了70.59%的完整准确率和89.21%的部分准确率。
- 当使用短语解码器的隐藏状态时,定位模型表现不佳,表明合成数据与真实世界指令数据之间存在领域差异。
- 在PixelHelp中,短语提取器在14个任务中未能正确提取步骤,主要表现为多生成步骤(11个任务)或错误步骤(3个任务),但从未跳过步骤。
- 定性分析显示,指令中与位置相关的词汇与对应UI对象的屏幕位置嵌入之间存在强相关性。
- 模型性能对不同数据集中语言风格的差异较为敏感,其中合成命令倾向于简洁,而真实世界指令表现出更高的词汇多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。