[论文解读] VASTA: A Vision and Language-assisted Smartphone Task Automation System
VASTA 是一种用于智能手机任务自动化的视觉与语言辅助编程演示(PBD)系统,利用计算机视觉(目标检测、OCR)和自然语言理解来创建鲁棒且可泛化的自动化脚本,而无需依赖用户界面结构。该系统使非技术用户能够通过演示操作和使用语音命令,在第三方应用之间实现任务自动化,在用户研究中实现了高精度的用户界面元素检测和语句理解。
We present VASTA, a novel vision and language-assisted Programming By Demonstration (PBD) system for smartphone task automation. Development of a robust PBD automation system requires overcoming three key challenges: first, how to make a particular demonstration robust to positional and visual changes in the user interface (UI) elements; secondly, how to recognize changes in the automation parameters to make the demonstration as generalizable as possible; and thirdly, how to recognize from the user utterance what automation the user wishes to carry out. To address the first challenge, VASTA leverages state-of-the-art computer vision techniques, including object detection and optical character recognition, to accurately label interactions demonstrated by a user, without relying on the underlying UI structures. To address the second and third challenges, VASTA takes advantage of advanced natural language understanding algorithms for analyzing the user utterance to trigger the VASTA automation scripts, and to determine the automation parameters for generalization. We run an initial user study that demonstrates the effectiveness of VASTA at clustering user utterances, understanding changes in the automation parameters, detecting desired UI elements, and, most importantly, automating various tasks. A demo video of the system is available here: http://y2u.be/kr2xE-FixjI
研究动机与目标
- 使非程序员能够通过自然手势和语音命令自动化重复性智能手机任务。
- 克服现有 PBD 系统依赖用户界面层次结构或标记信息的局限性,这些系统在视觉或结构变化下会失效。
- 利用视觉和自然语言理解(NLU)泛化自动化脚本,以适应不同应用版本和用户语句的变化。
- 支持在任意第三方应用(包括网页视图和渲染复杂的原生应用)中实现任务自动化。
- 通过计算机视觉实现对用户界面元素的鲁棒检测,即使在位置和视觉变化下也能保持稳定。
提出的方法
- 利用最先进的目标检测和 OCR 技术识别并标记用户界面元素,而无需依赖可访问性 API 或 XML 结构。
- 采用基于视觉的方法,通过视觉特征和文本内容跟踪用户界面元素,从而增强对用户界面布局和外观变化的鲁棒性。
- 采用先进的自然语言理解(NLU)模型,将相似的用户语句聚类并提取任务参数,以实现泛化。
- 将用户演示(点击/滑动的坐标和屏幕状态)与 NLU 输入相结合,生成可执行的自动化脚本。
- 在大规模智能手机用户界面元素数据集上训练专用目标检测器,以提高检测精度。
- 结合视觉跟踪与 NLU 技术,检测用户命令与实际操作之间的不一致,未来可集成 XML 数据以进一步提升可靠性。
实验结果
研究问题
- RQ1基于视觉的系统是否能够在不依赖用户界面层次结构的前提下,检测并跟踪不同应用版本和视觉变化下的用户界面元素?
- RQ2NLU 模型在多大程度上能够将多样的用户语句聚类到同一自动化任务中,并准确提取动态参数?
- RQ3仅依靠视觉和语言信号,PBD 系统在多大程度上能够泛化到不同的用户输入和用户界面布局?
- RQ4系统是否能够检测用户命令与实际演示操作之间的不匹配,并提醒用户注意此类不一致?
- RQ5将计算机视觉与 NLU 结合,与传统 PBD 系统相比,如何提升智能手机任务自动化的鲁棒性和可用性?
主要发现
- VASTA 成功利用目标检测和 OCR 在视觉和位置变化下检测并跟踪用户界面元素,展示了在动态应用环境中的鲁棒性。
- NLU 组件能够有效将用户语句聚类到同一任务类别,并提取参数,实现对相似命令的泛化。
- 用户研究证实,VASTA 能够在多个第三方应用(包括网页视图和无可访问标记的应用)中自动化多样化的任务。
- 该系统在处理用户界面变化方面优于传统 PBD 方法,并支持在可访问性 API 不可用的平台上实现自动化。
- 用户研究参与者认为系统直观易用,能够处理自然语言变化和任务参数的变动。
- 尽管面临挑战,VASTA 的基于视觉的方法在 XML 系统(如 SUGILITE)失效的环境中(如网页视图和图形渲染的用户界面)仍能实现自动化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。