Skip to main content
QUICK REVIEW

[论文解读] VUT: Versatile UI Transformer for Multi-Modal Multi-Task User Interface Modeling

Yang Li, Gang Li|arXiv (Cornell University)|Dec 10, 2021
Speech and dialogue systems被引用 10
一句话总结

VUT 是一种统一的多模态 Transformer 模型,通过联合处理 UI 图像、视图层级结构和自然语言,实现五项不同的用户界面任务——对象检测、命令定位、控件描述生成、屏幕摘要生成和可点击性预测,其性能与或优于专用任务模型,同时通过联合多任务学习显著减少了模型规模。

ABSTRACT

User interface modeling is inherently multimodal, which involves several distinct types of data: images, structures and language. The tasks are also diverse, including object detection, language generation and grounding. In this paper, we present VUT, a Versatile UI Transformer that takes multimodal input and simultaneously accomplishes 5 distinct tasks with the same model. Our model consists of a multimodal Transformer encoder that jointly encodes UI images and structures, and performs UI object detection when the UI structures are absent in the input. Our model also consists of an auto-regressive Transformer model that encodes the language input and decodes output, for both question-answering and command grounding with respect to the UI. Our experiments show that for most of the tasks, when trained jointly for multi-tasks, VUT substantially reduces the number of models and footprints needed for performing multiple tasks, while achieving accuracy exceeding or on par with baseline models trained for each individual task.

研究动机与目标

  • 将多种异构的多模态 UI 建模任务统一到单一共享模型架构中,以降低部署复杂度和模型规模。
  • 探究单一模型是否能通过共享图像、结构和语言表示,有效处理多种异构的 UI 任务。
  • 设计一种紧凑且可扩展的模型,在无需为每项任务单独配置模型的情况下,保持各项任务的高性能。
  • 评估在资源受限环境(如移动设备)中,联合多任务学习在 UI 建模中的可行性和有效性。
  • 证明对象检测可被有效整合到多任务框架中,而不会降低其他任务的性能。

提出的方法

  • VUT 采用双塔 Transformer 架构:图像-结构编码器用于处理视觉和结构化的 UI 输入,问题-答案解码器用于处理语言输入。
  • 图像-结构模型在早期阶段融合图像与视图层级特征,注意力机制通过关注图引导对象查询。
  • 即使缺少结构输入,模型仍能实现鲁棒的纯视觉对象检测。
  • 问题-答案模型关注图像-结构表示,并解码生成文本输出,用于描述生成和摘要生成任务。
  • 对于语言命令定位任务,模型利用问题-答案编码器的最终隐藏状态,预测目标 UI 元素。
  • 每个任务头根据批次动态激活,使模型能在单次前向传播中处理多项任务。

实验结果

研究问题

  • RQ1单一多模态 Transformer 模型能否同时有效执行五项不同的 UI 建模任务?
  • RQ2联合多任务学习是否会导致单个任务性能相比单任务训练有所下降?
  • RQ3在共享学习框架中,引入对象检测如何影响其他任务的性能?
  • RQ4模型能否在无需任务特定微调或独立架构的情况下,保持在多样化任务上的高精度?
  • RQ5是否可行将对象检测作为多任务学习流水线的一部分,而非作为独立的预训练任务?

主要发现

  • VUT 在所有五项任务中均达到或优于专用模型的性能,包括对象检测、控件描述生成、屏幕摘要生成、语言命令定位和可点击性预测。
  • 在控件描述生成任务中,完整多任务模型的 BLEU-1 达 47.0,CIDEr 达 99.3,优于单任务基线(45.8 和 94.8)。
  • 在屏幕摘要生成任务中,多任务模型的 BLEU-1 为 67.7,ROUGE 为 53.9,略低于单任务最佳结果(68.7 和 53.8),但仍具高度竞争力。
  • 在语言命令定位任务中,完整多任务模型准确率达到 80.8%,超过单任务基线的 75.5%。
  • 可点击性预测在完整多任务设置下达到 88.3% 的 F1 值,优于单任务基线的 86.6%。
  • 对象检测在联合训练中准确率略有下降(AP 为 35.2,单任务为 37.0),但保持稳定且可恢复,表明在多任务设置中具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。