Skip to main content
QUICK REVIEW

[论文解读] ScreenQA: Large-Scale Question-Answer Pairs over Mobile App Screenshots

Yu-Chung Hsiao, Fedir Zubach|arXiv (Cornell University)|Sep 16, 2022
Topic Modeling被引用 5
一句话总结

本文提出了ScreenQA,一个包含超过80,000个移动应用截图的问答对的大规模数据集,旨在通过问答任务来评估屏幕内容理解能力。该任务要求智能体识别并排序相关用户界面元素以回答自然语言问题,重点关注语义分组和最少答案选择,为视觉-语言模型在移动用户界面理解方面提供了新的基准。

ABSTRACT

We introduce ScreenQA, a novel benchmarking dataset designed to advance screen content understanding through question answering. The existing screen datasets are focused either on low-level structural and component understanding, or on a much higher-level composite task such as navigation and task completion for autonomous agents. ScreenQA attempts to bridge this gap. By annotating 86k question-answer pairs over the RICO dataset, we aim to benchmark the screen reading comprehension capacity, thereby laying the foundation for vision-based automation over screenshots. Our annotations encompass full answers, short answer phrases, and corresponding UI contents with bounding boxes, enabling four subtasks to address various application scenarios. We evaluate the dataset's efficacy using both open-weight and proprietary models in zero-shot, fine-tuned, and transfer learning settings. We further demonstrate positive transfer to web applications, highlighting its potential beyond mobile applications.

研究动机与目标

  • 通过创建一个连接结构化用户界面分析与高层任务自动化的基准,填补屏幕内容理解方面的空白。
  • 支持移动应用界面机器阅读理解的研究,因为理解显示信息对于任务完成和无视觉交互至关重要。
  • 提供一个公开可获取的大规模数据集,支持在具有多样化布局和语义内容的真实移动用户界面中对视觉-语言模型进行评估。
  • 鼓励开发无需依赖视图层次结构输入即可对移动应用截图中的视觉和文本内容进行推理的模型。
  • 通过结构化的问答框架,分析理解真实应用截图中文本、图标、符号以及分组语义元素的挑战。

提出的方法

  • 对36,000张独特的RICO应用截图进行了标注,生成了82,000个问答对,重点在于内容理解而非结构或操作。
  • 采用两轮标注流程,由人工标注员基于每张截图的视觉内容生成问题,确保问题的相关性和多样性。
  • 将答案选择定义为选择一个或多个UI元素(通过边界框表示),其文本内容能最小程度地满足问题要求,并按相关性或阅读顺序排序。
  • 引入一种灵活的评估指标,通过允许基于语义的分组而非基于坐标的排序,减轻因UI元素边界不精确带来的歧义。
  • 在必要时允许答案跨越多个UI元素,特别是针对分组内容(如锻炼项目)或分散信息(如日期组件)。
  • 通过使用人工绘制的边界框标注47%的答案,避免依赖视图层次结构,反映出在答案选择中需要人类水平的语义判断。

实验结果

研究问题

  • RQ1真实移动应用截图中的问题类型分布和多样性如何?它们如何反映用户的资讯需求?
  • RQ2单个UI元素在多大程度上足以回答一个问题?在什么情况下需要组合多个元素或使用语义分组?
  • RQ3当定义最小答案时,人工标注员在多大程度上依赖视图层次结构,而非手动绘制边界框?
  • RQ4视觉元素如图标、符号和非文本内容在多大程度上影响移动用户界面内容理解的难度?
  • RQ5视觉-语言模型是否能有效理解并回答关于移动应用内容的问题,而无需访问结构化的用户界面元数据?

主要发现

  • 超过92%的问题可以通过单个边界框回答,表明大多数内容问题都集中于一个UI元素。
  • 尽管存在视图层次结构,仍有47%的答案需要人工绘制的边界框,表明在复杂情况下视图层次结构不足以实现最小答案选择。
  • 约0.5%的问题需要结合视图层次结构节点与人工绘制的边界框,通常出现在答案跨越语义上不同或非连续的UI组件时。
  • 该数据集包含36,000张唯一截图中的82,000个问题,其中46,000个为唯一问题,表明常见问题类型在不同应用间存在显著复用。
  • 问题分布呈现指数衰减,斜率较缓,表明每张截图的问题频率分布自然且均衡。
  • 相当比例的问题(如12.7%)涉及用户特定或动态内容,如消费限额、中间名首字母或速度,反映了真实的用户信息需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。