[论文解读] ILuvUI: Instruction-tuned LangUage-Vision modeling of UIs from Machine Conversations
本文提出 ILuvUI,一种在 335K 经指令微调的多模态 UI 截图与文本交互数据上进行微调的视觉-语言模型,这些数据由 LLM 和 UI 元素检测器生成。该方法无需人工标注的字幕,实现了零样本 UI 理解,并在 UI 描述、推理和多步导航任务上表现出色,优于未针对 UI 微调的视觉-语言模型。
Multimodal Vision-Language Models (VLMs) enable powerful applications from their fused understanding of images and language, but many perform poorly on UI tasks due to the lack of UI training data. In this paper, we adapt a recipe for generating paired text-image training data for VLMs to the UI domain by combining existing pixel-based methods with a Large Language Model (LLM). Unlike prior art, our method requires no human-provided annotations, and it can be applied to any dataset of UI screenshots. We generate a dataset of 335K conversational examples paired with UIs that cover Q&A, UI descriptions, and planning, and use it to fine-tune a conversational VLM for UI tasks. To assess the performance of our model, we benchmark it on UI element detection tasks, evaluate response quality, and showcase its applicability to multi-step UI navigation and planning.
研究动机与目标
- 解决视觉-语言模型(VLM)在 UI 领域缺乏多模态训练数据的问题。
- 开发一种可扩展的自动化方法,用于生成无需人工标注的多样化、高质量的 UI 文本-图像配对数据。
- 微调一个视觉-语言模型,使其能够执行 UI 任务中的指令,包括描述、推理和多步导航。
- 在 UI 理解基准上评估模型性能,并证明其在未见 UI 任务上的泛化能力。
提出的方法
- 利用现有的 UI 元素检测模型,从 UI 截图中提取结构化表示。
- 使用大型语言模型(GPT-3.5-turbo)基于检测到的 UI 元素和上下文,生成六类文本响应——问答、描述、操作列表、结果预测、元素选择和规划。
- 将基于像素的 UI 截图与 LLM 生成的文本结合,创建 335K 组用于微调的图像-指令配对样本。
- 在合成的 UI 数据集上微调开源的 LLaVA VLM,构建一个指令遵循型视觉代理 ILuvUI。
- 通过使用多样化的提示模板,生成多样化、逼真且任务特定的响应,以提升数据多样性。
- 在 UI 元素检测、描述和多步导航任务上,对模型进行零样本和 few-shot 评估。
实验结果
研究问题
- RQ1视觉-语言模型能否在无人工标注字幕的情况下,有效微调于合成的、指令微调的 UI 数据?
- RQ2该模型在 UI 专属任务(如元素检测、描述和动作规划)上的表现如何?
- RQ3该模型能否泛化到未见过的 UI 布局,并基于自然语言指令执行多步导航?
- RQ4该模型在 UI 理解基准上与未针对 UI 微调的 VLM 相比,性能如何?
主要发现
- ILuvUI 模型在 UI 元素检测和类型识别任务上表现优异,优于未针对 UI 微调的 VLM。
- 通过定性和定量评估验证,该模型生成了高质量、上下文相关的描述和操作建议。
- ILuvUI 展现出推理和规划能力,能够通过序列化动作预测成功完成多步 UI 任务(如启动计时器)。
- 合成数据生成流程在无需人工标注字幕的情况下,生成了多样化、逼真且任务特定的响应,实现了可扩展的数据生成。
- 该模型能泛化到未见过的 UI 布局,并在不同应用领域中表现出稳健性能,基准评估结果已证实这一点。
- 该方法实现了零样本 UI 理解,为实现可访问的语音控制 UI 交互和自动化 GUI 测试铺平了道路。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。