Skip to main content
QUICK REVIEW

[论文解读] Enabling Conversational Interaction with Mobile UI using Large Language Models

Bryan Wang, Gang Li|arXiv (Cornell University)|Sep 18, 2022
AI in Service Interactions被引用 4
一句话总结

本文提出一种基于提示的方案,仅使用单一大型语言模型(LLM)即可实现与移动UI的多样化对话交互,无需任务特定的数据集和训练过程。通过将Android UI视图层次结构转换为结构化的HTML文本表示,该方法在四项关键任务——屏幕问题生成、摘要生成、问答和指令到动作映射——上实现了具有竞争力的性能,且每项任务仅需两个 few-shot 示例。

ABSTRACT

Conversational agents show the promise to allow users to interact with mobile devices using language. However, to perform diverse UI tasks with natural language, developers typically need to create separate datasets and models for each specific task, which is expensive and effort-consuming. Recently, pre-trained large language models (LLMs) have been shown capable of generalizing to various downstream tasks when prompted with a handful of examples from the target task. This paper investigates the feasibility of enabling versatile conversational interactions with mobile UIs using a single LLM. We designed prompting techniques to adapt an LLM to mobile UIs. We experimented with four important modeling tasks that address various scenarios in conversational interaction. Our method achieved competitive performance on these challenging tasks without requiring dedicated datasets and training, offering a lightweight and generalizable approach to enable language-based mobile interaction.

研究动机与目标

  • 解决使用单一可泛化的模型实现与移动UI多样化对话交互的挑战。
  • 克服现有助手缺乏GUI理解能力、无法回答与UI相关问题的局限性。
  • 减少对昂贵的任务特定数据集和训练流程的依赖,以实现基于语言的移动交互。
  • 探索通过 few-shot 提示将预训练LLM适配到移动UI任务的可行性。
  • 建立轻量级、可泛化的框架,以实现基于语言的移动交互的快速原型开发。

提出的方法

  • 使用深度优先搜索遍历将Android UI视图层次结构转换为保留结构和属性信息的基于文本的HTML表示。
  • 设计任务特定的提示模板,引导LLM执行四项核心移动UI交互任务:屏幕问题生成、摘要生成、问答和指令到动作映射。
  • 利用上下文 few-shot 学习,每项任务仅使用两个示例来适应LLM,无需微调。
  • 利用LLM的预训练知识和泛化能力,推断UI语义并生成上下文相关的响应。
  • 开源HTML转换算法和示例提示,以支持可复现性和未来扩展。
  • 使用标准指标和人工评估进行性能评估,并与现有模型如Screen2Words进行比较。

实验结果

研究问题

  • RQ1能否通过 few-shot 提示有效适应单一预训练LLM,以执行多种移动UI对话交互任务?
  • RQ2LLM在无专用训练数据的情况下,对新型任务(如屏幕问题生成和问答)的性能如何?
  • RQ3UI层次结构的HTML表示在在多大程度上保留了LLM推理移动界面所必需的结构和语义信息?
  • RQ4与在大规模数据集上训练的专用模型相比,few-shot LLM方法的性能如何?
  • RQ5仅依赖视图层次结构数据存在哪些局限性?视觉或多模态线索在多大程度上影响LLM在移动UI交互中的可靠性?

主要发现

  • 所提出的提示方法在四项具有挑战性的移动UI任务——屏幕问题生成、摘要生成、问答和指令到动作映射——上实现了具有竞争力的性能,且每项任务仅使用两个 few-shot 示例。
  • 该方法在新型任务“屏幕问题生成”上设立了基准性能,该任务此前在文献中尚未被研究过。
  • 人工评估显示,LLM生成的屏幕摘要比基于数万个示例训练的Screen2Words模型更准确。
  • LLM表现出问题组合和知识融合等涌现行为,表明其具备强大的推理和泛化能力。
  • 尽管缺乏视觉输入,该模型在基于文本的UI任务上表现良好,表明基于视图层次结构的HTML表示在许多交互场景中是有效的。
  • 该方法显著降低了数据集收集和模型训练的时间与成本,使基于语言的移动交互能够实现快速原型开发。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。