[论文解读] Android in the Wild: A Large-Scale Dataset for Android Device Control
本论文介绍了 Android in the Wild (AitW),这是一个大规模数据集,包含 across 30k 条独特的自然语言指令、四个 Android 版本(v10–13)和八种设备类型,共 715k 条由人类标注的设备交互片段。该数据集支持训练和评估直接映射自然语言到真实 UI 上精确手势的设备控制智能体,重点关注对新任务、新应用和平台版本的鲁棒性,展示了无需依赖 UI 元数据即可实现端到端、基于视觉的智能体学习的可行性。
There is a growing interest in device-control systems that can interpret human natural language instructions and execute them on a digital device by directly controlling its user interface. We present a dataset for device-control research, Android in the Wild (AITW), which is orders of magnitude larger than current datasets. The dataset contains human demonstrations of device interactions, including the screens and actions, and corresponding natural language instructions. It consists of 715k episodes spanning 30k unique instructions, four versions of Android (v10-13),and eight device types (Pixel 2 XL to Pixel 6) with varying screen resolutions. It contains multi-step tasks that require semantic understanding of language and visual context. This dataset poses a new challenge: actions available through the user interface must be inferred from their visual appearance. And, instead of simple UI element-based actions, the action space consists of precise gestures (e.g., horizontal scrolls to operate carousel widgets). We organize our dataset to encourage robustness analysis of device-control systems, i.e., how well a system performs in the presence of new task descriptions, new applications, or new platform versions. We develop two agents and report performance across the dataset. The dataset is available at https://github.com/google-research/google-research/tree/master/android_in_the_wild.
研究动机与目标
- 为解决缺乏大规模、多样化且真实的训练和评估数据集的问题,这些数据集用于训练和评估直接在移动 UI 上操作、且不依赖平台特定 UI 元数据的设备控制智能体。
- 支持在新任务指令、新应用程序以及不断演进的 Android 平台版本(v10–13)和设备类型(Pixel 2 XL 至 Pixel 6)之间进行泛化研究。
- 支持开发基于视觉的智能体,将自然语言命令映射到精确的坐标级手势(例如滑动、点击),而非抽象的 UI 元素操作。
- 提供一个基准,用于评估在分布偏移情况下的智能体性能,包括未见过的任务、应用和 UI,采用包含未见领域划分的结构化评估协议。
- 促进多模态、基于基础模型的智能体的发展,这些智能体能够处理原始屏幕像素并生成低层级手势动作。
提出的方法
- 通过众包标注者在真实 Android 设备上执行自然语言指令来收集数据,捕获完整的交互轨迹,包括截图和精确的 <x,y> 手势动作。
- 标注者使用鼠标和键盘模拟触摸交互,以空间精度记录点击、拖动和系统按钮按键(例如主页键、返回键)。
- 对多步骤片段应用事后重标注(hindsight relabeling),以生成单步任务,提高数据效率并支持目标达成性能的评估。
- 数据包含来自人类标注者、大语言模型生成的提示以及技术文档(例如 PixelHelp)的多样化任务指令,确保语言和功能上的多样性。
- 数据涵盖 350 多个 Android 应用和网站,涵盖屏幕分辨率、设备形态和 Android 版本的差异,支持在真实世界分布偏移下的鲁棒性评估。
- 评估通过 AndroidEnv 进行,这是一个开源的 Android 模拟器平台,支持在未见条件下对智能体性能进行可复现的基准测试。

实验结果
研究问题
- RQ1设备控制智能体在未见过的训练指令(尤其是高层次或模糊的指令)上泛化能力如何,尤其在指令语义不明确时?
- RQ2在 AitW 上训练的智能体在新 Android 平台版本(v10–13)和多种设备类型(例如 Pixel 2 XL 至 Pixel 6)上表现的可靠性如何?
- RQ3基于视觉的智能体在无法访问结构化 UI 元数据的情况下,学习将原始屏幕像素和自然语言映射到精确坐标级手势的有效性如何?
- RQ4自动化评估指标(部分匹配和完全匹配)是否能可靠地近似零样本泛化设置下的人工标注性能?
- RQ5当应用于真实世界、视觉对齐的多步骤设备控制任务时,当前行为克隆和基于大语言模型的智能体存在哪些局限性?
主要发现
- AitW 数据集包含 715k 个交互片段,覆盖 30k 条独特的指令、350 多个应用和网站、四个 Android 版本(v10–13)和八种设备类型,其规模远超以往数据集,达到数量级的提升。
- 部分匹配与人工标注的完全匹配之间具有较强的皮尔逊相关性,尤其在短任务中表现更佳,验证了自动化指标可作为真实性能的可靠代理。
- 完全匹配指标是真实性能的下界估计,表明自动化评估可能低估智能体的成功率,但仍对基准测试具有实用价值。
- 在 AitW 上训练了两个智能体:行为克隆模型和基于大语言模型的智能体,前者表现优于后者,表明针对该任务的专用模型可能仍比微调的基础模型更有效。
- 该数据集支持对未见领域的鲁棒性评估,包括新任务、新应用和新 Android 版本,设有专门的划分用于泛化能力测试。
- 尽管标注者群体在人口统计学特征和输入方式(鼠标/键盘 vs. 触摸)方面存在局限,但数据仍捕捉到真实且多样的交互模式,支持对泛化能力和多模态学习的研究。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。