Skip to main content
QUICK REVIEW

[논문 리뷰] Android in the Wild: A Large-Scale Dataset for Android Device Control

C. Rawles, Alice Li|arXiv (Cornell University)|2023. 07. 19.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 30,000개의 고유한 자연어 지시어, 네 가지 안드로이드 버전(v10–13), 여덟 종류의 기기 유형을 포함하여 총 715,000개의 인간 레이블링된 기기 상호작용 에피소드를 포함하는 대규모 데이터셋인 Android in the Wild(AitW)을 소개한다. 이 데이터셋은 UI 메타데이터에 의존하지 않고 실제 UI에서 정확한 제스처로 자연어를 매핑하는 기기 제어 에이전트의 훈련과 평가를 가능하게 하며, 새로운 작업, 앱, 플랫폼 버전에 대한 강건성에 중점을 두어, UI 메타데이터 없이도 종단 간 비전 기반 에이전트 학습의 실현 가능성을 입증한다.

ABSTRACT

There is a growing interest in device-control systems that can interpret human natural language instructions and execute them on a digital device by directly controlling its user interface. We present a dataset for device-control research, Android in the Wild (AITW), which is orders of magnitude larger than current datasets. The dataset contains human demonstrations of device interactions, including the screens and actions, and corresponding natural language instructions. It consists of 715k episodes spanning 30k unique instructions, four versions of Android (v10-13),and eight device types (Pixel 2 XL to Pixel 6) with varying screen resolutions. It contains multi-step tasks that require semantic understanding of language and visual context. This dataset poses a new challenge: actions available through the user interface must be inferred from their visual appearance. And, instead of simple UI element-based actions, the action space consists of precise gestures (e.g., horizontal scrolls to operate carousel widgets). We organize our dataset to encourage robustness analysis of device-control systems, i.e., how well a system performs in the presence of new task descriptions, new applications, or new platform versions. We develop two agents and report performance across the dataset. The dataset is available at https://github.com/google-research/google-research/tree/master/android_in_the_wild.

연구 동기 및 목표

  • 플랫폼 전용 UI 메타데이터에 의존하지 않고 실제 모바일 UI에서 직접 작동하는 기기 제어 에이전트를 훈련하고 평가하기 위한 대규모, 다양한, 현실적인 데이터셋의 부족을 해결하기 위해.
  • 신규 작업 지시어, 신규 애플리케이션, 변화하는 안드로이드 플랫폼 버전(v10–13) 및 기기 유형(Pixel 2 XL에서 Pixel 6까지)에 대한 일반화 연구를 가능하게 하기 위해.
  • 구조화된 UI 요소 동작이 아닌, 좌표 수준의 정확한 제스처(예: 스와이프, 터치)로 자연어 명령을 매핑하는 비전 기반 에이전트의 개발을 지원하기 위해.
  • 미리 정의된 도메인 분할을 사용한 체계적인 평가 프로토콜을 통해, 알려지지 않은 작업, 앱, UI에 대한 분포 이탈 상황에서의 에이전트 성능 평가를 위한 벤치마크를 제공하기 위해.
  • 원시 화면 픽셀을 처리하고 저수준 제스처 동작을 생성할 수 있는 다중모odal 기반의 기초 모델 기반 에이전트의 개발을 촉진하기 위해.

제안 방법

  • 실제 안드로이드 기기에서 인간 레이블러들이 자연어 지시어를 수행하면서 캡처한 전체 상호작용 트레이제터리(스크린샷 및 정확한 <x,y> 제스처 동작 포함)를 통해 데이터셋을 수집하였다.
  • 레이블러들은 마우스와 키보드를 사용해 터치 상호작용을 시뮬레이션하였으며, 터치 탭, 드래그, 시스템 단추 입력(예: 홈, 뒤로가기)을 공간 정밀도로 기록하였다.
  • 다중 단계 에피소드에 대해 뒤늦은 재라벨링( hindsight relabeling )을 적용하여 단일 단계 작업을 생성함으로써 데이터 효율성을 높이고 목표 달성 성능 평가를 가능하게 하였다.
  • 데이터셋은 인간 레이블러, LLM 생성 지시어, 기술 문서(예: PixelHelp) 등으로부터 유래한 다양한 작업 지시어를 포함하여 언어적 및 기능적 다양성을 확보하였다.
  • 350개 이상의 안드로이드 앱과 웹사이트를 포함하며, 화면 해상도, 기기 형상, 안드로이드 버전의 다양성이 있어 실제 분포 이탈 상황에서의 강건성 평가가 가능하다.
  • 평가에는 오픈소스 안드로이드 에뮬레이터 플랫폼인 AndroidEnv를 사용하여, 알려지지 않은 조건에서의 에이전트 성능을 재현 가능한 방식으로 평가할 수 있다.
Figure 1: AitW data pipeline . Raters are given a randomly selected instruction. The raters execute the task by interacting with the device in a natural way. We capture precise gestures in addition to typing and the home and back button interactions (we plot swipes with the arrow pointing where the
Figure 1: AitW data pipeline . Raters are given a randomly selected instruction. The raters execute the task by interacting with the device in a natural way. We capture precise gestures in addition to typing and the home and back button interactions (we plot swipes with the arrow pointing where the

실험 결과

연구 질문

  • RQ1훈련 중에 볼 수 없었던 새로운 작업 지시어, 특히 고수준이거나 모호한 지시어에 대해 기기 제어 에이전트는 얼마나 잘 일반화할 수 있는가?
  • RQ2AitW에서 훈련된 에이전트는 신규 안드로이드 플랫폼 버전(v10–13)과 다양한 기기 유형(Pixel 2 XL에서 Pixel 6까지)에서 얼마나 신뢰성 있게 작동하는가?
  • RQ3구조화된 UI 메타데이터에 접근할 수 없는 상황에서 비전 기반 에이전트는 원시 화면 픽셀과 자연어를 정확한 좌표 수준의 제스처로 매핑하는 데 얼마나 효과적인가?
  • RQ4자동 평가 지표(부분 일치 및 완전 일치)는 제로샷 일반화 설정에서 인간 레이블링 성능을 얼마나 신뢰성 있게 근사할 수 있는가?
  • RQ5현실 세계의 시각 기반 다단계 기기 제어 작업에 적용했을 때, 기존의 이mitation learning 및 LLM 기반 에이전트의 한계는 무엇인가?

주요 결과

  • AitW 데이터셋은 30,000개의 고유 지시어, 350개 이상의 앱 및 웹사이트, 네 가지 안드로이드 버전(v10–13), 여덟 종류의 기기 유형을 포함하여 총 715,000개의 에피소드를 포함하며, 이는 이전 데이터셋보다 수개의 주기수 이상 크다.
  • 인간 레이블링 완전 일치와의 부분 일치 상관관계는 특히 짧은 작업에서 강력하여, 자동 평가 지표가 진정된 성능을 신뢰할 수 있는 대체 지표로 활용될 수 있음을 검증한다.
  • 완전 일치 지표는 진정된 성능의 하한선 추정치이므로, 자동 평가 지표는 에이전트 성공률을 다소 과소 평가할 수 있지만, 벤치마크 목적에서는 여전히 유용하다.
  • AitW에서 훈련된 두 개의 에이전트가 존재한다: 행동 복제 모델과 LLM 기반 에이전트이며, 후자가 전자를 능가하지 못함을 통해 이 작업에 전용 모델이 여전히 퍼포먼스 면에서 파생 기초 모델보다 효과적일 수 있음을 시사한다.
  • 이 데이터셋은 새로운 작업, 새로운 앱, 새로운 안드로이드 버전에 대한 일반화 테스트를 위한 전용 분할을 포함하여, 알려지지 않은 도메인에 대한 강건성 평가가 가능하다.
  • 레이블러의 인구 통계적 특성과 입력 방식(마우스/키보드 vs. 터치)의 한계가 있음에도 불구하고, 이 데이터셋은 현실적이고 다양한 상호작용 패tern을 캡처하며 일반화 및 다중모달 학습 연구를 지원한다.
(a)
(a)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.