Skip to main content
QUICK REVIEW

[논문 리뷰] VASTA: A Vision and Language-assisted Smartphone Task Automation System

Alborz Rezazadeh Sereshkeh, Gary Leung|arXiv (Cornell University)|2019. 11. 04.
Multimodal Machine Learning Applications참고 문헌 31인용 수 5
한 줄 요약

VASTA는 스마트폰 작업 자동화를 위한 시각 및 언어 지원 프로그래밍-바이-디모스트레이션 시스템으로, UI 구조에 의존하지 않고 컴퓨터 비전(객체 검출, OCR)과 자연어 이해를 활용하여 견고하고 일반화 가능한 자동화 스크립트를 생성한다. 비기술자 사용자가 액션을 시연하고 음성 명령어를 사용하여 제3자 앱 간의 작업을 자동화할 수 있도록 하며, 사용자 연구에서 높은 정확도로 UI 요소 검출 및 발화 이해를 달성한다.

ABSTRACT

We present VASTA, a novel vision and language-assisted Programming By Demonstration (PBD) system for smartphone task automation. Development of a robust PBD automation system requires overcoming three key challenges: first, how to make a particular demonstration robust to positional and visual changes in the user interface (UI) elements; secondly, how to recognize changes in the automation parameters to make the demonstration as generalizable as possible; and thirdly, how to recognize from the user utterance what automation the user wishes to carry out. To address the first challenge, VASTA leverages state-of-the-art computer vision techniques, including object detection and optical character recognition, to accurately label interactions demonstrated by a user, without relying on the underlying UI structures. To address the second and third challenges, VASTA takes advantage of advanced natural language understanding algorithms for analyzing the user utterance to trigger the VASTA automation scripts, and to determine the automation parameters for generalization. We run an initial user study that demonstrates the effectiveness of VASTA at clustering user utterances, understanding changes in the automation parameters, detecting desired UI elements, and, most importantly, automating various tasks. A demo video of the system is available here: http://y2u.be/kr2xE-FixjI

연구 동기 및 목표

  • 비프로그래머 사용자가 자연스러운 제스처와 음성 명령어를 사용하여 반복적인 스마트폰 작업을 자동화할 수 있도록 하는 것.
  • UI 계층 또는 마크업에 의존하는 기존 PBD 시스템의 한계를 극복하여, 시각적 또는 구조적 변경 상황에서도 작동하지 않는 문제를 해결하는 것.
  • 컴퓨터 비전과 NLU를 활용해 다양한 앱 버전과 사용자 발화 변형에 일반화된 자동화 스크립트를 생성하는 것.
  • 웹 뷰 및 복잡한 렌더링을 가진 네이티브 앱을 포함한 다양한 제3자 앱 간의 작업 자동화를 지원하는 것.
  • 컴퓨터 비전을 통해 위치나 시각적 변화가 발생하더라도 UI 요소를 견고하게 탐지할 수 있도록 하는 것.

제안 방법

  • 접근성 API나 XML 구조에 의존하지 않고, 최신 기술 수준의 객체 검출 및 OCR을 활용해 UI 요소를 식별하고 레이블링하는 것.
  • 시각적 특징과 텍스트 내용을 기반으로 UI 요소를 추적하는 비전 기반 접근법을 사용하여 UI 레이아웃 및 외관 변화에 강건성을 확보하는 것.
  • 고급 자연어 이해(NLU) 모델을 활용해 유사한 사용자 발화를 군집화하고 작업 매개변수를 추출하여 일반화를 달성하는 것.
  • 사용자 시연(터치/스와이프 좌표 및 화면 상태)과 NLU 입력을 통합하여 실행 가능한 자동화 스크립트를 생성하는 것.
  • 스마트폰 UI 요소의 대규모 데이터셋을 기반으로 전용 객체 검출기를 훈련시켜 검출 정확도를 향상시키는 것.
  • 시각적 추적과 NLU를 결합하여 사용자 명령어와 시연된 동작 간의 불일치를 탐지하며, 향후 XML 데이터 통합을 통해 신뢰도를 향상시킬 수 있도록 설계된 것.

실험 결과

연구 질문

  • RQ1UI 계층에 의존하지 않고 시각 기반 시스템이 다양한 앱 버전과 시각적 변화 상황에서도 UI 요소를 탐지하고 추적할 수 있는가?
  • RQ2NLU 모델이 다양한 사용자 발화를 동일한 자동화 작업으로 군집화하고 동적 매개변수를 얼마나 정확하게 추출할 수 있는가?
  • RQ3비전 및 언어 신호만을 사용하여 PBD 시스템이 다양한 사용자 입력과 UI 레이아웃 변화에 얼마나 잘 일반화되는가?
  • RQ4사용자 명령어와 시연된 동작 간의 불일치를 탐지하고 이러한 불일치를 사용자에게 경고할 수 있는가?
  • RQ5컴퓨터 비전과 NLU를 결합함으로써 기존 PBD 시스템에 비해 스마트폰 작업 자동화의 견고성과 사용성은 얼마나 향상되는가?

주요 결과

  • VASTA는 객체 검출과 OCR을 활용해 시각적 및 위치적 변화가 발생하는 상황에서도 UI 요소를 성공적으로 탐지하고 추적하며, 동적인 앱 환경에서의 견고성을 입증한다.
  • NLU 모듈은 사용자 발화를 동일한 작업 카테고리로 효과적으로 군집화하고 매개변수를 추출하여 유사한 명령어에 대한 일반화를 가능하게 한다.
  • 사용자 연구를 통해 VASTA가 웹 뷰 및 접근성 마크업이 없는 앱을 포함한 다양한 제3자 앱에서 다양한 작업을 자동화할 수 있음을 확인했다.
  • 접근성 API가 사용 불가능한 플랫폼에서도 기존 PBD 방법보다 UI 변경에 더 잘 대응하며 자동화를 지원함을 입증했다.
  • 사용자 연구에 참여한 참가자들은 시스템이 자연어 변형과 작업 매개변수 변화를 잘 처리할 수 있으며 직관적으로 사용할 수 있다고 평가했다.
  • 도전 과제가 있었음에도 불구하고, VASTA의 비전 기반 접근법은 XML 기반 시스템(SUGILITE 등)이 실패하는 환경, 예를 들어 웹 뷰나 그래픽 렌더링 UI에서의 자동화를 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.