Skip to main content
QUICK REVIEW

[논문 리뷰] Spotlight: Mobile UI Understanding using Vision-Language Models with a Focus

Gang Li, Yang Li|arXiv (Cornell University)|2022. 09. 29.
Multimodal Machine Learning Applications인용 수 10
한 줄 요약

Spotlight는 화면 캡처에서 관심 영역에 집중하는 시각-언어 모델을 사용하여 뷰 계층 구조에 의존하지 않는 시각 중심 접근법을 제안한다. 이는 신뢰할 수 없는 뷰 계층 구조에 기반하지 않고도 다수의 UI 작업에서 최신 기술 성능을 달성하며, 확장 가능한 사전 훈련과 미세조정, 다중 작업 학습, 소수의 예제를 통한 프롬프팅을 지원한다.

ABSTRACT

Mobile UI understanding is important for enabling various interaction tasks such as UI automation and accessibility. Previous mobile UI modeling often depends on the view hierarchy information of a screen, which directly provides the structural data of the UI, with the hope to bypass challenging tasks of visual modeling from screen pixels. However, view hierarchies are not always available, and are often corrupted with missing object descriptions or misaligned structure information. As a result, despite the use of view hierarchies could offer short-term gains, it may ultimately hinder the applicability and performance of the model. In this paper, we propose Spotlight, a vision-only approach for mobile UI understanding. Specifically, we enhance a vision-language model that only takes the screenshot of the UI and a region of interest on the screen -- the focus -- as the input. This general architecture of Spotlight is easily scalable and capable of performing a range of UI modeling tasks. Our experiments show that our model establishes SoTA results on several representative UI tasks and outperforms previous methods that use both screenshots and view hierarchies as inputs. Furthermore, we explore multi-task learning and few-shot prompting capacities of the proposed models, demonstrating promising results in the multi-task learning direction.

연구 동기 및 목표

  • 뷰 계층 구조의 한계를 해결하기 위해, 모바일 UI 이해에서 누락되거나 손상된 객체 기술 및 구조적 불일치 문제를 해결한다.
  • 뷰 계층 구조 데이터에 의존하지 않는 확장 가능한 시각 중심의 모바일 UI 모델링 접근법을 개발한다.
  • 통합된 시각-언어 모델 아키텍처와 영역별 주의 메커니즘을 통해 다양한 UI 작업 간 일반화를 가능하게 한다.
  • 저자원 UI 모델링 환경에서 다중 작업 학습과 소수의 예제를 통한 프롬프팅의 효과성을 탐색한다.
  • 대규모 고품질 시각 데이터로 훈련된 시각-언어 모델이 하이브리드 시각-뷰 계층 모델보다 우수한 성능을 낼 수 있음을 입증한다.

제안 방법

  • UI 화면 캡처의 특정 관심 영역에 집중하기 위해 영역 인식 주의 메커니즘(Region Summarizer)을 시각-언어 모델에 통합한다.
  • 250만 개의 모바일 UI 화면 캡처와 8,000만 개의 웹 페이지를 사용해 시각-언어 표현을 학습하기 위해 사전 훈련한다.
  • 위젯 설명 작성, 화면 요약, 명령어 기반 위치 지정 등의 특정 작업을 위해 감독 데이터를 사용해 모델을 미세조정한다.
  • 공유된 시각 및 언어 인코더를 사용해 여러 UI 작업을 동시에 학습함으로써 다중 작업 학습을 지원한다.
  • 재훈련 없이도 인ference 시 소수의 레이블 예시를 제공함으로써 소수의 예제 프롬프팅을 가능하게 한다.
  • 시각 인코딩에 비전 트랜스포머(ViT)를, 텍스트 생성에 T5 기반 디코더를 사용하며, 영역 경계 상자(Bounding Box)를 조건 입력으로 활용한다.

실험 결과

연구 질문

  • RQ1시각 중심 접근법이 뷰 계층 구조에 의존하는 기존 방법보다 모바일 UI 이해에서 우월한 성능을 낼 수 있는가?
  • RQ2영역 중심의 시각-언어 모델이 UI 작업에 필요한 시각적 및 언어적 맥락을 얼마나 효과적으로 포착할 수 있는가?
  • RQ3다중 작업 학습이 다양한 UI 모델링 작업 간 일반화 능력을 얼마나 향상시킬 수 있는가?
  • RQ4소수의 예제 프롬프팅을 통해 최소한의 레이블 예시로도 새로운 UI 작업에 효과적으로 적응할 수 있는가?
  • RQ5대규모이고 다양한 UI 및 웹 데이터로 사전 훈련한 모델이 초기 학습에서부터 훈련한 모델보다 하류 작업 성능을 크게 향상시키는가?

주요 결과

  • Spotlight는 위젯 설명 작성, 화면 요약, 명령어 기반 위치 지정 등의 다수의 모바일 UI 작업에서 최신 기술 성능을 달성하며, 화면 캡처와 뷰 계층 모두를 사용하는 기존 방법보다 뛰어난 성능을 보였다.
  • L/16 모델은 5개의 예제를 사용한 소수의 예제 프롬프팅으로 위젯 설명 작성 작업에서 62.1%의 정확도를 달성했으며, 제로샷 프롬프팅 대비 약간의 향상이 있었다.
  • 더 큰 모델(L/16 등)은 더 작은 모델(B/16 등)보다 소수의 예제 일반화 능력이 뛰어나, 높은 용량이 소수의 예제 적응 능력을 향상시킨다는 것을 시사한다.
  • 절단 실험 결과, 사전 훈련이 성능 향상에 크게 기여하며, 미세조정된 모델은 초기 학습에서부터 훈련한 모델보다 뚜렷한 성능 향상을 보였다.
  • 캡처링 및 요약 작업에서의 주의 시각화 결과, 모델이 목표 영역뿐 아니라 의미적으로 관련된 주변 요소들에도 주의를 기울이는 것을 확인했다.
  • 뷰 계층 입력이 없음에도 불구하고 모델은 작업 간에 잘 일반화되며, 대규모 사전 훈련에서 기인한 강력한 전이 학습 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.