Skip to main content
QUICK REVIEW

[논문 리뷰] ScreenQA: Large-Scale Question-Answer Pairs over Mobile App Screenshots

Yu-Chung Hsiao, Fedir Zubach|arXiv (Cornell University)|2022. 09. 16.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 모바일 앱 스크린샷을 기반으로 한 80,000개 이상의 질문-답변 쌍을 포함하는 대규모 데이터셋인 ScreenQA를 소개한다. 이는 질문 응답을 통한 화면 내용 이해를 평가하기 위해 설계되었으며, 에이전트가 자연어 질문에 답하기 위해 관련 UI 요소를 식별하고 순위를 매여야 하는 작업을 요구한다. 이 작업은 의미적 그룹화와 최소한의 답변 선택에 중점을 두어, 모바일 UI 이해 분야에서 비전-언어 모델에 대한 새로운 벤치마크를 제공한다.

ABSTRACT

We introduce ScreenQA, a novel benchmarking dataset designed to advance screen content understanding through question answering. The existing screen datasets are focused either on low-level structural and component understanding, or on a much higher-level composite task such as navigation and task completion for autonomous agents. ScreenQA attempts to bridge this gap. By annotating 86k question-answer pairs over the RICO dataset, we aim to benchmark the screen reading comprehension capacity, thereby laying the foundation for vision-based automation over screenshots. Our annotations encompass full answers, short answer phrases, and corresponding UI contents with bounding boxes, enabling four subtasks to address various application scenarios. We evaluate the dataset's efficacy using both open-weight and proprietary models in zero-shot, fine-tuned, and transfer learning settings. We further demonstrate positive transfer to web applications, highlighting its potential beyond mobile applications.

연구 동기 및 목표

  • 구조적 UI 분석과 고수준 작업 자동화 사이의 격차를 메우기 위해, 실질적인 화면 내용 이해를 평가할 수 있는 벤치마크를 구축하기 위해.
  • 작업 완료와 눈을 쓰지 않는 상호작용에 있어 표시된 정보를 이해하는 것이 핵심이 되는 모바일 앱 인터페이스에 대한 기계적 독해 이해 연구를 가능하게 하기 위해.
  • 다양한 레이아웃과 의미적 내용을 지닌 실제 모바일 UI에서 비전-언어 모델의 평가를 지원하는 공개 가능한 대규모 데이터셋을 제공하기 위해.
  • 뷰 계층 정보에 의존하지 않고도 모바일 앱 스크린샷의 시각적 및 텍스트적 내용을 추론할 수 있는 모델 개발을 장려하기 위해.
  • 구조적인 QA 프레임워크를 통해 실제 앱 스크린샷에서 텍스트, 아이콘, 기호, 그룹화된 의미적 요소를 이해하는 데 직면한 과제를 분석하기 위해.

제안 방법

  • 36,000개의 고유한 RICO 앱 스크린샷을 82,000개의 질문-답변 쌍으로 애너테이션하여, 구조나 동작이 아닌 내용 이해에 중점을 두었다.
  • 인간 애너테이터를 활용한 이중 단계 애너테이션 프로세스를 통해 각 스크린샷의 시각적 내용을 바탕으로 질문을 생성하여 관련성과 다양성을 확보했다.
  • 답변 선택을 하나 이상의 UI 요소(경계 상자로 표시)에서 선택하는 것으로 정의하였으며, 질문을 최소한으로 충족시키는 텍스트 내용을 기반으로 하며, 관련성 또는 독서 순서에 따라 순서를 정했다.
  • 좌표 기반 순서에 의존하지 않고 의미적 그룹화를 允허하는 유연한 평가 지표를 도입하여, 정확도가 떨어지는 UI 요소 경계로 인한 모호함을 완화했다.
  • 필요한 경우, 특히 그룹화된 콘텐츠(예: 운동 세트)나 산산이 흩어진 정보(예: 날짜 구성 요소)의 경우 여러 UI 요소를 아우르는 답변을 허용했다.
  • 뷰 계층 정보에 의존하지 않기 위해, 47%의 답변에 대해 수작업으로 그린 경계 상자를 사용하여, 답변 선택 시 인간 수준의 의미적 판단이 필요하다는 점을 반영했다.

실험 결과

연구 질문

  • RQ1실제 모바일 앱 스크린샷에서 질문 유형의 분포와 다양성은 어떻게 되며, 사용자의 정보 필요성과 어떻게 관련이 있는가?
  • RQ2단일 UI 요소로 질문에 답하는 경우가 얼마나 자주 발생하며, 언제는 여러 요소를 조합하거나 의미적 그룹화가 필요할까?
  • RQ3최소한의 답변를 정의할 때 인간 애너테이터가 뷰 계층 정보에 얼마나 의존하는가, 또는 수작업으로 그린 경계 상자 선택에 얼마나 의존하는가?
  • RQ4아이콘, 기호, 비텍스트 콘텐츠와 같은 시각적 요소가 모바일 UI에서 콘텐츠 이해의 어려움에 어떤 영향을 미치는가?
  • RQ5뷰 계층 정보에 접근할 수 없는 상태에서 비전-언어 모델이 모바일 앱 콘텐츠에 대해 효과적으로 질문을 이해하고 답할 수 있는가?

주요 결과

  • 질문의 92% 이상가 단일 경계 상자로 해결될 수 있어, 대부분의 콘텐츠 질문이 한 개의 UI 요소에 국한됨을 시사한다.
  • 뷰 계층 정보가 제공됨에도 불구하고 47%의 답변가 수작업으로 그린 경계 상자로 정의되었으며, 이는 복잡한 경우 뷰 계층 정보만으로는 최소한의 답변 선택이 부족함을 보여준다.
  • 약 0.5%의 질문에서 뷰 계층 노드와 수작업으로 그린 상자 조합이 필요했으며, 일반적으로 의미적으로 다를거나 이어지지 않는 UI 구성 요소를 아우르는 경우에 해당한다.
  • 36,000개의 고유한 스크린샷에 걸쳐 총 82,000개의 질문이 포함되어 있으며, 이 중 46,000개는 고유한 질문으로, 다양한 앱 간에 공통된 질문 유형의 반복 사용이 뚜렷하다.
  • 질문 분포는 지수 감소를 보이며 가벼운 기울기를 가지며, 스크린샷 당 질문 빈도의 천연적이고 균형 잡힌 분포임을 나타낸다.
  • 사용자 고유 또는 동적 콘텐츠(예: 소비 한도, 중간 이름, 속도 등)에 관련된 질문의 상당 부분(예: 12.7%)이 존재하여 실제 사용자의 정보 필요성을 반영하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.