Skip to main content
QUICK REVIEW

[논문 리뷰] VUT: Versatile UI Transformer for Multi-Modal Multi-Task User Interface Modeling

Yang Li, Gang Li|arXiv (Cornell University)|2021. 12. 10.
Speech and dialogue systems인용 수 10
한 줄 요약

VUT는 UI 이미지, 뷰 계층 구조, 자연어를 동시에 처리하는 통합 다중모odal 트랜스포머 모델로, 오브젝트 검출, 명령어 기반 위치 지정, 위젯 설명 생성, 화면 요약, 탭 가능성 예측의 다섯 가지 별개의 사용자 인터페이스 작업을 수행한다. 이는 전용 모델 수준의 성능를 유지하거나 초월하면서도 다중 작업 학습을 통한 통합으로 모델 크기를 줄였다.

ABSTRACT

User interface modeling is inherently multimodal, which involves several distinct types of data: images, structures and language. The tasks are also diverse, including object detection, language generation and grounding. In this paper, we present VUT, a Versatile UI Transformer that takes multimodal input and simultaneously accomplishes 5 distinct tasks with the same model. Our model consists of a multimodal Transformer encoder that jointly encodes UI images and structures, and performs UI object detection when the UI structures are absent in the input. Our model also consists of an auto-regressive Transformer model that encodes the language input and decodes output, for both question-answering and command grounding with respect to the UI. Our experiments show that for most of the tasks, when trained jointly for multi-tasks, VUT substantially reduces the number of models and footprints needed for performing multiple tasks, while achieving accuracy exceeding or on par with baseline models trained for each individual task.

연구 동기 및 목표

  • 다양하고 다중모달적인 UI 모델링 작업을 하나의 공통 모델 아키텍처로 통합하여 구현 복잡도와 모델 크기를 줄이기 위해.
  • 일반적인 표현을 통해 이미지, 구조, 언어를 공유하는 방식으로 단일 모델이 다양한 이질적인 UI 작업을 효과적으로 처리할 수 있는지 조사하기 위해.
  • 각 작업에 대해 별도의 모델을 필요로 하지 않으면서도 높은 성능를 유지할 수 있는 컴act하고 확장 가능한 모델을 설계하기 위해.
  • 특히 모바일 기기와 같은 자원 제약 환경에서 UI 모델링을 위한 공동 다중작업 학습의 타당성과 효율성을 평가하기 위해.
  • 오브젝트 검출이 별도의 사전학습 작업이 아니라 다중작업 학습 파이프라인의 일부로 효과적으로 통합될 수 있는지 보여주기 위해.

제안 방법

  • VUT는 두 개의 트랜스포머 타워 아키텍처를 사용한다: 시각적 및 구조적 UI 입력을 위한 이미지-구조 인코더와 언어 입력을 위한 질문-답변 디코더.
  • 이미지-구조 모델은 이미지와 뷰 계층 구조 특징을 조기에 융합하며, 오브젝트 탐색 시 주의 메커니즘을 안내하는 포커스 맵을 활용한다.
  • 구조 입력이 없을 경우에도 모델은 시각적 입력만으로도 안정적인 오브젝트 검출을 수행할 수 있다.
  • 질문-답변 모델은 이미지-구조 표현에 주의를 기울이고, 설명 생성 및 요약 작업을 위한 텍스트 출력을 디코딩한다.
  • 언어 명령어 기반 위치 지정 작업에서는 질문-답변 인코더의 최종 히든 상태를 사용하여 대상 UI 요소를 예측한다.
  • 각 작업 헤드는 배치 단위로 동적으로 활성화되어 단일 순방향 전파 내에서 다수의 작업을 처리할 수 있다.

실험 결과

연구 질문

  • RQ1단일 다중모달 트랜스포머 모델이 동시에 다섯 가지 별개의 UI 모델링 작업을 효과적으로 수행할 수 있는가?
  • RQ2공동 다중작업 학습이 단일 작업 학습 대비 개별 작업의 성능을 떨어뜨리는가?
  • RQ3공통 학습 프레임워크 내에서 오브젝트 검출의 포함 여부가 다른 작업의 성능에 어떤 영향을 미치는가?
  • RQ4작업별 특화 미세조정이나 별도 아키텍처 없이도 다양한 작업에서 높은 정확도를 유지할 수 있는가?
  • RQ5오브젝트 검출을 별도의 사전학습 작업이 아닌 다중작업 학습 파이프라인의 일부로 사용하는 것이 가능한가?

주요 결과

  • VUT는 오브젝트 검출, 위젯 설명 생성, 화면 요약, 언어 명령어 기반 위치 지정, 탭 가능성 예측의 다섯 가지 작업 전반에서 전용 모델 수준의 성능를 유지하거나 초월한다.
  • 위젯 설명 생성 작업에서 전체 다중작업 모델은 BLEU-1 47.0과 CIDEr 99.3을 기록했으며, 단일작업 기준선(45.8, 94.8)을 능가했다.
  • 화면 요약 작업에서 다중작업 모델은 BLEU-1 67.7과 ROUGE 53.9를 기록했으며, 단일작업 최고 성능(68.7, 53.8)에 비해 약간 낮았지만 여전히 경쟁력 있는 성능를 보였다.
  • 언어 명령어 기반 위치 지정 작업에서 전체 다중작업 모델은 80.8%의 정확도를 달성했으며, 단일작업 기준선(75.5%)을 뛰어넘었다.
  • 탭 가능성 예측 작업에서 전체 다중작업 설정에서 F1 점수는 88.3%를 기록했으며, 단일작업 기준선(86.6%)을 초월했다.
  • 공동 학습 중 오브젝트 검출 정확도는 약간 하락했지만(AP 35.2 vs. 단일작업 37.0), 안정적이고 복구 가능했으며, 다중작업 환경에서도 강건함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.