Skip to main content
QUICK REVIEW

[논문 리뷰] Mapping Natural Language Instructions to Mobile UI Action Sequences

Yang Li, Jiacong He|arXiv (Cornell University)|2020. 05. 07.
Multimodal Machine Learning Applications참고 문헌 23인용 수 5
한 줄 요약

이 논문은 모바일 UI에서 자연어 지시문을 실행 가능한 동작 시퀀스로 번역하는 새로운 작업을 제안하며, 두 단계로 구성된 모델을 개발한다. 첫 번째 단계에서는 트랜스포머 기반 모델을 사용해 지시문에서 동작 어휘 튜플(작업, 대상, 인자)을 추출하고, 두 번째 단계에서는 맥락 기반 화면 표현을 통해 이 튜플을 UI 객체에 할당한다. 제안된 방법은 새로운 데이터셋 PixelHelp에서 전체 동작 시퀀스 예측에 대해 70.59%의 정확도를 달성한다.

ABSTRACT

We present a new problem: grounding natural language instructions to mobile user interface actions, and create three new datasets for it. For full task evaluation, we create PIXELHELP, a corpus that pairs English instructions with actions performed by people on a mobile UI emulator. To scale training, we decouple the language and action data by (a) annotating action phrase spans in HowTo instructions and (b) synthesizing grounded descriptions of actions for mobile user interfaces. We use a Transformer to extract action phrase tuples from long-range natural language instructions. A grounding Transformer then contextually represents UI objects using both their content and screen position and connects them to object descriptions. Given a starting screen and instruction, our model achieves 70.59% accuracy on predicting complete ground-truth action sequences in PIXELHELP.

연구 동기 및 목표

  • 사용자 간섭 없이 다단계 자연어 지시문을 모바일 터치 UI에서 자동으로 실행하는 데 도전하는 것.
  • 실제 세계의 영어 지시문과 모바일 UI 에뮬레이터 상의 해당 동작 시퀀스를 짝지은 새로운 벤치마크 데이터셋 PixelHelp를 구축하는 것.
  • 웹에서 확보한 HowTo 지시문을 사용해 어휘 추출을 분리하고, 합성 명령 생성을 통해 기반을 확장함으로써 학습을 분리하고 확장하는 것.
  • 장거리 지시문에서 정확하게 동작 어휘 튜플을 추출하고, 모바일 UI 환경에서 이를 기반으로 기반화하는 모델을 개발하는 것.
  • 언어 기반 UI 제어를 통해 시각적 또는 상황적 장애가 있는 사용자에게 접근성 있고 자동화된 작업 실행을 가능하게 하는 것.

제안 방법

  • 트랜스포머 기반 어휘 추출기는 세 가지 스파닝 표현 전략(합산 풀링 포함)을 사용해 장문의 자연어 지시문에서 작업, 대상, 인자 스팬을 식별한다.
  • 기반화 모델은 UI 객체의 내용과 화면 위치를 기반으로 맥락 인식 트랜스포머를 사용해 표현하며, 자연어 기술과의 정렬을 가능하게 한다.
  • 시스템은 두 단계로 작업을 분해한다: (1) 튜플 시퀀스를 생성하기 위한 어휘 추출, (2) 이 튜플을 연속된 UI 화면의 실행 가능한 동작으로 매핑하는 기반화.
  • 합성 데이터 생성 파이프라인을 통해 25,000개의 모바일 UI 화면에서 295,000개의 단일 단계 명령어를 생성하여 기반화 모델의 사전 학습을 수행했으며, 이는 총 178,000개의 고유한 UI 객체를 포함한다.
  • 기반화 모델은 화면 전환 함수와 구조적 관계(예: 뷰 계층)를 활용해 동작 실행 중 화면 상태의 변화를 모델링한다.
  • 전체 파이프라인은 종단 간 학습 및 평가가 이루어지며, 부분적 및 완전한 동작 시퀀스 정확도 모두로 성능을 측정한다.

실험 결과

연구 질문

  • RQ1두 단계 모델이 장문의 다단계 자연어 지시문에서 동작 어휘 튜플(작업, 대상, 인자)을 효과적으로 추출할 수 있는가?
  • RQ2맥락 인식 트랜스포머 모델이 모바일 터치스크린 환경에서 추출된 어휘 튜플을 특정 UI 객체에 얼마나 잘 기반화할 수 있는가?
  • RQ3실제 세계의 모바일 UI 지시문에서 전체 정답 동작 시퀀스를 예측하는 데 전체 파이프라인의 성능은 어떠한가?
  • RQ4다양한 스팬 표현 방식과 객체 인코딩 전략이 어휘 추출 및 기반화 정확도에 어떤 영향을 미치는가?
  • RQ5어휘 추출에서 발생하는 누적 오류가 기반화 성능에 미치는 영향은 얼마나 크며, 어휘 모델의 은닉 상태가 기반화의 강건성 향상에 기여하는가?

주요 결과

  • 스패닝 표현에 합산 풀링을 사용한 어휘 추출기는 HowTo 지시문 데이터셋에서 완전한 정답 스팬 시퀀스 예측에 대해 85.56%의 정확도를 달성한다.
  • 전체 시스템은 자연어 지시문에서 전체 동작 시퀀스를 예측하는 데 PixelHelp 데이터셋에서 70.59%의 완전 정확도와 89.21%의 부분 정확도를 기록한다.
  • 어휘 디코더의 은닉 상태를 사용할 경우 기반화 모델의 성능이 떨어지며, 이는 합성 데이터와 실제 지시문 데이터 간 도메인 차이를 시사한다.
  • 어휘 추출기가 PixelHelp의 14개 작업에서 정확한 단계를 추출하지 못했으며, 주로 불필요한 단계를 추가(11개 작업)하거나 잘못된 단계를 생성(3개 작업)했지만, 단계를 건너뛰지는 않았다.
  • 정성 분석을 통해 지시문의 위치 관련 단어와 해당 UI 객체의 화면 위치 임베딩 간 강한 상관관계가 확인되었다.
  • 모델의 성능은 데이터셋 간 언어 스타일의 차이에 민감하며, 합성 명령어는 간결함을 선호하는 반면, 실제 지시문은 더 높은 어휘 다양성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.