[논문 리뷰] Enabling Conversational Interaction with Mobile UI using Large Language Models
이 논문은 단일 대규모 언어 모델(LLM)을 사용하여 모바일 UI와의 다양한 대화형 상호작용을 허용하는 프롬프팅 기반 접근법을 제안한다. 이는 작업별 특화된 데이터셋과 훈련이 필요로 하지 않도록 한다. Android UI 뷰 계층을 구조화된 HTML 텍스트 표현으로 변환함으로써, 각 작업당 두 개의 흩어진 예시만으로도 네 가지 핵심 작업—화면 질문 생성, 요약, 질의응답, 지시어에서 동작으로의 매핑—에서 경쟁력 있는 성능을 달성한다.
Conversational agents show the promise to allow users to interact with mobile devices using language. However, to perform diverse UI tasks with natural language, developers typically need to create separate datasets and models for each specific task, which is expensive and effort-consuming. Recently, pre-trained large language models (LLMs) have been shown capable of generalizing to various downstream tasks when prompted with a handful of examples from the target task. This paper investigates the feasibility of enabling versatile conversational interactions with mobile UIs using a single LLM. We designed prompting techniques to adapt an LLM to mobile UIs. We experimented with four important modeling tasks that address various scenarios in conversational interaction. Our method achieved competitive performance on these challenging tasks without requiring dedicated datasets and training, offering a lightweight and generalizable approach to enable language-based mobile interaction.
연구 동기 및 목표
- 단일 일반화 가능한 모델을 사용하여 다양한 대화형 상호작용을 모바일 UI와 수행하는 데 도전하는 데 초점 맞추기.
- 기존 보조자가 GUI 이해 능력이 부족하고 UI 전용 질문에 답하지 못하는 한계를 극복하기.
- 언어 기반 모바일 상호작용을 위한 비용이 많이 드는 작업별 특화된 데이터셋과 훈련 파이프라인에 대한 의존도를 줄이기.
- 소수 예제 프롬프팅을 통해 사전 훈련된 LLM을 모바일 UI 작업에 적응시킬 수 있는 가능성을 탐색하기.
- 언어 기반 모바일 상호작용의 빠른 프로토타이핑을 위한 경량이고 일반화 가능한 프레임워크 구축하기.
제안 방법
- 깊이 우선 탐색 순회를 사용하여 Android UI 뷰 계층을 구조적 및 속성 정보를 유지하는 텍스트 기반 HTML 표현으로 변환하기.
- 화면 질문 생성, 요약, 질의응답, 지시어에서 동작으로의 매핑 등 네 가지 핵심 모바일 UI 상호작용 작업을 수행하도록 작업별 프롬프팅 템플릿 설계하기.
- 피팅 튜닝 없이도 LLM을 적응시키기 위해 각 작업당 두 개의 인라인 예시를 사용한 컨텍스트 기반 소수 예제 학습 활용하기.
- LLM의 사전 훈련된 지식과 일반화 능력을 활용하여 UI 의미를 추론하고 맥락에 적합한 응답 생성하기.
- 재현 가능성과 향후 확장성을 위해 HTML 변환 알고리즘과 예시 프롬프트를 오픈소스로 공개하기.
- 표준 메트릭과 인간 평가를 사용하여 기존 모델인 Screen2Words와 비교해 성능 평가하기.
실험 결과
연구 질문
- RQ1소수 예제 프롬프팅을 사용하여 단일 사전 훈련된 LLM이 여러 모바일 UI 대화형 상호작용 작업에 효과적으로 적응할 수 있는가?
- RQ2전용 훈련 데이터가 없는 새로운 작업—예를 들어 화면 질문 생성 및 질의응답—에서 LLM의 성능은 어느 정도인가?
- RQ3UI 계층의 HTML 표현이 LLM이 모바일 인터페이스에 대해 추론하기 위해 필요한 구조적 및 의미적 정보를 어느 정도 유지하는가?
- RQ4소수 예제 LLM 접근법의 성능가 기존의 대규모 데이터셋으로 훈련된 전용 모델과 비교해 어떻게 되는가?
- RQ5오직 뷰 계층 데이터에 의존할 경우의 한계는 무엇이며, 시각적 또는 다중모odal 신호가 모바일 UI 상호작용에서 LLM의 신뢰성에 어떤 영향을 미치는가?
주요 결과
- 제안된 프롬프팅 방법은 각 작업당 두 개의 소수 예제만으로도 화면 질문 생성, 요약, 질의응답, 지시어에서 동작으로의 매핑 등 네 가지 도전적인 모바일 UI 작업에서 경쟁력 있는 성능을 달성했다.
- 이전에 문헌에서 다뤄지지 않은 화면 질문 생성이라는 신규 작업에 대해 벤치마크 성능를 설정했다.
- 인간 평가 결과, Screen2Words(수천 개의 예제로 훈련된 모델)보다 LLM이 생성한 화면 요약이 더 정확한 것으로 나타났다.
- 질문 조합 및 지식 통합과 같은 잠재적 행동을 보이며, 강력한 추론 및 일반화 능력을 보여주었다.
- 시각 입력 없이도 모델이 텍스트 기반 UI 작업에서 잘 수행되었으며, 이는 뷰 계층 기반 HTML 표현이 많은 상호작용 시나리오에서 효과적임을 시사한다.
- 이 접근법은 기존 파이프라인에 비해 데이터셋 수집 및 모델 훈련의 시간과 비용을 크게 줄여 언어 기반 모바일 상호작용의 빠른 프로토타이핑을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.