[논문 리뷰] You Only Look at Screens: Multimodal Chain-of-Action Agents
이 논문은 환경 파싱이나 애플리케이션 전용 API에 의존하지 않고 화면 픽셀을 관찰하여 직접 사용자 인터페이스와 상호작용하는 다중모달 자율 에이전트인 Auto-UI를 소개한다. 이는 이력 동작과 향후 계획을 통합한 액션 체인 기법을 사용하여 액션 예측 성능을 향상시키며, 추론 시간이 1초 이내인 조건에서 AITW 벤치마크에서 90%의 액션 유형 정확도와 74%의 성공률을 달성한다.
Autonomous graphical user interface (GUI) agents aim to facilitate task automation by interacting with the user interface without manual intervention. Recent studies have investigated eliciting the capabilities of large language models (LLMs) for effective engagement in diverse environments. To align with the input-output requirement of LLMs, most existing approaches are developed under a sandbox setting where they rely on external tools and application-specific APIs to parse the environment into textual elements and interpret the predicted actions. Consequently, those approaches often grapple with inference inefficiency and error propagation risks. To mitigate the challenges, we introduce Auto-GUI, a multimodal solution that directly interacts with the interface, bypassing the need for environment parsing or reliance on application-dependent APIs. Moreover, we propose a chain-of-action technique -- leveraging a series of intermediate previous action histories and future action plans -- to help the agent decide what action to execute. We evaluate our approach on a new device-control benchmark AITW with 30$K$ unique instructions, spanning multi-step tasks such as application operation, web searching, and web shopping. Experimental results show that Auto-GUI achieves state-of-the-art performance with an action type prediction accuracy of 90\% and an overall action success rate of 74\%. Code is publicly available at https://github.com/cooelf/Auto-GUI.
연구 동기 및 목표
- 환경 파싱이나 애플리케이션 전용 API에 의존하지 않고 직접 화면 인터페이스에서 작동하는 자율 UI 에이전트를 개발하는 것.
- 기존 LLM 기반 에이전트의 추론 비효율성과 오류 전파 문제를 해결하기 위해 중간 텍스트 기반 환경 표현을 제거하는 것.
- 과거 동작 이력과 향후 계획을 통합한 새로운 액션 체인 기법을 통해 액션 예측 정확도를 향상시키는 것.
- 실제 배포 환경에서 다양한 UI 작업(예: 앱 운영, 웹 검색, 웹 쇼핑)에 대한 일반화 능력을 확보하는 것.
- 소비자 하드웨어에서 실시간 배포에 적합한 최소한의 계산 비용으로 고속 추론을 달성하는 것.
제안 방법
- Auto-UI는 뷰어의 화면 이미지를 처리하기 위해 시각 인코더(BLIP-2)를 사용하고, 액션을 생성하기 위해 언어 모델(FLAN-Alpaca)을 활용하여 UI와 직접적인 다중모달 상호작용을 가능하게 한다.
- 액션 체인 기법은 각 단계에서 액션 예측을 안내하기 위해 과거 액션 이력과 향후 액션 계획을 모두 맥락으로 통합한다.
- 액션 예측의 공간 정확도를 향상시키기 위해 좌표 정규화 기법을 적용한다.
- 30,000개의 고유 지시문을 포함한 다단계 작업을 포함한 새로운 기기 제어 벤치마크 AITW에서 엔드 투 엔드로 모델을 훈련한다.
- 모든 도메인에서 통합 모델을 훈련하지만, 도메인 일반화 성능 평가를 위해 별도의 모델도 평가한다.
- 추론 속도를 최적화하여, GPU 메모리 사용량이 10GB 미만인 조건에서 1초 이내로 액션 예측을 수행한다.
실험 결과
연구 질문
- RQ1환경 파싱이나 애플리케이션 전용 API에 의존하지 않고 자율 에이전트가 UI 제어를 수행할 수 있는가?
- RQ2과거 액션 이력과 향후 계획을 통합함으로써 다중모달 UI 상호작용에서 액션 예측 정확도는 어떻게 향상되는가?
- RQ3복잡한 다단계 작업에서 기존 프롬프팅 및 파인튜닝 기반 베이스라인과 비교해 직접 화면을 관찰하는 에이전트의 성능은 어떠한가?
- RQ4웹 쇼핑, 앱 운영, 웹 검색 등의 다양한 UI 도메인 간에서 에이전트의 일반화 능력은 어느 정도인가?
- RQ5실시간 UI 제어에서 중간 크기의 다중모달 에이전트의 추론 효율성과 계산 비용은 어떠한가?
주요 결과
- Auto-UI는 AITW 벤치마크에서 최신 기술 수준의 90% 액션 유형 예측 정확도를 달성한다.
- 에이전트는 전체적으로 74%의 액션 성공률을 기록하며, 기존 프롬프팅 및 파인튜닝 기반 베이스라인을 초월한다.
- Auto-UI는 액션당 추론 시간이 1초 이내이며, 대규모 모델의 경우 최고 GPU 메모리 사용량이 8.2GB이다.
- 8비트 양자화를 적용한 Llama 2보다 15배 빠른 추론 속도를 기록하여 높은 계산 효율성을 입증한다.
- 액션 체인 기법은 성능 향상에 크게 기여하며, 추이적 분석 결과 이 기법이 정확도 향상에 기여하는 것으로 확인된다.
- 통합 모델은 도메인 간 일반화 능력이 뛰어나, AITW 벤치마크의 예측되지 않은 서브셋에서도 강력한 zero-shot 전이 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.