Skip to main content
QUICK REVIEW

[논문 리뷰] A data-driven approach for learning to control computers

Peter C. Humphreys, David Raposo|arXiv (Cornell University)|2022. 02. 16.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

이 논문은 대규모 인간 시연 데이터와 행동 복제를 활용하여 키보드 및 마우스 기반 컴퓨터 제어 작업에서 인간 수준의 성능을 달성하는 데이터 기반 강화 학습 접근법을 제시한다. 이 방법은 전용 동작 공간을 사용하지 않고 표준 키보드 및 마우스 동작만을 사용하며, 최소한의 아키텍처 수정으로도 강력한 태스크 간 전이 성능를 보여준다.

ABSTRACT

It would be useful for machines to use computers as humans do so that they can aid us in everyday tasks. This is a setting in which there is also the potential to leverage large-scale expert demonstrations and human judgements of interactive behaviour, which are two ingredients that have driven much recent success in AI. Here we investigate the setting of computer control using keyboard and mouse, with goals specified via natural language. Instead of focusing on hand-designed curricula and specialized action spaces, we focus on developing a scalable method centered on reinforcement learning combined with behavioural priors informed by actual human-computer interactions. We achieve state-of-the-art and human-level mean performance across all tasks within the MiniWob++ benchmark, a challenging suite of computer control problems, and find strong evidence of cross-task transfer. These results demonstrate the usefulness of a unified human-agent interface when training machines to use computers. Altogether our results suggest a formula for achieving competency beyond MiniWob++ and towards controlling computers, in general, as a human would.

연구 동기 및 목표

  • 키보드 및 마우스 입력만을 사용하여 컴퓨터를 제어할 수 있는 확장 가능하고 일반적인 방법을 개발하는 것.
  • 대규모 인간 시연 데이터가 전용 동작 공간이나 복잡한 커리큘럼 없이도 컴퓨터 제어 작업에서 뛰어난 성능를 가능하게 할 수 있는지 조사하는 것.
  • 디지털 작업 자동화를 위한 통합된 인간-에이전트 인터페이스에서 행동 복제와 강화 학습을 융합하는 효과를 평가하는 것.
  • 실제로 상호작용 가능한 웹 기반 환경에서 태스크 간 전이 및 인간 수준의 성능가 가능할지 확인하는 것.
  • 이전 연구에서 제기된 가설(기존 강화 학습 방법은 컴퓨터 제어에 부적절하다)을 검증하기 위해, 데이터 규모만으로도 성능 격차를 메울 수 있음을 보여주는 것.

제안 방법

  • 에이전트의 동작 공간으로 키보드 및 마우스 동작만을 사용하여 인간 상호작용 패턴과 직접 일치시킴.
  • 대규모 인간 시연 트랙토리(이전 데이터셋보다 최대 400배 이상 큼)를 활용하여 행동 복제를 통해 에이전트 정책을 사전 훈련함.
  • MiniWob++ 환경의 프로그래밍 가능한 보상 기반으로 행동 복제와 강화 학습을 결합하여 정책을 최적화함.
  • 더 풍부한 환경 이해를 위해 픽셀 수준의 시각적 입력과 DOM 수준의 상태 정보를 통합한 관측 공간을 사용함.
  • 특히 텍스트 입력이 많은 작업에서 탐색 부담을 줄이기 위해 태스크별 고유 텍스트 문자열의 사전을 활용함.
  • 전용 동작 공간이나 커리큘럼 설계 없이도 표준 딥 강화 학습 알고리즘(SAC 또는 PPO 등)을 행동 복제 정책 위에 적용함.

실험 결과

연구 질문

  • RQ1행동 복제와 강화 학습의 단순한 조합이 키보드 및 마우스만을 사용하여 인간 수준의 성능를 달성할 수 있는가?
  • RQ2인간 시연 데이터의 규모가 증가할수록 MiniWob++ 태스크에서 성능에 어떤 영향을 미치는가?
  • RQ3One 태스크에서 훈련된 정책이 MiniWob++ 벤치마크의 다른 태스크로 얼마나 잘 일반화되는가?
  • RQ4복잡한 웹 태스크에서 DOM 전용 동작 대비 표준 동작 공간(키보드 및 마우스)이 성능에서 뛰어나거나 동등한가?
  • RQ5대규모 인간 데이터만으로도 아키텍처 혁신이나 커리큘럼 학습 없이 인간 수준의 행동과의 성능 격차를 메울 수 있는가?

주요 결과

  • 이 방법은 MiniWob++ 벤치마크의 모든 태스크에서 최신 기술(SOTA) 수준의 인간 수준 성능를 달성하며, 이전 최고 성능를 괴물러 뛰어넘음.
  • 인간 시연 데이터의 양이 증가할수록 성능가 단조롭게 향상되며, 이전 데이터셋의 400배 규모까지도 포화 현상 없이 성능 향상가 관찰됨.
  • 강력한 태스크 간 전이 성능가 관찰되어, 에이전트가 태스크에 특화된 동작을 암기하는 것이 아니라 일반화 가능한 기술을 학습하고 있음을 시사함.
  • 통합된 키보드 및 마우스 인터페이스의 사용은 DOM의 구조가 명확하지 않은 태스크로의 효과적인 일반화를 가능하게 하여 더 넓은 적용 가능성을 지원함.
  • 기존 딥 강화 학습에 대규모 행동 복제를 융합한 것이 고성능를 달성하는 데 충분하며, 전용 동작 공간이나 복잡한 커리큘럼의 필요성을 도전함.
  • 아키텍처 수정 없이도 커리큘럼 기반 훈련 없이 인간 수준의 성능를 달성함으로써, 상호작용 에이전트 학습에서 데이터 규모의 중요성을 입증함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.