Skip to main content
QUICK REVIEW

[논문 리뷰] Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning

Nicholas E. Corrado, Y. Qu|arXiv (Cornell University)|2023. 10. 27.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

GuDA는 사용자가 정의한 규칙를 적용하여 작업 완료로 향하는 진행 상황을 보이는 트레이젝터리 세그먼트를 선택함으로써 전문가 수준의 시범 데이터를 생성하는 인간이 안내하는 데이터 증강 프레임워크이다. 이는 오프라인 강화학습과 이터레이션 학습에서 무작위 데이터 증강보다 뛰어나며, 단 한 개의 열악한 시범 데이터로도 효과적인 정책 학습을 가능하게 하였고, 물리적 로봇 축구 작업에서 전문가 정책을 초월하기도 하였다.

ABSTRACT

In offline reinforcement learning (RL), an RL agent learns to solve a task using only a fixed dataset of previously collected data. While offline RL has been successful in learning real-world robot control policies, it typically requires large amounts of expert-quality data to learn effective policies that generalize to out-of-distribution states. Unfortunately, such data is often difficult and expensive to acquire in real-world tasks. Several recent works have leveraged data augmentation (DA) to inexpensively generate additional data, but most DA works apply augmentations in a random fashion and ultimately produce highly suboptimal augmented experience. In this work, we propose Guided Data Augmentation (GuDA), a human-guided DA framework that generates expert-quality augmented data. The key insight behind GuDA is that while it may be difficult to demonstrate the sequence of actions required to produce expert data, a user can often easily characterize when an augmented trajectory segment represents progress toward task completion. Thus, a user can restrict the space of possible augmentations to automatically reject suboptimal augmented data. To extract a policy from GuDA, we use off-the-shelf offline reinforcement learning and behavior cloning algorithms. We evaluate GuDA on a physical robot soccer task as well as simulated D4RL navigation tasks, a simulated autonomous driving task, and a simulated soccer task. Empirically, GuDA enables learning given a small initial dataset of potentially suboptimal experience and outperforms a random DA strategy as well as a model-based DA strategy.

연구 동기 및 목표

  • 실세계 작업에서 수집하기 어려운 고성능 전문가 시범 데이터 확보의 과제를 해결하기 위해.
  • 추가적인 실세계 상호작용 없이 다양하고 전문가 유사한 시범 데이터를 생성하여 오프라인 강화학습과 이터레이션 학습의 성능을 향상시키기 위해.
  • 최적의 전문가 시범 데이터에 대한 의존도를 줄이기 위해, 작업 진행 상황에 관한 간단하고 직관적인 규칙를 사용해 데이터 증강을 안내할 수 있도록 하기 위해.
  • 모의 환경과 실제 환경, 복잡한 물리적 로봇 작업을 포함한 다양한 환경에서 지도된 데이터 증강의 효과를 평가하기 위해.

제안 방법

  • GuDA는 무작위로 샘플링하는 대신, 작업 완료로 향하는 의미 있는 진행 상황을 나타내는 트레이젝터리 세그먼트를 선별하고 생성하기 위해 사용자가 정의한 규칙의 집합을 사용한다.
  • 기존의 시범 트레이젝터리에 대해 이동, 회전, 반사와 같은 기하학적 변환을 적용하여 새로운 다양성 있는 트레이젝터리를 생성한다.
  • 사용자는 목표에 접근하거나 올바르게 방향을 맞추는 등의 작업 관련 행동 기반으로 규칙를 정의함으로써 생성된 데이터가 전문가 행동을 근사하도록 보장한다.
  • 이 방법은 오프더쉐프 오프라인 RL 및 행동 클로닝 알고리즘을 활용하여 증강된 데이터셋에서 정책을 훈련시킨다.
  • GuDA는 모의 탐색, 자율 주행, 그리고 단 하나의 열악한 시범 데이터만을 사용하는 물리적 로봇 축구 환경을 포함한 작업들에 적용되었다.
  • 성공률과 완료 시간 지표를 사용하여 GuDA를 무작위 데이터 증강 및 증강 없음과 비교하여 평가하였다.

실험 결과

연구 질문

  • RQ1사용자가 안내하는 데이터 증강이 실세계 상호작용 없이 전문가 수준의 시범 데이터를 생성할 수 있는가?
  • RQ2오프라인 강화학습과 이터레이션 학습에서 지도된 데이터 증강은 무작위 데이터 증강에 비해 정책 성능에서 어떻게 비교되는가?
  • RQ3GuDA는 단지 몇 개의 열악한 전문가 시범 데이터로도 효과적인 정책 학습을 가능하게 하는가?
  • RQ4증강된 데이터로 훈련된 경우, GuDA는 실제 물리적 작업에서 원본 시범자보다 뛰어난 성능을 보이는가?

주요 결과

  • 단 하나의 열악한 시범 데이터로 수행된 물리적 로봇 축구 작업에서, GuDA는 어려운 초기화 조건 하에서 7/10의 성공률을 기록했고, Random DA와 No DA는 각각 0/10을 기록했다.
  • 쉬운 초기화 조건에서는 GuDA가 8/10의 성공률을 기록하여 Random DA(4/10)와 No DA(4/10)를 크게 앞서며 전문가의 9/10 성공률과 동일한 성과를 냈다.
  • 쉬운 초기화 조건에서 GuDA로 훈련된 정책은 전문가 정책보다 더 빠른 시간 내에 성공했으며, 이는 더 뛰어난 샘플 효율성과 정책 품질을 의미한다.
  • 어려운 초기화 조건에서는 오직 GuDA 정책만 일관되게 성공했고, 전문가 정책은 거의 모든 시도에서 실패했으며, 이는 GuDA가 시범자보다 뛰어날 수 있음을 보여준다.
  • GuDA로 생성된 데이터는 IQM 지표와 신뢰구간을 통해 Random DA보다 더 나은 일반화 성능과 더 낮은 골까지 소요 시간을 달성했으며, 이는 더 나은 정책 성능을 의미한다.
  • 결과적으로 GuDA는 작업 진행 상황에 초점을 맞춘 고품질의 증강 데이터를 생성함으로써, 최소한의 열악한 시범 데이터로도 효과적인 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.