[논문 리뷰] Learning Visual Robotic Control Efficiently with Contrastive Pre-training and Data Augmentation
CoDER는 대조적 사전 훈련, 온라인 데이터 증강, 그리고 소수의 시범 예측을 조합하여 데이터 효율적인 시각 기반 로봇 강화 학습을 가능하게 한다. 10개의 시범 예측만으로도 실제 로봇 데이터를 훈련에 사용하여, 도달하기, 스위치 뒤집기, 서랍 열기와 같은 희소 보상 기반의 조작 작업을 단 30분의 실제 훈련 시간 내에 수행한다.
Recent advances in unsupervised representation learning significantly improved the sample efficiency of training Reinforcement Learning policies in simulated environments. However, similar gains have not yet been seen for real-robot reinforcement learning. In this work, we focus on enabling data-efficient real-robot learning from pixels. We present Contrastive Pre-training and Data Augmentation for Efficient Robotic Learning (CoDER), a method that utilizes data augmentation and unsupervised learning to achieve sample-efficient training of real-robot arm policies from sparse rewards. While contrastive pre-training, data augmentation, demonstrations, and reinforcement learning are alone insufficient for efficient learning, our main contribution is showing that the combination of these disparate techniques results in a simple yet data-efficient method. We show that, given only 10 demonstrations, a single robotic arm can learn sparse-reward manipulation policies from pixels, such as reaching, picking, moving, pulling a large object, flipping a switch, and opening a drawer in just 30 minutes of mean real-world training time. We include videos and code on the project website: https://sites.google.com/view/efficient-robotic-manipulation/home
연구 동기 및 목표
- 픽셀 관측에서의 실제 로봇 강화 학습에서의 데이터 비효율성 문제를 해결한다.
- 표준 강화 학습과 이민 학습의 한계를 극복하기 위해 비지도 표현 학습과 효율적인 탐색을 조합한다.
- 시뮬레이션, 동작 캡처, 또는 밀도 높은 보상에 의존하지 않고도 실제 로봇 하드웨어에서 샘플 효율적인 정책 학습을 가능하게 한다.
- 대조적 사전 훈련, 데이터 증강, 및 소수의 시범 예측 간의 상호보완성이 실제 환경에서 신속하고 신뢰할 수 있는 정책 훈련을 가능하게 한다는 것을 입증한다.
제안 방법
- 10개의 전문가 시범 예측을 수집하고 이를 재생 버퍼에 저장하여 학습 과정을 초기화한다.
- 시범 데이터를 기반으로 인스턴스 수준의 대조적 학습을 사용하여 컨볼루션 인코더를 사전 훈련하여 시점에 강인한 시각적 표현을 학습한다.
- 온라인 상호작용과 초기 시범 예측에서 유래한 증강된 관측값을 사용하여 오프정책 딥 강화 학습(SAC)을 통해 정책을 미세 조정한다.
- 강화 학습 훈련 중 관측값에 무작위 데이터 증강(예: 자르기, 색상 왜곡)을 적용하여 정확도와 표현 학습을 향상시킨다.
- 희소 보상 신호를 사용하여 정책을 실제 세계에서 종단 간(end-to-end)으로 훈련시켜 엔지니어링된 보상이나 사전 상태 정보에 의존도를 최소화한다.
- 사전 훈련된 인코더를 활용하여 정책 네트워크를 의미 있는 시각적 특징으로 초기화함으로써 샘플 효율성을 향상시킨다.

실험 결과
연구 질문
- RQ1대조적 사전 훈련과 데이터 증강이 실제 로봇 시각 강화 학습에서 샘플 효율성을 크게 향상시킬 수 있는가?
- RQ2비지도 표현 학습과 결합할 경우 소수의 시범 예측(예: 10개)이 얼마나 효율적인 정책 학습을 가능하게 하는가?
- RQ3사전 훈련, 데이터 증강, 및 오프정책 강화 학습의 조합이 실제 로봇 조작에서 개별 구성 요소보다 우수한 성능을 내는가?
- RQ4이 프레임워크는 최소한의 인간 간섭으로도 다양한 희소 보상 기반 조작 작업에 얼마나 효과적으로 적용되는가?
- RQ5이 방법은 시뮬레이션이나 밀도 높은 감독 없이도 실제 시각적 변형과 복잡한 조작 작업에 일반화 가능한가?
주요 결과
- CoDER는 도달하기, 밀고 당기기, 큰 물체를 움직이기, 스위치 뒤집기, 서랍 열기 등 6개의 다양한 조작 작업에 대해 단 10개의 시범 예측만으로도 성공적인 정책을 훈련시켰다.
- 각 작업당 총 15분에서 50분 이내의 실제 훈련 시간 내에 안정적인 성능을 달성하였으며, 표준 강화 학습 대비 샘플 복잡도를 크게 감소시켰다.
- 대조적 사전 훈련, 데이터 증강, 및 시범 예측의 조합은 각각의 구성 요소만으로는 실제 로봇 작업에서 실패하는 상황에서도 효율적인 학습을 가능하게 한다.
- CoDER는 밀도 높은 보상, Sim2Real 전이, 또는 동작 캡처를 사용하는 방법들과 비슷한 데이터 효율성을 달성하지만, 이러한 구성 요소들을 필요로 하지 않는다.
- 물체의 형태나 위치에 작은 변화가 있을 경우에도 일반화 성능가 유지되지만, 조명 변화나 배경 변화와 같은 큰 시각적 도메인 이동에서는 성능 저하가 발생한다.
- 이 방법은 두 대의 RGB 카메라, 단일 GPU, 최소한의 설정만으로도 표준 로봇 하드웨어에 경량으로 구현 가능하며, 깊이 센서나 복잡한 인프라 없이도 구동된다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.