Skip to main content
QUICK REVIEW

[논문 리뷰] RL-CycleGAN: Reinforcement Learning Aware Simulation-To-Real

Kanishka Rao, C.J. Harris|arXiv (Cornell University)|2020. 06. 16.
Reinforcement Learning in Robotics참고 문헌 31인용 수 14
한 줄 요약

이 논문은 도메인 번역에 under Q-value의 불변성을 강제함으로써 시뮬레이션에서 실제 세계로의 시각 기반 강화 학습 전이를 향상시키는 작업 인식 이미지 번역 방법인 RL-CycleGAN을 제안한다. CycleGAN 프레임워크에 RL-신경망 일致 손실를 통합함으로써, 작업에 관련된 시각적 의미를 유지하면서 동시에 시뮬레이션된 이미지를 현실적으로 변환하며, 최소한의 실제 세계 데이터를 사용하여 최신 기술 수준의 실제 세계에서의 抓취 성능을 달성한다—실제로 5,000개의 실제 에피소드만으로도 94%의 성공률을 기록한다.

ABSTRACT

Deep neural network based reinforcement learning (RL) can learn appropriate visual representations for complex tasks like vision-based robotic grasping without the need for manually engineering or prior learning a perception system. However, data for RL is collected via running an agent in the desired environment, and for applications like robotics, running a robot in the real world may be extremely costly and time consuming. Simulated training offers an appealing alternative, but ensuring that policies trained in simulation can transfer effectively into the real world requires additional machinery. Simulations may not match reality, and typically bridging the simulation-to-reality gap requires domain knowledge and task-specific engineering. We can automate this process by employing generative models to translate simulated images into realistic ones. However, this sort of translation is typically task-agnostic, in that the translated images may not preserve all features that are relevant to the task. In this paper, we introduce the RL-scene consistency loss for image translation, which ensures that the translation operation is invariant with respect to the Q-values associated with the image. This allows us to learn a task-aware translation. Incorporating this loss into unsupervised domain translation, we obtain RL-CycleGAN, a new approach for simulation-to-real-world transfer for reinforcement learning. In evaluations of RL-CycleGAN on two vision-based robotics grasping tasks, we show that RL-CycleGAN offers a substantial improvement over a number of prior methods for sim-to-real transfer, attaining excellent real-world performance with only a modest number of real-world observations.

연구 동기 및 목표

  • 작업 특화 엔지니어링이나 광범위한 실제 세계 데이터 수집을 요구하지 않고, 시각 기반 강화 학습에서 시뮬레이션-실세계 격차를 해소하는 것.
  • 강화 학습 정책 성능에 핵심적인 특징을 유지하면서, 시뮬레이션된 이미지를 자동으로 현실적으로 변환하는 방법을 개발하는 것.
  • Q-value 불변성에 기반한 작업 인식 손실 함수를 도입함으로써 도메인 랜덤라이제이션이나 수동적 특징 엔지니어링에 대한 의존도를 줄이는 것.
  • 실제 세계 데이터와 시뮬레이션 데이터만을 사용하여, 실제 세계에서의 정책 전이를 효과적으로 가능하게 하는 것—학습 중 실제 세계의 온정책 롤아웃이 필요 없도록 하는 것.

제안 방법

  • Q-값이 사이클 GAN 이미지 번역 작동에 대해 불변하도록 하는 RL-신경망 일치 손실를 도입한다.
  • 이 손실를 표준 사이클 GAN 학습 목표와 결합하여, 시뮬레이션된 이미지를 현실적으로 변환하는 생성 모델을 동시에 학습한다.
  • 강화 학습 정책에서 사전 학습된 Q-함수를 사용하여 이미지 번역 과정을 감독함으로써, 작업에 관련된 특징이 유지되도록 보장한다.
  • 사이클 일관성을 활용하여 입력 이미지와 번역된 이미지 간의 구조적 및 의미적 정합성을 유지함으로써, 모드 붕괴를 방지한다.
  • 온정책 실세계 경험과 시뮬레이션 데이터를 기반으로 GAN을 학습함으로써, 학습 중 실세계의 온정책 롤아웃이 필요 없도록 한다.
  • 학습된 번역 모델을 정책 학습 중 시뮬레이션 관측을 적응시키는 데 적용함으로써, 시뮬레이션에서의 엔드 투 엔드 정책 학습과 실제 세계 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1작업 특화 특징의 수동 엔지니어링 없이도, 시뮬레이션-실세계 전이를 위한 도메인 적응 방법을 작업 인식적으로 만들 수 있는가?
  • RQ2이미지 번역에 under Q-값 불변성이 작업에 관련된 시각적 의미를 유지하는 데 효과적인 신호로 작용할 수 있는가?
  • RQ3RL-CycleGAN은 어떤 정도로 실제 세계에서의 높은 성능를 달성하기 위해 필요한 실제 세계 에피소드 수를 줄일 수 있는가?
  • RQ4GraspGAN 및 RCAN과 같은 이전 방법과 비교할 때, RL-CycleGAN은 실제 세계 성능과 데이터 효율성 측면에서 어떻게 다른가?

주요 결과

  • 오직 5,000개의 실제 세계 에피소드만으로도 RL-CycleGAN은 로봇 1에서 75%의 抓취 성공률을 달성하였으며, 기준 모델이 87% 성공률에 도달하기 위해 580,000개의 실제 에피소드가 필요로 한 것을 고려하면 성능이 뛰어나다.
  • 로봇 2에서는 단일 박스에서 3,000개의 실제 에피소드로 72%의 성공률을 기록하였으며, 이는 80,000개의 실제 에피소드가 필요한 기준 모델의 36% 성공률을 크게 능가한다.
  • 80,000개의 실제 에피소드로, RL-CycleGAN은 단일 박스에서 95%의 성공률, 다중 박스에서 93%의 성공률을 기록하여 최신 기술 수준의 성능를 도달하거나 초월하였다.
  • 10,000개의 온정책 실제 에피소드로의 정밀 조정 후, RL-CycleGAN은 94%의 抓취 성공률에 도달하였으며, RCAN의 성능를 따라가지만, RCAN가 28,000개의 온정책 에피소드가 필요한 데 비해 RL-CycleGAN은 오직 5,000개의 온정책 외부 에피소드만을 사용하였다.
  • 5,000개의 온정책 외부 에피소드와 5,000개의 온정책 에피소드를 사용하여 RL-CycleGAN은 90%의 抓취 성공률를 달성하였으며, 도메인 랜덤라이제이션 없이도 RCAN 수준의 높은 데이터 효율성과 성능를 보였다.
  • 온정책 정밀 조정을 병행할 경우, RL-CycleGAN은 실세계로의 제로샷 전이를 70% 성공률로 달성하였으며, 도메인 랜덤라이제이션만을 사용하는 것보다 성능이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.