Skip to main content
QUICK REVIEW

[논문 리뷰] RetinaGAN: An Object-aware Approach to Sim-to-Real Transfer

Daniel E. Ho, Kanishka Rao|arXiv (Cornell University)|2020. 11. 06.
Robot Manipulation and Learning참고 문헌 35인용 수 7
한 줄 요약

RetinaGAN은 시뮬레이션 이미지를 실제 환경의 시각적 요소로 적응시키면서도 물체 검출 일관성을 유지하는 GAN 기반의 시뮬레이션에서 실제 환경으로의 전이 방법이다. 이는 로봇 공학에서 효과적인 정책 전이를 가능하게 하며, 이전 방법보다 12% 높은 抓취 성공률을 기록하고, 실제 데이터가 5–10% 밖에 없을 때에도 뛰어난 성능 유지를 보이며, 밀고 다니기 및 문 열기와 같은 다양한 작업에 대해 강건한 일반화 능력을 입증한다.

ABSTRACT

The success of deep reinforcement learning (RL) and imitation learning (IL) in vision-based robotic manipulation typically hinges on the expense of large scale data collection. With simulation, data to train a policy can be collected efficiently at scale, but the visual gap between sim and real makes deployment in the real world difficult. We introduce RetinaGAN, a generative adversarial network (GAN) approach to adapt simulated images to realistic ones with object-detection consistency. RetinaGAN is trained in an unsupervised manner without task loss dependencies, and preserves general object structure and texture in adapted images. We evaluate our method on three real world tasks: grasping, pushing, and door opening. RetinaGAN improves upon the performance of prior sim-to-real methods for RL-based object instance grasping and continues to be effective even in the limited data regime. When applied to a pushing task in a similar visual domain, RetinaGAN demonstrates transfer with no additional real data requirements. We also show our method bridges the visual gap for a novel door opening task using imitation learning in a new visual domain. Visit the project website at https://retinagan.github.io/

연구 동기 및 목표

  • 시뮬레이션에서 실제 환경으로의 강화학습 및 이민학습에서 발생하는 시각적 현실 갭을 해소하기 위해, 이미지 도메인 적응 과정에서 임무에 핵심적인 물체 의미를 유지한다.
  • 로봇 조작에 필수적인 시각적 특징을 왜곡하거나 제거할 수 있는 표준 GAN의 한계를 극복한다.
  • 실제 환경에서의 광범위한 데이터 수집 없이도 시뮬레이션에서 실제 환경으로의 정책 전이를 효과적으로 가능하게 한다.
  • 물체 수준의 구조와 질감을 유지하기 위해 검출 일관성 손실을 통해 적응 과정을 보장함으로써, 다양한 시각적 도메인 간에 강건한 성능을 확보한다.
  • 단일 RetinaGAN 모델이 최소한의 재학습 또는 실제 데이터 없이도 여러 작업과 시각적 도메인 간에 전이 가능하도록 한다.

제안 방법

  • 시뮬레이션 이미지를 실제적인 시각적 요소로 변환하면서도 물체 검출 일관성을 유지하는 CycleGAN을 학습한다.
  • 원본 시뮬레이션 이미지와 GAN에 의해 변환된 이미지 간에 동일한 물체 검출 예측을 유지하기 위해, 인variant한 물체 검출 예측을 강제하는 인지 일관성 손실($\mathcal{L}_{\text{prcp}}$)을 도입한다.
  • 실제 및 시뮬레이션 데이터에 대해 사전 훈련된 물체 검출기(EfficientDet)를 사용하여 지도 학습을 위한 검출 출력을 생성한다.
  • 작업 특화 손실에 의존하지 않고, 짝이 지어지지 않은 실제 및 시뮬레이션 이미지만을 사용하여 GAN을 비지도 학습 방식으로 훈련한다.
  • GAN 훈련의 안정성을 확보하기 위해 스펙트럼 정규화와 Adam 최적화를 적용하며, 하이퍼파rameter는 좁은 범위 내에서만 조정한다.
  • 모든 작업과 도메인에서 동일한 사전 훈련된 검출기를 재사용하여, 재학습 없이도 일관된 의미적 지도를 보장한다.

실험 결과

연구 질문

  • RQ1물체 인식 기반 도메인 적응은 시각 기반 로봇 조작 작업에서 시뮬레이션에서 실제 환경으로의 전이 성능을 향상시킬 수 있는가?
  • RQ2표준 GAN과 비교해 RetinaGAN은 이미지 번역 과정에서 물체 수준의 구조와 질감을 얼마나 잘 유지하는가?
  • RQ3실제 데이터가 5–10% 밖에 없는 저데이터 환경에서 RetinaGAN의 효과성은 어떠한가?
  • RQ4그러한 작업(예: 抓취)에서 훈련된 RetinaGAN 모델이 추가적인 실제 데이터 없이 다른 작업(예: 밀고 다니기)에 성공적으로 재사용될 수 있는가?
  • RQ5최소한의 데이터로도 RetinaGAN이 실내 회의실의 문 열기와 같은 새로운 시각적 도메인에 일반화될 수 있는가?

주요 결과

  • 전체 실제 데이터를 사용할 경우, RetinaGAN은 이전의 시뮬레이션에서 실제 환경으로의 전이 방법보다 실제 환경에서의 抓취 성공률을 12% 향상시켰다.
  • 실제 데이터가 5–10% 밖에 없을 경우, RetinaGAN는 성능 저하가 14%에 그쳐, 저데이터 환경에서도 강력한 일반화 능력을 입증했다.
  • 그러한 抓취 데이터에서 훈련된 RetinaGAN 모델은 추가적인 실제 데이터나 최적화 없이도 3D 물체 밀고 다니기 작업에서 90%의 성공률을 기록했다.
  • 다른 시각적 도메인에서의 새로운 문 열기 작업에 대해, Ensemble-RetinaGAN 변종을 사용한 이민학습을 통해 RetinaGAN은 97%의 성공률을 달성했다.
  • 번역 과정 전후로 일관된 물체 검출 예측이 유지됨을 확인하여, 의미적 구조와 질감이 효과적으로 보존됨을 입증했다.
  • 동일한 사전 훈련된 물체 검출기가 모든 작업과 도메인에서 효과적으로 작동함을 통해, 이 방법의 일반화 능력과 전이 가능성의 타당성을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.