[논문 리뷰] How to Close Sim-Real Gap? Transfer with Segmentation!
이 논문은 Povray 렲영과 실제 배경 조합을 통해 현실적인 다양성 있는 훈련 이미지를 생성하고, DAGGER를 사용해 실패 복구 능력을 향상시켜 로봇 조작에서 시뮬레이션에서 실제 환경으로의 일반화 격차를 줄이는 모듈러하고 분할 지도 학습 기반 접근법을 제안한다. 이 방법은 88%의 실제 작업 성공률를 달성하며, 합성 애너테이션을 활용해 더 효과적인 정책 학습을 가능하게 하는 명시적 분할 지도 학습 덕분에 비지도 학습 변종보다 뛰어난 성능을 보인다.
One fundamental difficulty in robotic learning is the sim-real gap problem. In this work, we propose to use segmentation as the interface between perception and control, as a domain-invariant state representation. We identify two sources of sim-real gap, one is dynamics sim-real gap, the other is visual sim-real gap. To close dynamics sim-real gap, we propose to use closed-loop control. For complex task with segmentation mask input, we further propose to learn a closed-loop model-free control policy with deep neural network using imitation learning. To close visual sim-real gap, we propose to learn a perception model in real environment using simulated target plus real background image, without using any real world supervision. We demonstrate this methodology in eye-in-hand grasping task. We train a closed-loop control policy model that taking the segmentation as input using simulation. We show that this control policy is able to transfer from simulation to real environment. The closed-loop control policy is not only robust with respect to discrepancies between the dynamic model of the simulated and real robot, but also is able to generalize to unseen scenarios where the target is moving and even learns to recover from failures. We train the perception segmentation model using training data generated by composing real background images with simulated images of the target. Combining the control policy learned from simulation with the perception model, we achieve an impressive $\bf{88\%}$ success rate in grasping a tiny sphere with a real robot.
연구 동기 및 목표
- 시뮬레이션에서의 시각적 현실감과 애너테이션 정확도를 향상시켜 로봇 이민 학습에서 시뮬레이션-실제 환경 간 도메인 갭을 해소하기.
- DAGGER를 통한 반복적 전문가 피드백을 통해 에이전트가 실패 복구 능력을 학습하도록 정책의 강건성을 향상시키기.
- 모듈러 네트워크 아키텍처에서 명시적 분할 지도 학습이 비지도 특징 학습보다 실제 환경으로의 일반화 성능을 향상시키는지 입증하기.
- 실제 이미지 조합과 적응형 훈련 스케줄링을 통합해 효율적인 엔드 투 엔드 훈련을 가능하게 하기.
제안 방법
- 정확한 조명과 그림자 모델링을 포함해 Povray에서 장면를 렌더링하여 현실적인 훈련 이미지를 생성하고, 그립퍼 플레이트 근사치를 사용해 현실적인 구체 그림자 효과를 시뮬레이션한다.
- 알파 블렌딩을 통해 Povray로 렌더링한 이미지를 실제 로봇 작업 공간 배경 이미지와 조합하여 시각적 다양성과 현실감을 향상시킨다.
- 훈련 중에 HSV 공간에서의 무작위화를 적용해 실제 환경의 조명 및 색상 변동성을 고려한다.
- Gazebo와 Povray에서 생성한 합성 마스크를 사용해 픽셀 단위 분할 지도 학습을 통해 정확한 물체 위치 추정을 가능하게 하는 시각 모듈을 훈련시킨다.
- 시각 모듈(분할 수행)과 제어 모듈(행동 예측)으로 구성된 이중 모듈 시스템을 구현하고, 실패 복구 능력을 향상시키기 위해 DAGGER를 통해 공동으로 훈련시킨다.
- 렌더링 중 물리 시뮬레이션 일시 정지, DAGGER 반복 단계별 훈련 에포크 수 조정, 총 훈련 시간을 134일에서 7일로 감소시켜 엔드 투 엔드 훈련을 최적화한다.
실험 결과
연구 질문
- RQ1실제 환경에 가까운 이미지 합성과 분할 지도 학습이 로봇 조작에서 시뮬레이션-실제 환경 전이 성능을 향상시키는가?
- RQ2명시적 분할 지도 학습이 비지도 특징 학습보다 시각 모듈에서 더 나은 일반화 성능을 보이는가?
- RQ3DAGGER 기반 최적화가 전문가 시연에서 볼 수 없었던 실패 상황에 대한 정책의 복구 능력을 효과적으로 학습시키는가?
- RQ4실제 이미지 조합과 엔드 투 엔드 훈련이 별도의 모듈 훈련 대비 실제 환경 성능에서 어떻게 다른가?
- RQ5특징 맵 크기 및 지도 학습 유형과 같은 아키텍처 선택 사항이 실제 환경에서의 구체 잡기 성공률에 어떤 영향을 미치는가?
주요 결과
- 제안된 방법은 혼잡도가 없는 환경에서 실제 실험에서 88%의 성공률를 기록했으며, 비지도 학습 변종보다 뚜렷하게 뛰어난 성능을 보였다.
- 혼잡도가 존재하는 상황에서도 엔드 투 엔드 훈련된 네트워크는 5번의 시도 중 4번에서 구체를 성공적으로 잡아내어 실제 환경의 간섭 요소에 대한 강건성을 입증했다.
- 분할 지도 학습을 적용한 네트워크는 비지도 학습 변종보다 유의미하게 낮은 훈련 손실을 기록해 더 나은 최적화와 수렴 성능를 보였다.
- 비지도 특징 맵 변종은 구체에 가까이 다가가더라도 구체를 잡지 못하는 데 실패했으며, 이는 구조화된 지도 학습의 중요성을 강조한다.
- 적응형 스케줄링과 렌더링 최적화를 통해 단일 Titan X GPU에서 엔드 투 엔드 훈련 시간을 예상 134일에서 7일로 단축시켰다.
- 픽셀 단위 지도 학습 덕분에 시각 모듈은 단 9시간 만에 훈련을 완료했으며, 각 이미지가 약 10,000개의 상관 샘플로 효과적으로 기여했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.