[논문 리뷰] VR-Goggles for Robots: Real-to-sim Domain Adaptation for Visual Control
이 논문은 실세계 카메라 스트림을 배포 중이 실세계 환경으로 일반화할 수 있도록 사전에 훈련된 딥 강화 학습 정책을 재학습하지 않고도 작동하도록 하는 실세계에서 시뮬레이션으로의 도메인 적응 방법인 VR-Goggles를 제안한다. 이 방법은 번역된 이미지 시퀀스의 시간적 일관성을 보장하기 위해 이동 손실을 도입함으로써 실내 주행 및 실외 자율 주행 작업 모두에서 높은 성공률를 달성하며, 기존의 시뮬레이션에서 실세계로의 접근 방식을 능가한다.
In this paper, we deal with the reality gap from a novel perspective, targeting transferring Deep Reinforcement Learning (DRL) policies learned in simulated environments to the real-world domain for visual control tasks. Instead of adopting the common solutions to the problem by increasing the visual fidelity of synthetic images output from simulators during the training phase, we seek to tackle the problem by translating the real-world image streams back to the synthetic domain during the deployment phase, to make the robot feel at home. We propose this as a lightweight, flexible, and efficient solution for visual control, as 1) no extra transfer steps are required during the expensive training of DRL agents in simulation; 2) the trained DRL agents will not be constrained to being deployable in only one specific real-world environment; 3) the policy training and the transfer operations are decoupled, and can be conducted in parallel. Besides this, we propose a simple yet effective shift loss that is agnostic to the downstream task, to constrain the consistency between subsequent frames which is important for consistent policy outputs. We validate the shift loss for artistic style transfer for videos and domain adaptation, and validate our visual control approach in indoor and outdoor robotics experiments.
연구 동기 및 목표
- 훈련 중이 아닌 배포 중에 실세계 센서 입력을 시뮬레이션 도메인으로 변환하여 시각적 제어의 현실성 격차를 해소한다.
- 정책 훈련과 도메인 적응을 분리함으로써 다양한 실세계 환경에서 병렬적이고 효율적인 배포를 가능하게 한다.
- 하나의 새로운 이동 손실을 도입하여 제어 작업에 대해 종속되지 않는 번역된 이미지 시퀀스의 일관성을 향상시킨다.
- 실내 및 실외 로봇 시나리오에서 방법을 검증하여 정책을 재학습하지 않고도 견고한 일반화 성능을 입증한다.
- 딥 강화 학습 정책을 시뮬레이션에서 실세계 배포로 이전하기 위한 경량적이고 유연하며 효율적인 솔루션을 제공한다.
제안 방법
- 이 방법은 실세계 RGB 이미지를 딥 강화 학습 정책 훈련 시 사용된 시뮬레이션 도메인으로 매핑하는 실세계에서 시뮬레이션으로의 이미지 번역 네트워크를 사용한다.
- 연속된 번역된 프레임 간의 일관성을 강제하기 위해 새로운 이동 손실을 도입하여 시간적 일관성을 향상시키며, 광학 흐름이나 순차적 지도 데이터가 필요로 하지 않는다.
- 이동 손실은 엔드 투 엔드로 훈련되며, 후속 제어 작업에 종속되지 않아 다양한 환경에 광범위하게 적용 가능하다.
- 도메인 적응은 오직 추론 시간에만 수행되며, 시뮬레이션 내에서 비용이 많이 드는 딥 강화 학습 훈련 과정과 분리된다.
- 이 방법은 사이클GAN 스타일 아키텍처를 사용하며 사이클 일관성과 이동 손실을 함께 훈련하며, 각 환경당 2000장의 실세계 이미지로 새로운 실세계 장면에 적응한다.
- 이 방법은 실내 주행(오피스에서 터틀봇3 사용) 및 실외 자율 주행(야간 도시에서 블러도그 사용)에 적용되며, 시뮬레이션에는 Carla를, 실세계 테스트에는 실재 데이터셋을 사용한다.
실험 결과
연구 질문
- RQ1배포 중 실세계에서 시뮬레이션으로의 이미지 번역이 사전에 시뮬레이션에서 훈련된 DRL 정책이 실세계 시각적 제어 작업에 효과적으로 일반화할 수 있는가?
- RQ2제안된 이동 손실은 표준 사이클 일관성 GAN과 비교해 번역된 이미지 시퀀스의 일관성을 어떻게 향상시키는가?
- RQ3제어 정책의 재학습이나 미세조정 없이도 다양한 시각적으로 다样的인 실세계 환경에 배포 가능한가?
- RQ4정책 훈련과 도메인 적응의 분리가 실세계 배포에서 상당한 효율성 향상을 이끌어내는가?
- RQ5어려운 시각적 도메인에서 기존의 시뮬레이션에서 실세계로의 접근 방식과 비교해 성공률 및 내구성 측면에서 어떻게 성능을 냈는가?
주요 결과
- 실내 사무실 주행에서 VR-Goggles는 100%의 성공률를 기록했으며, CycleGAN(60%)과 No-Goggles(0%)를 크게 앞서며 우수한 도메인 적응 품질을 입증했다.
- 정책은 NVIDIA TX2에서 13 Hz로 실시간으로 실행되었으며, 이는 방법의 낮은 계산 오버헤드를 확인한다.
- 실외 자율 주행에서 VR-Goggles는 야간 도로를 성공적으로 주행시켰고, No-Goggles는 실세계 야간 조건와 시뮬레이션의 주간 조건 사이의 큰 도메인 이격으로 완전히 실패했다.
- 이동 손실은 번역된 이미지 시퀀스의 시간적 일관성을 효과적으로 향상시켜 번 flicker를 줄이고 정책의 안정성을 향상시켰으며, 광학 흐름이나 순차적 데이터가 필요로 하지 않았다.
- 단지 각 도메인당 2000장의 실세계 이미지로만 정책 재학습 없이도 새로운 환경에 배포 가능하여 방법의 유연성과 확장성을 입증했다.
- 비디오 데모는 VR-Goggles가 새로운 환경(예: 새로운 가구 유형)에 빠르게 적응할 수 있으며, 사전에 훈련된 정책을 수정하지 않아도 된다는 것을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.