Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Cross-Domain Correspondence for Control with Dynamics Cycle-Consistency

Qiang Zhang, Tete Xiao|arXiv (Cornell University)|2020. 12. 17.
Reinforcement Learning in Robotics참고 문헌 41인용 수 22
한 줄 요약

이 논문은 시각과 상태 공간에서 서로 다른 모odalities, 물리적 파rameters, 형태를 가진 도메인 간의 비페어드, 비정렬 데이터 간의 교차 도메인 대응관계를 학습하기 위해 다이내믹스 사이클 일관성 프레임워크를 제안한다. 이는 피드백 없는 미세조정 없이도 서로 다른 모달리티, 물리적 파라미터, 형태를 가진 도메인 간에 제로샷 정책 전이를 가능하게 한다. 도메인 간 시간적 다이내믹스의 일관성을 강제함으로써, 이 방법은 정확한 상태 추정과 정책 전이를 달성하며, Cycle-GAN과 같은 기존 방법들을 능가한다. 이는 실제 로봇과 시뮬레이션 작업에서 검증되었다.

ABSTRACT

At the heart of many robotics problems is the challenge of learning correspondences across domains. For instance, imitation learning requires obtaining correspondence between humans and robots; sim-to-real requires correspondence between physics simulators and the real world; transfer learning requires correspondences between different robotics environments. This paper aims to learn correspondence across domains differing in representation (vision vs. internal state), physics parameters (mass and friction), and morphology (number of limbs). Importantly, correspondences are learned using unpaired and randomly collected data from the two domains. We propose \ extit{dynamics cycles} that align dynamic robot behavior across two domains using a cycle-consistency constraint. Once this correspondence is found, we can directly transfer the policy trained on one domain to the other, without needing any additional fine-tuning on the second domain. We perform experiments across a variety of problem domains, both in simulation and on real robot. Our framework is able to align uncalibrated monocular video of a real robot arm to dynamic state-action trajectories of a simulated arm without paired data. Video demonstrations of our results are available at: https://sjtuzq.github.io/cycle_dynamics.html .

연구 동기 및 목표

  • 다른 모달리티(예: 시각 대비 상태), 물리적 파라미터(질량, 마찰계수), 형태(예: 사지 수)를 가진 도메인 간의 대응관계 학습에 도전하는 것.
  • 페어드 데이터나 타겟 도메인에서의 미세조정 없이도 도메인 간 제로샷 정책 전이를 가능하게 하는 것.
  • 이전 방법들이 페어드 트래잭터리나 불변 기반 표현에 의존하는 한계를 극복하기 위해 도메인 간 다이내믹스 일관성을 통합하는 것.
  • 양 도메인에서 수집한 비페어드, 무작위로 수집된 데이터를 사용하여 관측값과 행동의 공동 대응관계를 학습하는 것.

제안 방법

  • 이 방법은 실제 로봇 영상과 시뮬레이션 상태 트래잭터리 간의 관측값과 행동값을 연결하는 4사이클 다이내믹스 체인을 사용한다.
  • 실제 영상을 시뮬레이션 상태로 매핑하는 도메인 번역기 $ G: \mathbf{x}_t \mapsto \mathbf{y}_t $ 와 시뮬레이션 도메인 내에서의 전진 다이내믹스 모델 $ F: \mathbf{y}_t \times \mathbf{u}_t \mapsto \mathbf{y}_{t+1} $ 를 도입한다.
  • 핵심 제약 조건은 다이내믹스 사이클 일관성이다: 도메인 간 일관된 행동이 주어지면, 시뮬레이션 도메인에서 예측한 다음 상태는 실제 로봇의 다음 관측값에 대한 영상-상태 번역과 일치해야 한다.
  • 이 프레임워크는 양 도메인에서의 비페어드 3튜플(관측값, 행동, 다음 관측값)을 사용하여 번역기와 다이내믹스 모델을 동시에 최적화한다.
  • 형태가 다른 에이전트 간 정책 전이 시 훈련 안정성을 향상시키기 위해 새로운 행동 반복 초기화 전략을 도입한다.
  • 실제 로봇의 내부 상태에 접근할 필요 없이, 校정되지 않은 RGB 비디오 입력만으로도 작동한다.

실험 결과

연구 질문

  • RQ1비페어드, 校정되지 않은 데이터(실제 로봇과 시뮬레이션에서 수집) 간에 다이내믹스 사이클 일관성이 정확한 교차 도메인 대응관계 학습을 가능하게 할 수 있는가?
  • RQ2모달리티와 물리적 특성이 다를 경우, 특히 페어드 데이터 없이도 시뮬레이션에서 학습된 정책을 실제 로봇으로 전이할 수 있는가?
  • RQ3대응관계 학습에 다이내믹스를 통합할 경우, 순수 시각 번역 방법(Cycle-GAN)에 비해 복잡한 실제 제어 작업에서 성능이 뛰어나지는가?
  • RQ4다양한 형태(예: 사지 수가 다른 로봇) 간에 이 프레임워크가 얼마나 일반화되는가?
  • RQ5실제 로봇의 내부 상태에 접근하지 않고도 원시 RGB 비디오에서 공동 상태 추정을 학습할 수 있는가?

주요 결과

  • 실제 로봇 실험에서, 이 방법은 무작위 운동 시 끝단 기구 위치 추정의 L1 오차가 0.025로 나타났고, 부드러운 운동 시에는 0.033를 기록하여, Cycle-GAN이 각각 0.18과 0.21을 기록한 것에 비해 유의미하게 뛰어난 성능을 보였다.
  • 7개의 관절 관측값을 포함하는 고차원 관측값을 사용할 경우에도, 무작위 운동에서 L1 오차가 0.031로 유지되어 복잡성 증가에 대한 강건성을 입증했다.
  • 실제 xArm 로봇에 대해 시뮬레이션에서 학습된 정책을 미세조정 없이 성공적으로 전이하였고, Cycle-GAN 기반 또는 행동 반복 초기화 전략에 의존하는 기존 방법들은 전부 실패했다.
  • 시각화 결과는 예측된 시뮬레이션 상태가 실제 로봇의 운동과 밀접하게 일치함을 확인하여 학습된 대응관계의 타당성을 검증했다.
  • 다이내믹스 사이클 일관성 목적함수는 필수적이었으며, 다이내믹스를 忽시한 방법(예: Cycle-GAN)은 비록 비페어드 데이터를 사용했지만 의미 있는 대응관계 학습에 실패했다.
  • 이 프레임워크는 다양한 도메인에 일반화되었으며, 모달리티 이질성(시각 대비 상태), 물리적 특성 차이(마찰계수, 질량), 형태적 다양성(사지 수) 모두를 다루었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.