[논문 리뷰] SimGAN: Hybrid Simulator Identification for Domain Adaptation via Adversarial Reinforcement Learning
SimGAN은 적대적 강화학습 프레임워크를 제안하여 실제 세계의 궤적 분포와 일치하는 하이브리드 물리 시뮬레이터를 식별한다. 학습된 GAN 기반 손실을 사용해 수동 손실 설계를 제거하고 시뮬레이션에서 실제 환경으로의 정책 전이를 향상시킨다. 50개의 타겟 궤적만으로도 실제 세계 데이터를 최소한으로 사용하여 여섯 가지 로봇 운동 과제에서 강력한 베이스라인을 능가하는 높은 정책 성능을 달성한다.
As learning-based approaches progress towards automating robot controllers design, transferring learned policies to new domains with different dynamics (e.g. sim-to-real transfer) still demands manual effort. This paper introduces SimGAN, a framework to tackle domain adaptation by identifying a hybrid physics simulator to match the simulated trajectories to the ones from the target domain, using a learned discriminative loss to address the limitations associated with manual loss design. Our hybrid simulator combines neural networks and traditional physics simulation to balance expressiveness and generalizability, and alleviates the need for a carefully selected parameter set in System ID. Once the hybrid simulator is identified via adversarial reinforcement learning, it can be used to refine policies for the target domain, without the need to interleave data collection and policy refinement. We show that our approach outperforms multiple strong baselines on six robotic locomotion tasks for domain adaptation.
연구 동기 및 목표
- 시뮬레이션과 실제 세계의 역학 간 도메인 차이가 정책 성능을 저해하는 시뮬레이션에서 실제 환경으로의 정책 전이 문제를 해결하기 위해.
- 모의 궤적과 실제 궤적 간 유사도 손실을 수동으로 설계할 필요를 제거하기 위해, 이는 종종 히وري스틱이고 현실적이지 않은 경향이 있다.
- 다양한 미분 가능한 신경망과 고전적 물리 모델을 조합한 하이브리드 시뮬레이터를 식별함으로써 시뮬레이션의 정밀도를 향상시키고, 일반화 능력을 훼손하지 않으면서도 표현력을 높이기 위해.
- 제한된 실제 세계 데이터로부터 한 번의 시뮬레이터 학습을 통해 효율적인 도메인 적응을 가능하게 하여 반복적인 데이터 수집 및 정책 개선 루프를 피하기 위해.
- 보상 함수가 변경되더라도 여러 운동 기술과 환경에 걸쳐 학습된 시뮬레이터의 일반화 능력을 입증하기 위해.
제안 방법
- GAN 판별자로 실제 궤적과 모의 궤적을 구분하는 방식으로, 시뮬레이션 식별 문제를 적대적 강화학습 문제로 공식화한다.
- GAN에서 유도된 학습된 판별 손실을 사용해 궤적 분포에 대한 약한 지도를 제공함으로써, 쌍화된 궤적이나 히وري스틱 거리 측정 기준이 필요 없도록 한다.
- 모델링되지 않은 역학을 설명하기 위해 고정된 시뮬레이션 파라미터를 상태-행동 의존적인 미분 가능한 신경망 함수로 대체하는 하이브리드 시뮬레이터를 구축한다.
- 정책 기반 강화학습 방법을 사용해 시뮬레이터 파라미터를 최적화하며, 파라미터 함수를 궤적의 현실성 최대화를 목표로 하는 RL 에이전트로 간주한다.
- 실제 세계의 행동 정책 궤적을 사용해 한 번의 시뮬레이터 학습을 수행한 후, 추가적인 데이터 수집 없이도 새로운 과제에 대한 정책 개선에 재사용한다.
- 특히 도전적인 환경에서 시뮬레이션 정밀도를 향상시키기 위해, 시뮬레이터 학습 중에 적응형 생존 보너스를 적용한다.
실험 결과
연구 질문
- RQ1학습된 GAN 기반 손실이 도메인 적응에서 모의 궤적과 실제 궤적 간 일치를 위해 수동으로 설계된 유사도 메트릭을 효과적으로 대체할 수 있는가?
- RQ2미분 가능하고 상태-행동 의존적인 파rameter를 가진 하이브리드 시뮬레이터가 고정된 파라미터를 가진 물리 모델을 초월해 시뮬레이션 정밀도를 향상시킬 수 있는가?
- RQ3시뮬레이터의 적대적 RL 학습이 최소한의 실제 세계 데이터 수집으로도 강력한 정책 전이를 가능하게 하는가?
- RQ4한 번 학습된 시뮬레이터가 타겟 도메인에서 서로 다른 여러 운동 기술의 정책 개선을 지원할 수 있는가?
- RQ5시뮬레이터 식별을 위한 실제 궤적의 품질과 양에 따라 이 방법의 민감도는 어떠한가?
주요 결과
- SimGAN은 Hopper/Heavy 및 Laikago/Deform를 포함한 여섯 가지 로봇 운동 과제에서 강력한 베이스라인을 능가하며, 뛰어난 도메인 적응 성능을 입증한다.
- 실제 세계 궤적 50개만으로도 Hopper/Heavy 환경에서 평균 과제 보상 1686점, Laikago/Deform 환경에서 2561점을 기록하여 낮은 데이터 예산에서도 성능 저하가 최소한임을 보였다.
- 적응형 생존 보너스를 사용함으로써 Hopper/Heavy 환경에서 정책 성능이 크게 향상되었으며, 시뮬레이터 학습 중에 적용했을 때 평균 보상이 1186에서 1658로 증가했다.
- 동일한 학습된 하이브리드 시뮬레이터가 Laikago 로봇에서 옆으로 걷는 정책 학습을 성공적으로 가능하게 하여, 서로 다른 운동 기술 간 강력한 일반화 능력을 보였다.
- 알고리즘의 추가 반복 실행이 성능 향상에 기여하지 않아, 분석적 물리 사전 지식을 가진 현재의 하이브리드 시뮬레이터가 이미 분포 이탈에 대해 강건함을 시사한다.
- 물리적 제약 없이 접촉력만 직접 학습하는 것은 에너지를 주입하는 가짜 힘으로 인해 열악한 성능을 보였으며, 이는 학습된 구성 요소에서 물리적 일관성의 중요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.