Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Domain Adaptation with Dynamics-Aware Rewards in Reinforcement Learning

Jinxin Liu, Hao Shen|arXiv (Cornell University)|2021. 10. 25.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

이 논문은 동적 변화가 있는 타겟 환경으로부터의 효율적 스킬 전이를 가능하게 하는 도메인 적응 방법인 DARS를 제안한다. KL 정규화 보상 함수를 도입하여 소스 환경과 타겟 환경의 행동을 정렬함으로써, 최소한의 타겟 환경 내 롤아웃을 통해 적응형이고 전이 가능한 스킬을 발견할 수 있도록 한다. 이로 인해 전체 타겟 환경 학습 수준의 성능을 달성하면서도 실제 환경 상호작용 시간을 최대 75% 감소시킨다.

ABSTRACT

Unsupervised reinforcement learning aims to acquire skills without prior goal representations, where an agent automatically explores an open-ended environment to represent goals and learn the goal-conditioned policy. However, this procedure is often time-consuming, limiting the rollout in some potentially expensive target environments. The intuitive approach of training in another interaction-rich environment disrupts the reproducibility of trained skills in the target environment due to the dynamics shifts and thus inhibits direct transferring. Assuming free access to a source environment, we propose an unsupervised domain adaptation method to identify and acquire skills across dynamics. Particularly, we introduce a KL regularized objective to encourage emergence of skills, rewarding the agent for both discovering skills and aligning its behaviors respecting dynamics shifts. This suggests that both dynamics (source and target) shape the reward to facilitate the learning of adaptive skills. We also conduct empirical experiments to demonstrate that our method can effectively learn skills that can be smoothly deployed in target.

연구 동기 및 목표

  • 비용이 많이 드는 실제 타겟 환경에 정책을 구현할 때의 높은 샘플 비용 문제를 해결하기 위해.
  • 소스 환경에서 비지도 스킬 발견을 가능하게 하면서도, 동적 변화가 있는 타겟 환경로의 전이 가능성 보장하기 위해.
  • 사전에 보상 함수나 목표 레이블 없이도 타겟 환경에서 필요한 롤아웃 수를 최소화하기 위해.
  • 소스 및 타겟 환경의 동적 특성을 기반으로 스킬 발견을 유도하는 보상 메커니즘 개발하기 위해.
  • 복잡한 로봇 스킬에 대해 최소한의 실제 환경 상호작용으로도 안정적인 시뮬레이션에서 실제 환경으로의 전이를 가능하게 하기 위해.

제안 방법

  • 소스 및 타겟 환경 간의 궤적을 정렬하기 위해 목표 달성 보상 함수를 수정하는 KL 정규화 항을 도입한다.
  • 소스 환경에서 목표를 표현하고 목표 분포 및 보상 함수를 학습하기 위해 잠재변수 조건부 프로빙 정책을 사용한다.
  • 동적 특성을 고려한 보상 함수를 사용하여 소스 환경에서만 목표 조건부 정책을 훈련시킨다.
  • 두 개의 분류기들을 활용하여 소스 및 타겟 상태 분포 간의 KL 발산을 추정함으로써, 동적 불일치에 기반한 보상 형상 조정을 가능하게 한다.
  • 소스 환경에서 오프더쉐프 비지도 강화학습 방법(예: GPIM)을 활용하여 타겟 환경으로 일반화 가능한 정책을 학습시킨다.
  • 데이터 효율성 평가를 위해 피니튜닝 실험에서 타겟 롤아웃 버퍼를 재사용한다.

실험 결과

연구 질문

  • RQ1풍부한 롤아웃을 가진 소스 환경에서 훈련된 정책이 최소한의 타겟 롤아웃만으로도 동적 변화가 있는 타겟 환경으로 효과적으로 적응할 수 있는가?
  • RQ2소스 및 타겟 환경 간의 동적 변화를 명시적으로 모델링하여 스킬 발견을 안내할 수 있는가?
  • RQ3강화학습에서 비지도 도메인 적응이 사전 보상 함수 없이도 타겟 환경에서의 전체 학습 수준의 성능을 달성할 수 있는가?
  • RQ4제안된 KL 정규화 보상이 불안정하거나 시뮬레이션에서 실제 환경으로의 전이 설정에서 학습된 스킬의 안정성과 전이 가능성 향상에 기여하는가?
  • RQ5스킬 성능을 유지하면서도 실제 환경에서 필요한 롤아웃 수를 어느 정도 줄일 수 있는가?

주요 결과

  • DARS는 100만 단계 이내에 타겟 환경에서 전체 학습 수준의 성능(GPIM in target)을 달성했으며, 이는 타겟 환경에서의 롤아웃 수를 크게 줄였다.
  • 동일한 타겟 롤아웃 수를 사용할 때 DARS는 10배 더 많은 업데이트와 피니튜닝 베이스라인보다 성능이 뛰어나 데이터 효율성을 입증했다.
  • 균형 유지 작업의 경우 DARS는 피니튜닝 기반 접근 방식의 4시간에서 1시간으로 실제 환경 학습 시간을 단축했으며, 전진/후진 운동 학습도 3시간 내로 성공시켰다. 반면 베이스라인은 6시간 내로 실패했다.
  • 불안정한 환경에서 DARS는 안정적이고 반복 가능한 스킬을 성공적으로 학습했으며, SMiRL 및 그 피니튜닝 변형은 동적 불일치로 인해 적응에 실패했다.
  • 타겟 버퍼 재사용이 성능 향상에 기여하지 않았다는 점은, KL 정규화가 적응을 위한 충분한 인덕티브 바이어스를 제공한다는 것을 시사한다.
  • 최소한의 실제 환경 상호작용으로도 DARS는 시뮬레이션에서 실제 환경으로의 전이에서 거의 최적의 성능를 달성하여, 실제 환경 적용의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.