Skip to main content
QUICK REVIEW

[논문 리뷰] Domain Adversarial Reinforcement Learning

Bonnie Li, Vincent François-Lavet|arXiv (Cornell University)|2021. 02. 14.
Domain Adaptation and Few-Shot Learning참고 문헌 26인용 수 6
한 줄 요약

이 논문은 도메인 적대적 강화학습(DARL)을 제안하며, 도메인 구분자와 함께 적대적 훈련을 통해 도메인 불변 표현을 학습함으로써 딥 강화학습에서 제로샷 일반화를 향상시키는 방법을 제시한다. 이 방법은 시각적 도메인의 변화가 있는 환경에서 성능 저하를 크게 줄이며, 예를 들어 SAC 대비 가장 멀리 떨어진 테스트 환경에서 성능 저하가 23.5%로 감소하여, 도메인 간 특징 분포를 일치시키면서도 작업에 관련된 정보를 유지한다.

ABSTRACT

We consider the problem of generalization in reinforcement learning where visual aspects of the observations might differ, e.g. when there are different backgrounds or change in contrast, brightness, etc. We assume that our agent has access to only a few of the MDPs from the MDP distribution during training. The performance of the agent is then reported on new unknown test domains drawn from the distribution (e.g. unseen backgrounds). For this "zero-shot RL" task, we enforce invariance of the learned representations to visual domains via a domain adversarial optimization process. We empirically show that this approach allows achieving a significant generalization improvement to new unseen domains.

연구 동기 및 목표

  • 환경 간 배경, 대비, 밝기 등의 변화가 있는 시각적 관측에서 딥 강화학습의 제로샷 일반화를 향상시키기 위해.
  • 훈련 중 특정 시각적 도메인에 과적합하는 전통적인 RL 에이전트의 취약성을 해결하기 위해.
  • 도메인 이동에 대해 불변인 표현을 학습하면서도 작업에 관련된 역학적 정보를 유지하여 효과적인 정책 학습을 가능하게 하기 위해.
  • 훈련 중 테스트 도메인 데이터에 접근하지 않고도 새로운, 알려지지 않은 시각적 도메인으로의 강건한 전이를 가능하게 하기 위해.

제안 방법

  • 표현 인코더와 도메인 구분자를 적대적으로 훈련하여, 인코더가 도메인 불변 특징을 생성함으로써 구분자를 속이도록 한다.
  • 다양한 시각적 배경을 가진 소수의 훈련 도메인에서 표준 RL 알고리즘(SAC 등)을 사용해 에이전트를 훈련시킨다.
  • 특징의 소스 도메인을 구분자에게 식별할 수 없도록 하는 도메인 적대적 손실을 최적화하여 인코더를 학습시킨다.
  • 도메인 구분자를 훈련 루프에 통합하여, 정책과 표현 인코더를 기울기 업데이트를 통해 함께 최적화한다.
  • 훈련 도메인과 테스트 도메인 간의 시각적 공간 및 특징 공간의 이질성을 측정하기 위해 t-SNE와 L2 거리를 사용한다.
  • 정적 및 비정적 테스트 도메인(자연 영상 배경, 동적 간섭자 포함)에서 일반화 성능을 평가한다.

실험 결과

연구 질문

  • RQ1표현 공간에서의 적대적 도메인 일치가 시각적 도메인 이동이 있는 딥 RL에서 제로샷 일반화를 향상시키는가?
  • RQ2새로운 시각적 도메인에서 도메인 적대적 에이전트의 성능은 표준 RL 에이전트와 비교해 어떻게 되는가?
  • RQ3새로운 시각적 도메인에서 테스트할 때 DARL에서 학습된 표현이 특징 공간에서 훈련 분포에 얼마나 가까이 유지되는가?
  • RQ4표현에서의 도메인 불변성이 다양한 시각적 배경에서 더 안정적이고 강건한 정책 성능을 이끌어내는가?

주요 결과

  • DARL는 잠재 공간에서 가장 이격된 테스트 환경(가장 먼 곳)에서 성능 저하가 23.5%에 그쳤고, SAC는 74.1%의 저하를 보여 더 뛰어난 강건성을 입증했다.
  • L2 거리로 측정한 평균 특징 간 거리로 볼 때, DARL의 특징 분포는 모든 테스트 환경에서 훈련 분포에 가까웠지만, SAC의 특징은 크게 산산이 갈라졌다.
  • DARL의 성능은 잠재 공간에서의 L2 거리와 강하게 상관관계가 있었으며, 훈련 분포에 가까운 거리일수록 더 좋은 일반화 성능을 보였다.
  • 자연 영상 배경이 있는 비정적 환경에서는 DARL가 SAC보다 더 안정적이고 일관된 성능을 보였고, SAC는 환경 간 성능 변화가 컸다.
  • t-SNE 시각화 결과 DARL 표현은 더 컴팩트하고 도메인 불변성이 높았으며, SAC 표현은 시각적 도메인 이동에 민감하게 반응했다.
  • 도메인 구분자가 특징의 소스 도메인을 식별하는 능력을 떨어뜨려, 표현 공간에서 효과적인 도메인 불변성이 달성되었음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.