Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Visual Domain Randomization for Reinforcement Learning

Reda Bahi Slaoui, William R. Clements|arXiv (Cornell University)|2019. 10. 23.
Domain Adaptation and Few-Shot Learning참고 문헌 36인용 수 7
한 줄 요약

이 논문은 한 개의 환경 변형에서 에이전트를 훈련시키면서도, 다양한 시각적 도메인 랜덤라이제이션 간에 학습된 상태 표현의 불변성을 강제하는 정규화 방법을 제안한다. 동일한 상태에 대한 서로 다른 시각적 랜덤라이제이션 하에서의 특징 간 L2 거리 최소화를 통해, 표준 도메인 랜덤라이제이션에 비해 더 뛰어난 강건성과 샘플 효율성을 달성하며, 훈련에 사용되지 않은 시각적 도메인에서도 동일하거나 더 나은 일반화 성능을 유지한다.

ABSTRACT

Producing agents that can generalize to a wide range of visually different environments is a significant challenge in reinforcement learning. One method for overcoming this issue is visual domain randomization, whereby at the start of each training episode some visual aspects of the environment are randomized so that the agent is exposed to many possible variations. However, domain randomization is highly inefficient and may lead to policies with high variance across domains. Instead, we propose a regularization method whereby the agent is only trained on one variation of the environment, and its learned state representations are regularized during training to be invariant across domains. We conduct experiments that demonstrate that our technique leads to more efficient and robust learning than standard domain randomization, while achieving equal generalization scores.

연구 동기 및 목표

  • 강화학습에서 표준 시각적 도메인 랜덤라이제이션의 비효율성과 높은 변동성을 해결하기 위해.
  • 실제 세계 데이터 없이도 예측할 수 없는 시각적 도메인으로의 일반화를 향상시키기 위해.
  • 훈련 중 특정 시각적 환경에 과적합되는 것을 줄이기 위해.
  • 시각적 도메인 이동에 대해 불변적인 상태 표현을 정규화하는 방법을 개발하기 위해.
  • 중간 네트워크 레이어에서의 불변성에 대한 이론적 및 실증적 근거를 제공하기 위해.

제안 방법

  • 에이전트는 배경 색상 등 고정된 시각적 특성을 가진 기준 환경에서 유일하게 훈련된다.
  • 훈련 중, 동일한 상태에 대해 서로 다른 시각적 랜덤라이제이션 하에서의 특징 표현 간 차이를 벌어지게 하는 정규화 항이 부과된다.
  • 정규화는 정책 출력이 아닌 신경망의 중간 레이어에 적용되어, 불변적인 상태 표현을 장려한다.
  • 이 방법은 이중 입력 전방전파를 사용한다: 하나는 기준 환경이고, 다른 하나는 동일한 상태의 무작위로 샘플된 시각적 변형이다.
  • 손실 함수는 표준 강화학습 손실(예: Q-러닝 또는 정책 기반 강화학습)과 특징 간 L2 거리 기반 대비 정규화 항을 조합한다.
  • 이 방법은 가치 기반(예: DQN) 및 정책 기반 강화학습(예: PPO) 알고리즘과 모두 호환된다.

실험 결과

연구 질문

  • RQ1중간 상태 표현을 정규화함으로써, 샘플 복잡도를 증가시키지 않고도 시각적 도메인 랜덤라이제이션에서의 일반화를 향상시킬 수 있는가?
  • RQ2특징 표현의 불변성이 예측할 수 없는 시각적 도메인 이동에 따른 정책의 강건성에 어떤 영향을 미치는가?
  • RQ3중간 레이어에 정규화를 적용하는 것이 정책 출력에 적용하거나 입력 노이즈를 적용하는 것보다 우월한가?
  • RQ4표준 도메인 랜덤라이제이션과 비교할 때, 제안된 방법은 훈련 효율성과 성능 변동성 측면에서 어떻게 다른가?
  • RQ5t-SNE를 통한 표현의 도메인 간 시각화로 측정했을 때, 정규화가 특징 공간의 구조에 어떤 영향을 미치는가?

주요 결과

  • 정규화된 에이전트는 표준 도메인 랜덤라이제이션과 유사한 일반화 성능를 달성하지만, 다양한 시각적 도메인 간에 훨씬 낮은 변동성을 보인다.
  • t-SNE 시각화 결과, 정규화된 에이전트는 다양한 시각적 도메인에 대해 유사한 표현을 학습하는 반면, 랜덤라이제이션된 에이전트는 각 도메인에 대해 별개의 표현을 학습한다.
  • 정규화된 에이전트는 훈련 세트에 포함되지 않은 배경 색상 등 예측할 수 없는 시각적 랜덤라이제이션에도 강건하게 일반화되며, 반면 랜덤라이제이션된 에이전트는 특징 표현에서 높은 변동성을 보인다.
  • 특정 시각적 구성에 대한 과적합이 줄어들었음을 확인할 수 있었으며, 이는 다양한 배경 색상에서 일관된 성능을 유지함으로써 입증된다.
  • 정규화 덕분에 훨씬 효율적인 훈련이 가능해졌으며, 에이전트가 롤아웃 중 모든 시각적 변형을 경험할 필요가 없어졌다.
  • 이론적 분석 결과, 제안된 정규화가 시각적 랜덤라이제이션에 대한 정책의 리프시츠 연속성( Lipschitz continuity )을 향상시켜 강건성을 증가시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.