Skip to main content
QUICK REVIEW

[논문 리뷰] Analysing Deep Reinforcement Learning Agents Trained with Domain Randomisation

Tianhong Dai, Kai Arulkumaran|arXiv (Cornell University)|2019. 12. 18.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

이 논문은 시뮬레이션에서 도메인 랜덤라이제이션(DR)을 사용해 훈련된 딥 강화학습(DRL) 에이전트의 일반화 능력, 내부 표현, 그리고 해석 가능성성을 비-DR 에이전트와 비교하여 조사한다. DR는 더 강건하고 엉키기 쉬운 시각적 표현을 유도하며, 구조적인 컨볼루션 필터와 강한 순환 처리 의존도를 보이지만, 과적합과 더 높은 샘플 복잡도를 유발할 수 있어 신뢰할 수 있는 분석을 위해 다중 방법의 해석 기법이 필요하다.

ABSTRACT

Deep reinforcement learning has the potential to train robots to perform complex tasks in the real world without requiring accurate models of the robot or its environment. A practical approach is to train agents in simulation, and then transfer them to the real world. One popular method for achieving transferability is to use domain randomisation, which involves randomly perturbing various aspects of a simulated environment in order to make trained agents robust to the reality gap. However, less work has gone into understanding such agents - which are deployed in the real world - beyond task performance. In this work we examine such agents, through qualitative and quantitative comparisons between agents trained with and without visual domain randomisation. We train agents for Fetch and Jaco robots on a visuomotor control task and evaluate how well they generalise using different testing conditions. Finally, we investigate the internals of the trained agents by using a suite of interpretability techniques. Our results show that the primary outcome of domain randomisation is more robust, entangled representations, accompanied with larger weights with greater spatial structure; moreover, the types of changes are heavily influenced by the task setup and presence of additional proprioceptive inputs. Additionally, we demonstrate that our domain randomised agents require higher sample complexity, can overfit and more heavily rely on recurrent processing. Furthermore, even with an improved saliency method introduced in this work, we show that qualitative studies may not always correspond with quantitative measures, necessitating the combination of inspection tools in order to provide sufficient insights into the behaviour of trained agents.

연구 동기 및 목표

  • 도메인 랜덤라이제이션(DR)이 시뮬레이션에서 훈련된 딥 강화학습(DRL) 에이전트의 일반화 능력과 내부 표현에 미치는 영향를 이해하는 것.
  • DR가 샘플 효율성, 시각적 및 환경적 요란에 대한 강건성, 그리고 순환 처리에 대한 의존도에 미치는 영향를 평가하는 것.
  • 특히 복수의 해석 기법을 조합하여 사용했을 때의 효과를 평가하여, DR 훈련된 에이전트를 분석하는 데에 효과적인지 평가하는 것.
  • DR에 의해 유도된 네트워크 내부의 변화가 일반화 능력 향상 또는 과적합과 같은 부작용과 관련이 있는지 조사하는 것.
  • 시뮬레이션에서 실제 환경으로의 전이를 돕기 위해, DR 없이도 모방할 수 있는 DR 에이전트의 핵심 구조적 및 표현적 특성을 규명하는 것.

제안 방법

  • Fetch 및 Jaco 로봇 조작 작업에서, 시각적 도메인 랜덤라이제이션(DR) 유무에 따라 PPO를 사용해 DRL 에이전트를 훈련하였으며, 체감 입력 유무를 포함한 다양한 구성에서 수행하였다.
  • 일반화 능력을 평가하기 위해, 시각적 요란(예: 랜덤라이즈된 조명, 텍스처), 도메인 이탈(예: DR에서 표준 시뮬레이션 시각으로 전환) 등을 포함한 단위 테스트를 실시하였다.
  • 해석 기법을 적용: 시각화 기반 중요도 맵(새로운 개선된 방법 포함), 유닛 제거(ablation), 활성화 최대화, 필터 노름 분석, 표현 엉킴 측정.
  • DR에 의한 특징 검출기의 구조적 변화를 정량화하기 위해 컨볼루션 필터의 ℓ₁-노름 분석을 수행하였다.
  • 다양한 시각 조건 하에서의 표현 간 불변성(표현의 일관성)을 엉킴 점수를 통해 측정하였다.
  • LSTM과 최종 정책 레이어에 대한 제거 실험을 통해 모듈성과 재초기화에 대한 강건성을 평가하였다.

실험 결과

연구 질문

  • RQ1도메인 랜덤라이제이션은 DRL 에이전트의 시각적 및 환경적 요란에 대한 일반화 성능에 어떻게 영향을 미치는가?
  • RQ2특히 컨볼루션 필터와 은닉 표현에서 도메인 랜덤라이제이션으로 인해 어떤 내부 구조적 및 표현적 변화가 발생하는가?
  • RQ3DR 에이전트는 어느 정도 순환 처리에 의존하는가? 비-DR 에이전트와 비교해 봤을 때 어떻게 다른가?
  • RQ4시각화, 제거, 활성화 최대화와 같은 해석 기법들이 DR 에이전트 행동에 대해 일관되고 신뢰할 수 있는 통찰을 제공할 수 있는가?
  • RQ5도메인 랜덤라이제이션은 특정 구성에서 과적합을 유도하는가? 체감 입력의 유무는 이에 어떻게 影향을 미치는가?

주요 결과

  • DR로 훈련된 에이전트는 비-DR 에이전트에 비해 다양한 테스트 조건(시각적 요란, 도전 요소 포함)에서 유의미하게 높은 일반화 성능를 보였다.
  • DR는 더 구조적이고 공간적으로 조직화된 컨볼루션 필터를 유도하였으며, 더 높은 ℓ₁-노름을 보여, 더 복잡하고 강건한 특징 검출기가 됨을 시사하였다.
  • 표현 엉킴 분석 결과, DR 에이전트는 다양한 시각 조건에서도 더 불변성 있고 작업에 특화된 특징을 학습하였으며, 서로 다른 시각 조건 하에서 임베딩 간의 겹침이 더 높았다.
  • 기대와는 달리, 필터 제거 실험에서 DR 에이전트는 성능 변동성이 줄어들지 않았다. 오히려 기준 성능가 더 높아져, 필터 변화에 대한 민감도 감소보다는 강건성 향상이 이루어졌음을 시사하였다.
  • DR 에이전트는 LSTMs를 강하게 의존함을 확인하였으며, 순환 상태를 제거했을 때 성능 저하가 심각하게 발생한 반면, 비-DR 에이전트는 영향을 거의 받지 않았다.
  • 놀랍게도, 체감 입력 없이 DR로 훈련된 Jaco 에이전트에서 과적합 사례가 발생하였다. 표준(비-DR) 시각 조건에서 테스트했을 때 성능이 떨어졌으며, 이는 낮은 감각 입력 환경에서 DR가 분포 과적합을 유도할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.