Skip to main content
QUICK REVIEW

[논문 리뷰] AdaRL: What, Where, and How to Adapt in Transfer Reinforcement Learning

Biwei Huang, Fan Feng|arXiv (Cornell University)|2021. 07. 06.
Reinforcement Learning in Robotics참고 문헌 48인용 수 6
한 줄 요약

AdaRL은 동적 베이지안 네트워크 내에서 구조적 변화를 단순한 그래픽 표현으로 모델링하여 효율적이고 해석 가능한 전이 강화 학습을 위한 원칙적인 프레임워크를 제안한다. 이는 소수의 타겟 도메인 샘플만으로도 정책 적응을 빠르게 수행하고, 정책 최적화에 드는 비용을 줄이며 전이, 관측, 보상 함수의 최소한의 구성 요소별 변화를 식별함으로써 CartPole 및 아케이드 게임에서 뛰어난 성능을 달성한다.

ABSTRACT

One practical challenge in reinforcement learning (RL) is how to make quick adaptations when faced with new environments. In this paper, we propose a principled framework for adaptive RL, called extit{AdaRL}, that adapts reliably and efficiently to changes across domains with a few samples from the target domain, even in partially observable environments. Specifically, we leverage a parsimonious graphical representation that characterizes structural relationships over variables in the RL system. Such graphical representations provide a compact way to encode what and where the changes across domains are, and furthermore inform us with a minimal set of changes that one has to consider for the purpose of policy adaptation. We show that by explicitly leveraging this compact representation to encode changes, we can efficiently adapt the policy to the target domain, in which only a few samples are needed and further policy optimization is avoided. We illustrate the efficacy of AdaRL through a series of experiments that vary factors in the observation, transition, and reward functions for Cartpole and Atari games.

연구 동기 및 목표

  • 변화하는 환경 간에 신뢰할 수 있고 저비용이며 해석 가능한 정책 전이를 가능하게 하기 위해.
  • 전이 과정에서 변화가 *어디서*, *무엇이*, 그리고 *어떻게* 발생하는지를 식별하여 효율적 적응을 이끌기 위해.
  • 구조적 변화 모델링을 통해 타겟 도메인에서의 광범위한 탐색과 정책 최적화에 대한 의존도를 줄이기 위해.
  • 부분 관측 가능한 환경을 포함한 MDP 및 POMDP 모두에 적응을 지원하기 위해.
  • 전이, 관측, 보상 함수의 변화를 인과적이고 해석 가능한 표현으로 제공하기 위해.

제안 방법

  • AdaRL은 잠재 상태, 관측, 행동, 보상, 도메인 특화 변화 요인 간의 관계를 동적 베이지안 네트워크(DBN)로 모델링한다.
  • 시스템의 어떤 구성 요소가 변화에 영향을 받는지를 식별하기 위해 구조 마스크(C_so, C_sr 등)를 도입하여 구성 요소별 적응을 가능하게 한다.
  • LSTM을 활용한 인코더-디코더 아키텍처를 사용하여 혼합 밀도 네트워크에서 잠재 상태를 추론하고 관측 및 보상을 재구성한다.
  • 구조 마스크와 변화 요인에 대한 희박성 정규화를 적용하여 최소한의 해석 가능한 변화 집합을 촉진한다.
  • 재구성, 예측 및 KL 발산 손실을 통해 모델을 훈련하며, 추가로 희박한 적응을 유도하는 정규화를 적용한다.
  • 학습된 변화 구조에 따라 소수의 타겟 도메인 롤아웃만으로도 소스 정책을 미세 조정하여 정책 적응을 달성한다.

실험 결과

연구 질문

  • RQ1전이, 관측, 보상 함수에서 효율적 정책 전이에 가장 관련성이 높은 구조적 변화는 무엇인가?
  • RQ2다른 도메인 간 정책 전이 시 적응이 필요한 최소한의 구성 요소는 무엇인가?
  • RQ3압축되고 해석 가능한 도메인 변화 그래픽 모델은 소수의 타겟 데이터로도 신속한 적응을 가능하게 하는가?
  • RQ4부분 관측 가능한 환경에서 기존 전이 강화 학습 방법과 비교해 볼 때 AdaRL의 데이터 효율성과 성능은 어떠한가?
  • RQ5CartPole 및 아케이드 환경에서 다양한 도메인 이동에 대해 모델의 일반화 능력은 어느 정도인가?

주요 결과

  • AdaRL은 타겟 도메인에서 소수의 샘플만으로도 CartPole 및 아케이드 게임에서 뛰어난 성능을 달성하여 타겟 도메인 탐색의 필요성을 크게 줄였다.
  • 흑상자 파rameter 업데이트에 의존하는 것보다는 구조적 변화를 명시적으로 모델링함으로써 베이스라인 전이 강화 학습 방법을 초월하는 성능을 보였다.
  • 구조 마스크의 사용은 구성 요소별 적응을 가능하게 하여 적응 과정을 해석 가능하고 효율적으로 만들었다.
  • 변화 요인과 구조 마스크에 대한 희박성 정규화는 필수적인 적응의 최소 집합을 이끌어내어 일반화 능력을 향상시키고 과적합을 줄였다.
  • 프레임워크는 부분 관측 가능한 환경에서도 정책을 성공적으로 적응시켜 관측 및 보상 함수의 이동에 대한 강건성을 입증했다.
  • 실험 결과, 복잡한 도메인 이동 조건에서도 AdaRL은 높은 샘플 효율성을 유지하며 전체 정책 재학습을 피하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.