Skip to main content
QUICK REVIEW

[논문 리뷰] ADAAPT: A Deep Architecture for Adaptive Policy Transfer from Multiple Sources

Janarthanan Rajendran, Prateek Prasanna|arXiv (Cornell University)|2015. 10. 10.
Reinforcement Learning in Robotics참고 문헌 30인용 수 10
한 줄 요약

ADAAPT는 여러 소스 태스크에서 타겟 태스크로 적응형이며 선택적 정책 전이를 가능하게 하는 딥 강화학습 아키텍처이다. 이는 악성 전이를 완화하고 학습 효율성을 향상시킨다. 시뮬레이션 환경에서의 실험 결과, 태스크 간 공유되는 상태-행동 공간을 효과적으로 활용하여, 전이 없거나 비적응형 방법보다 우수한 성능을 보였다.

ABSTRACT

The ability to transfer knowledge from learnt source tasks to a new target task can be very useful in speeding up the learning process of a Reinforcement Learning agent. This has been receiving a lot of attention, but the application of transfer poses two serious challenges which have not been adequately addressed in the past. First, the agent should be able to avoid negative transfer, which happens when the transfer hampers or slows down the learning instead of speeding it up. Secondly, the agent should be able to do selective transfer which is the ability to select and transfer from different and multiple source tasks for different parts of the state space of the target task. We propose ADAAPT: A Deep Architecture for Adaptive Policy Transfer, which addresses these challenges. We test ADAAPT using two different instantiations: One as ADAAPTive REINFORCE algorithm for direct policy search and another as ADAAPTive Actor-Critic where the actor uses ADAAPT. Empirical evaluations on simulated domains show that ADAAPT can be effectively used for policy transfer from multiple source MDPs sharing the same state and action space.

연구 동기 및 목표

  • 다중 소스 강화학습 전이에서 악성 전이 문제를 해결하기 위해.
  • 타겟 태스크의 상태 공간 내 다양한 영역에 따라 어떤 소스 정책을 사용할지 적응적으로 조정함으로써 선택적 전이를 가능하게 하기 위해.
  • 다양한 소스 태스크의 정책을 동적으로 통합할 수 있는 딥 아키텍처를 설계하기 위해.
  • 공유되는 상태 및 행동 공간을 가진 시뮬레이션 환경에서 적응형 전이의 효과성을 평가하기 위해.

제안 방법

  • ADAAPT는 현재 상태에 따라 여러 소스 태스크의 정책을 게이팅하고 조합하는 방식으로 학습하는 딥 네ural 네트워크 아키텍처를 사용한다.
  • 입력 상태에 따라 관련성이 있는 소스 정책을 적응적으로 선택하는 라우팅 메커니즘을 사용하여, 관련이 없는 소스로부터의 간섭을 최소화한다.
  • 모델은 ADAAPTive REINFORCE와 ADAAPTive Actor-Critic로 구현되어 있으며, 직접 정책 탐색과 액터-크리틱 학습을 모두 가능하게 한다.
  • 정책 기반 강화학습 방법을 사용하여 엔드 투 엔드로 학습되며, 유용한 소스 정책을 우선시하는 애너턴스 유사 라우팅을 활용한다.
  • 모델은 오직 유용한 지식만 전이되도록 보장하여 악성 전이의 위험을 줄인다.

실험 결과

연구 질문

  • RQ1다수의 소스에서의 적응형 정책 전이가 강화학습에서 악성 전이를 줄일 수 있는가?
  • RQ2에이전트가 현재 상태에 따라 다양한 소스 태스크의 정책을 얼마나 효과적으로 선택하고 통합할 수 있는가?
  • RQ3선택적 전이가 공유되는 상태-행동 공간을 가진 타겟 태스크에서 학습 속도와 성능을 향상시키는가?
  • RQ4ADAAPT는 시뮬레이션 환경에서 비적응형 또는 단일 소스 전이 방법과 비교하여 어떻게 성능을 내는가?

주요 결과

  • ADAAPT는 각 상태 영역에 대해 관련성이 있는 소스 정책만 선택적으로 활성화함으로써 악성 전이를 크게 감소시킨다.
  • 비전이 및 비적응형 전이 기반선 대비 타겟 태스크에서 더 빠른 수렴을 달성할 수 있다.
  • 실험적 평가 결과, 공유되는 상태 및 행동 공간을 가진 여러 시뮬레이션 도메인에서 일관된 성능 향상이 확인되었다.
  • 적응형 라우팅 메커니즘은 상태 공간의 다양한 부분에 대해 가장 유용한 소스 정책을 효과적으로 식별하고 활용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.