Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Adaptive Exploration Strategies in Dynamic Environments Through Informed Policy Regularization

Pierre-Alexandre Kamienny, Matteo Pirotta|arXiv (Cornell University)|2020. 05. 06.
Reinforcement Learning in Robotics참고 문헌 27인용 수 9
한 줄 요약

이 논문은 동적이고 비정상적인 환경에서 샘플 복잡도를 크게 줄이고 강력한 일반화 능력과 적응 능력을 유지하면서 RNN 기반 탐색 정책을 훈련하기 위해 임의의 정책 정규화 방법인 IMPORT를 제안한다. 이 방법은 태스크 특화 지능형 정책에서 유도된 지도 신호를 활용하여 RNN 기반 탐색 정책을 훈련함으로써, 이전의 접근 방식인 톰슨 샘플링과 태스크 인퍼런스보다 특히 태스크 변화가 발생하거나 사전 정보가 제한적인 상황에서 더 빠르고 안정적인 학습을 달성한다.

ABSTRACT

We study the problem of learning exploration-exploitation strategies that effectively adapt to dynamic environments, where the task may change over time. While RNN-based policies could in principle represent such strategies, in practice their training time is prohibitive and the learning process often converges to poor solutions. In this paper, we consider the case where the agent has access to a description of the task (e.g., a task id or task parameters) at training time, but not at test time. We propose a novel algorithm that regularizes the training of an RNN-based policy using informed policies trained to maximize the reward in each task. This dramatically reduces the sample complexity of training RNN-based policies, without losing their representational power. As a result, our method learns exploration strategies that efficiently balance between gathering information about the unknown and changing task and maximizing the reward over time. We test the performance of our algorithm in a variety of environments where tasks may vary within each episode.

연구 동기 및 목표

  • 시간이 지남에 따라 변화하는 태스크가 존재하는 동적이고 비정상적인 환경에서 효과적인 탐색-이용 정책을 훈련하는 데 도전하는 것.
  • RNN 기반 정책를 훈련할 때 과도한 샘플 복잡도를 줄이되, 그 표현 능력을 손상시키지 않는 것.
  • 훈련 중에 RNN과 태스크 지능형 정책의 장점을 융합하여 효율적인 온라인 적응을 가능하게 하는 것.
  • 미리보지 않은 태스크에 대한 일반화 능력 향상과 관련 없는 또는 노이즈가 있는 태스크 기술자에 대한 강건성 향상

제안 방법

  • IMPORT는 관측값과 함께 태스크 임베딩 또는 RNN 히든 상태를 입력으로 받는 공유 정책 헤드를 훈련시켜 RNN과 지능형 정책의 공동 학습을 가능하게 한다.
  • 훈련 시점에서 태스크 기술자를 입력으로 사용하여 지능형 정책를 훈련시키며, 이 정책가 RNN 정책에 정규화를 통해 지도 신호를 제공한다.
  • RNN 정책는 지능형 정책의 행동을 모방하도록 유도하는 손실를 통해 정규화되며, 이는 훈련의 안정성과 수렴 속도 향상에 기여한다.
  • 테스트 시점에서 태스크 기술자는 RNN의 히든 상태로 대체되며, 이는 진짜 태스크에 접근할 수 없더라도 에이전트가 행동할 수 있도록 한다.
  • 이 방법은 태스크 기술자가 알려진 가족의 태스크들에서 훈련되는 다중태스크 학습 설정을 사용하여, 새로운 태스크에 대한 일반화를 가능하게 한다.
  • 이 접근은 희소 보상 탐색 태스크와 비정상적인 제어 문제를 조합하여 평가되었으며, 수정된 CartPole 및 미로 탐색 환경을 포함한다.

실험 결과

연구 질문

  • RQ1훈련 중에 태스크 특화 지능형 정책를 활용함으로써 RNN 기반 정책를 동적 환경에서 더 효율적으로 훈련시킬 수 있는가?
  • RQ2지능형 정책를 사용한 정책 정규화는 샘플 효율성과 성능 측면에서 톰슨 샘플링과 태스크 인퍼런스에 비해 어떻게 비교되는가?
  • RQ3제한된 사전 정보를 가진 상태에서 훈련된 RNN 정책는 얼마나 많은 정도로 새로운 태스크에 일반화할 수 있는가?
  • RQ4기존의 접근 방식에 비해 이 방법은 관련 없거나 최소한의 정보를 가진 태스크 기술자에 대해 얼마나 강건한가?

주요 결과

  • 모든 환경에서 IMPORT는 RNN과 태스크 인퍼런스(TI)보다 더 빠른 학습을 달성하며, 특히 미로 탐색 태스크에서 뚜렷하게 감소된 샘플 복잡도를 보였다.
  • 비정상적인 환경에서 IMPORT는 TS와 TI를 능가하며, 에피소드 내에서 태스크 변화에 대한 더 뛰어난 적응 능력을 보였다.
  • 제한된 수의 태스크 인스턴스에서만 훈련된 상태에서도 IMPORT는 새로운 태스크에 효과적으로 일반화되었으며, 제로샷 일반화 설정에서 TS와 TI를 능가했다.
  • 이 방법은 관련 없거나 노이즈가 있는 태스크 기술자에 대해서도 강건했지만, TI의 성능는 이러한 조건에서 크게 떨어졌다.
  • β > 0(정규화된) 상태에서의 IMPORT는 β = 0일 때보다 더 빠르게 학습을 진행했으며, 지능형 정책로부터 유도된 보조 지도 손실의 유용성을 확인했다.
  • 일반화 실험에서 4×10⁶ 단계 이후 오버피팅 현상이 관찰되었으며, 이는 훈련 태스크를 기억하는 것과 새로운 태스크에 일반화하는 것 사이의 상충 관계를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.