Skip to main content
QUICK REVIEW

[논문 리뷰] Linear Representation Meta-Reinforcement Learning for Instant Adaptation

Matt Peng, Banghua Zhu|arXiv (Cornell University)|2021. 01. 12.
Reinforcement Learning in Robotics참고 문헌 32인용 수 4
한 줄 요약

FLAP은 공유 선형 정책 표현을 학습하고 피드포워드 어댑터 네트워크를 사용하여 임시 정책 가중치를 즉시 예측함으로써 메타강화학습 방법을 도입한다. 이는 기존의 MAML 및 PEARL과 같은 방법보다 최대 8배 빠른 적응 속도와 분포 외부 작업에서 평균 수익의 두 배를 달성한다.

ABSTRACT

This paper introduces Fast Linearized Adaptive Policy (FLAP), a new meta-reinforcement learning (meta-RL) method that is able to extrapolate well to out-of-distribution tasks without the need to reuse data from training, and adapt almost instantaneously with the need of only a few samples during testing. FLAP builds upon the idea of learning a shared linear representation of the policy so that when adapting to a new task, it suffices to predict a set of linear weights. A separate adapter network is trained simultaneously with the policy such that during adaptation, we can directly use the adapter network to predict these linear weights instead of updating a meta-policy via gradient descent, such as in prior meta-RL methods like MAML, to obtain the new policy. The application of the separate feed-forward network not only speeds up the adaptation run-time significantly, but also generalizes extremely well to very different tasks that prior Meta-RL methods fail to generalize to. Experiments on standard continuous-control meta-RL benchmarks show FLAP presenting significantly stronger performance on out-of-distribution tasks with up to double the average return and up to 8X faster adaptation run-time speeds when compared to prior methods.

연구 동기 및 목표

  • 기존의 메타강화학습 방법이 분포 외부 작업에 대해 적응할 때 높은 계산 비용을 수반하는 한계를 해결한다.
  • 로봇과 같은 실세계 응용 분야에서 적응 시간을 줄이기 위해 기존의 기울기 기반 업데이트를 정책 가중치 직접 예측으로 대체한다.
  • 기울기 기반 미세조정이 아닌 가중치 예측을 통해 다양한 정책 출력을 가능하게 하여 새로운 작업에 대한 일반화 성능을 향상시킨다.
  • 최소한의 상호작용 데이터에서 최적의 정책 가중치를 예측하는 사전 훈련된 어댑터 네트워크를 활용하여 적응 과정에서의 샘플 효율성을 극대화한다.

제안 방법

  • 여러 훈련 작업을 통해 정책 네트워크의 공유 선형 표현을 학습하며, π_i = φ · w_i로 표현한다. 여기서 φ는 공유 표현이고 w_i는 작업별 가중치이다.
  • 새로운 작업의 단일 SARS 튜플을 기반으로 작업별 가중치 w_i를 예측하기 위해 독립적인 피드포워드 어댑터 네트워크를 지도학습 방식으로 훈련한다.
  • 적응 과정에서 공유 표현 φ를 고정하고 어댑터 네트워크를 사용해 새로운 작업에 대한 w_test를 직접 예측함으로써 기울기 업데이트를 생략한다.
  • 오프-폴리시 액터-크리틱 훈련을 통해 공유 정책 표현과 어댑터 네트워크를 동시에 최적화한다.
  • 반복적인 기울기 업데이트를 단일 전방 전파로 대체함으로써 빠른 추론을 가능하게 한다.
  • 훈련된 작업들과 크게 다른 작업에서의 성능을 측정하여 일반화 능력을 평가하며, 적응 속도와 수익 성능을 함께 분석한다.

실험 결과

연구 질문

  • RQ1메타강화학습 방법이 추론 과정에서 기울기 기반 업데이트에 의존하지 않고도 빠른 적응을 달성할 수 있는가?
  • RQ2학습된 어댑터 네트워크를 통해 작업별 정책 가중치를 예측하는 것이 기울기 기반 또는 컨텍스트 인코딩 방법에 비해 분포 외부 작업에서의 일반화 성능을 향상시키는가?
  • RQ3어댑터 네트워크에 단일 SARS 튜플을 입력으로 사용할 경우 적응 성능 및 안정성에 어떤 영향을 미치는가?
  • RQ4선형 정책 표현이 다양한 작업 간 표현력과 수렴 안정성 사이의 균형을 잘 유지할 수 있는가?
  • RQ5어댑터 네트워크의 일반화 능력이 공유 정책 표현의 구조에 얼마나 의존하는가?

주요 결과

  • FLAP은 기울기 업데이트가 아닌 직접 예측 덕분에 기존 메타강화학습 방법(MAML 및 PEARL 포함)보다 최대 8배 빠른 적응 런타임을 달성한다.
  • 분포 외부 작업에서 FLAP은 최신 기술보다 평균 수익을 최대 두 배까지 확보하여 뛰어난 일반화 성능을 입증한다.
  • 어댑터 네트워크 덕분에 적응 과정에서 환경과의 상호작용 수를 극히 적게 유지하면서도 높은 성능을 달성하여 샘플 복잡도를 크게 감소시킨다.
  • 기울기 기반 방법이 작업 간 유사한 정책을 생성하는 데 반해, FLAP은 훈련 작업과 매우 다른 새로운 작업에서도 잘 일반화된다.
  • SARS 튜플의 시퀀스를 어댑터 네트워크의 입력으로 사용하면 분포가 희박한 보상 작업에서 분산을 줄이고 약간의 성능 향상을 얻을 수 있으나, 속도에 약간의 비용이 발생한다.
  • 어댑터 네트워크는 훈련 과정에서 안정적이고 신속하게 수렴하여 새로운 작업에 대한 가중치 예측의 신뢰성과 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.