Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient transfer learning and online adaptation with latent variable models for continuous control

Christian F. Perez, Felipe Petroski Such|arXiv (Cornell University)|2018. 12. 08.
Robot Manipulation and Learning참고 문헌 9인용 수 7
한 줄 요약

이 논문은 연속 제어 작업에서 효율적인 전이 학습과 온라인 적응을 가능하게 하는 변분 추론 기반의 잠재변수 모델을 제안한다. 보조 잠재변수를 통해 환경 간 공유되는 동역학을 학습하고, 온라인 베이지안 추론을 통해 이를 갱신함으로써, 빠르고 샘플 효율적인 학습과 물리적 파rameter가 변하는 환경(예: 질량이나 마찰계수 등 알 수 없는 물리적 파rameter가 변하는 HalfCheetah)에 대한 강건한 일반화를 달성한다.

ABSTRACT

Traditional model-based RL relies on hand-specified or learned models of transition dynamics of the environment. These methods are sample efficient and facilitate learning in the real world but fail to generalize to subtle variations in the underlying dynamics, e.g., due to differences in mass, friction, or actuators across robotic agents or across time. We propose using variational inference to learn an explicit latent representation of unknown environment properties that accelerates learning and facilitates generalization on novel environments at test time. We use Online Bayesian Inference of these learned latents to rapidly adapt online to changes in environments without retaining large replay buffers of recent data. Combined with a neural network ensemble that models dynamics and captures uncertainty over dynamics, our approach demonstrates positive transfer during training and online adaptation on the continuous control task HalfCheetah.

연구 동기 및 목표

  • 물리적 파rameter(예: 질량 또는 마찰계수)가 알 수 없을 때 환경 동역학이 변화함에 따라 모델기반 강화학습에서 일반화 성능이 열 劣하는 문제를 해결하기 위해.
  • 환경 간 공유되는 동역학을 학습함으로써, 환경별 특성에 대한 공유된 잠재 표현을 학습함으로써 여러 환경 간 빠르고 데이터 효율적인 학습을 가능하게 하기 위해.
  • 큰 경험 버퍼를 저장할 필요 없이 온라인 베이지안 추론을 사용하여 추론 중에 변화하는 동역학에 실시간으로 적응할 수 있도록 지원하기 위해.
  • 유사한 훈련 환경에서의 전이를 활용하여 잠재변수 추론을 통해 새로운 환경에서의 일반화와 성능을 향상시키기 위해.

제안 방법

  • 공유된 신경망 앙상블이 동역학을 모델링하는 계층적 확률 모델을 사용하며, 보조 잠재변수 $\mathbf{e}_k$ 는 환경별 특수한 물리적 파rameter를 나타낸다.
  • 훈련 중에 동역학 모델과 미지 환경 특성의 잠재 표현 $\mathbf{e}_k$ 를 동시에 학습하기 위해 변분 추론을 적용한다.
  • 새로운 전이가 도착함에 따라 posterior over $\mathbf{e}_k$ 를 순차적으로 갱신하기 위해 온라인 베이지안 추론을 사용하여, 큰 리play 버퍼를 저장할 필요 없이 갱신한다.
  • 딥 네ural 네트워크 앙상블을 사용하여 동역학의 불확실성을 모델링함으로써, 단일 모델보다 강건성과 과적합 방지를 향상시킨다.
  • 모든 환경 간 공정한 비교를 위해 환경별 최소 및 최대 평균 보상값을 사용해 보상을 재스케일링한다.
  • 비가역 posterior over $\mathbf{e}_k$ 를 효율적이고 확장 가능한 추론이 가능하도록 스위치 변분 추론을 사용하여 근사한다.

실험 결과

연구 질문

  • RQ1공유 동역학 모델에 보조 잠재변수를 도입함으로써, 물리적 파rameter가 다양하게 변화하는 연속 제어 환경 간에 더 빠르고 일반화 능력이 뛰어난 학습이 가능할 수 있는가?
  • RQ2학습된 잠재변수에 대한 온라인 베이지안 추론이 큰 메모리 오버헤드 없이 변화하는 환경 동역학에 실시간으로 적응하는 데 얼마나 효과적인가?
  • RQ3잠재변수 학습에 변분 추론을 사용할 경우, 훈련 중에 양의 전이가 발생하고 새로운 테스트 환경에서 성능 향상이 이루어지는가?
  • RQ4데이터 효율성과 일반화 능력 측면에서, 제안된 방법은 전문가 및 일반화 전문가 에이전트와 비교해 어떻게 성능를 보이는가?
  • RQ5유추된 잠재변수들이 실제 환경의 물리적 파rameter(예: 중력 각도 $\theta_g$)를 얼마나 잘 반영하는가?

주요 결과

  • 제안된 방법은 물리적 파rameter가 다양하게 변화하는 환경 간에 훈련 중에 양의 전이를 보이며, 전문가 및 일반화 전문가 기준선보다 더 빠른 학습을 달성한다.
  • 500 시간 단위 이후에 $\theta_g$ 가 $-6^\circ$ 에서 $6^\circ$ 로 변화하는 동적 환경에서, 5회의 학습만으로도 일반화 전문가 기준선보다 온라인 적응에서 뛰어난 성능을 보였다.
  • 모델은 새로운 테스트 환경으로의 일반화가 효과적으로 이루어지며, 유추된 잠재변수들이 조건부로 $\theta_g$ 값의 상대적 순서를 정확히 포착함으로써 훈련 분포를 초월하는 외삽도 가능했다.
  • 학습 및 테스트 환경 전반에서 진짜 $\theta_g$ 값과 일치하는 방향으로 2차원 잠재공간이 학습된 것을 바탕으로, 환경 동역학 내 의미 있는 구조를 포착하고 있음을 보여주었다.
  • 일반화 전문가 기준선이 고데이터 영역에서 약간 더 뛰어난 성능을 보일지라도, 제안된 방법은 모든 환경에서 최종 성능을 유지하며 손상 없이 높은 성능를 유지했다.
  • 온라인 베이지안 추론을 사용함으로써, 큰 경험 버퍼를 저장할 필요 없이 실시간 적응이 가능해졌으며, 이는 메모리 제약을 줄이면서도 강건성을 유지하는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.