Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Online Estimation of Empowerment for Reinforcement Learning

Ruihan Zhao, Pieter Abbeel|arXiv (Cornell University)|2020. 07. 14.
Reinforcement Learning in Robotics참고 문헌 39인용 수 5
한 줄 요약

이 논문은 신경망을 사용하여 에너지함수를 볼록 최적화 문제로 재구성함으로써 강화학습에서 에너지함수를 추정하는 효율적인 온라인 알고리즘을 제안한다. 이는 샘플 및 계산 복잡도를 크게 감소시킨다. 이 방법은 도메인 특화 지식이나 수동 리셋이 없이도 효과적인 내재적 동기를 제공하며, 실제 환경에서의 확장 가능한 훈련을 가능하게 한다.

ABSTRACT

Training artificial agents to acquire desired skills through model-free reinforcement learning (RL) depends heavily on domain-specific knowledge, and the ability to reset the system to desirable configurations for better reward signals. The former hinders generalization to new domains; the latter precludes training in real-life conditions because physical resets are not scalable. Recently, intrinsic motivation was proposed as an alternative objective to alleviate the first issue, but there has been no reasonable remedy for the second. In this work, we present an efficient online algorithm for a type of intrinsic motivation, known as empowerment, and address both limitations. Our method is distinguished by its significantly lower sample and computation complexity, along with improved training stability compared to the relevant state of the art. We achieve this superior efficiency by transforming the challenging empowerment computation into a convex optimization problem through neural networks. In simulations, our method manages to train policies with neither domain-specific knowledge nor manual intervention. To address the issue of resetting in RL, we further show that our approach boosts learning when there's no early termination. Our proposed method opens doors for studying intrinsic motivation for policy training and scaling up model-free RL training in real-life conditions.

연구 동기 및 목표

  • 기본 모델 기반 강화학습(RL)에서 스킬 습득을 위한 도메인 특화 지식이 요구되는 문제를 해결한다.
  • 실제 강화학습 환경에서 물리적 리셋이 비현실적이므로, 조기 종료나 수동 간섭 없이 훈련을 가능하게 한다.
  • 에너지함수를 통한 내재적 동기 부여를 위한 확장 가능하고 샘플 효율적인 방법을 개발하여 훈련의 안정성과 일반화 능력을 향상시킨다.
  • 신경망을 사용하여 복잡한 에너지함수 계산을 볼록 최적화 문제로 변환함으로써 효율성을 향상시킨다.

제안 방법

  • 정책과 환경 역학을 신경망으로 매개변수화함으로써 에너지함수 계산을 볼록 최적화 문제로 재구성한다.
  • 기울기 전파를 통해 엔드 투 엔드 훈련이 가능한 미분 가능한 신경망 아키텍처를 사용하여 최대 달성 가능한 상태 분포를 추정한다.
  • 배치 처리를 피하기 위해 온라인 최적화 기법을 적용하여 정책 훈련 중 실시간으로 에너지함수 추정치를 업데이트한다.
  • 외부 보상이 흐린 경우에 의존하지 않고 탐색을 이끄는 내재적 보상 신호로 에너지함수 신호를 통합한다.
  • 반복적 값 반복 또는 몬테카를로 시뮬레이션을 피하기 위해 볼록 프레임워크 내에서 폐쇄형 해를 사용함으로써 계산 효율성을 확보한다.
  • 부분 관측 가능성과 확률적 전이에 강건한 설계를 통해 복잡한 환경에서의 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1에너지함수를 온라인 모델 기반 강화학습에서 실용적인 내재적 보상으로 효율적으로 추정할 수 있는가?
  • RQ2기존 방법과 비교해 본다면 제안된 방법이 샘플 및 계산 복잡도를 얼마나 감소시킬 수 있는가?
  • RQ3실제 환경에서 도메인 특화 지식이나 수동 리셋 없이도 효과적인 학습을 가능하게 하는가?
  • RQ4에너지함수의 볼록 재구성이 훈련 안정성과 수렴 속도를 어떻게 향상시키는가?
  • RQ5기존 내재적 동기 부여 방법이 높은 샘플 비용으로 실패하는 연속 제어 과제에 대해서도 이 방법이 확장 가능한가?

주요 결과

  • 제안된 방법은 에너지함수 추정 분야에서 최신 기술보다 훨씬 낮은 샘플 및 계산 복잡도를 달성한다.
  • 알고리즘은 도메인 특화 지식이나 수동 리셋 없이도 안정적이고 효율적인 온라인 정책 훈련을 가능하게 한다.
  • 시뮬레이션에서의 실험 결과는 조기 종료가 비활성화된 상태에서도 효과적인 학습이 가능함을 보여주며, 흐린 보상에 대한 강건성을 입증한다.
  • 볼록 최적화 공식화는 비볼록 또는 반복적 대안 대비 더 빠른 수렴과 향상된 안정성을 가능하게 한다.
  • 이 방법은 연속 제어 환경으로까지 확장 가능하여, 에너지함수 기반 내재적 동기 부여가 실제 강화학습 응용 분야에서 실현 가능하게 한다.
  • 최적화 문제를 파arameter화하기 위해 신경망을 사용함으로써 엔드 투 엔드 미분 가능성이 보장되고 딥 강화학습 파이프라인에 원활하게 통합된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.