Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Efficient Representation for Intrinsic Motivation

Ruihan Zhao, Stas Tiomkin|arXiv (Cornell University)|2019. 12. 04.
Reinforcement Learning in Robotics참고 문헌 14인용 수 5
한 줄 요약

이 논문은 고차원 시각 환경에서 행동과 미래 상태 간의 상호정보량으로 정의되는 에너지함수를 비용이 많이 드는 샘플링에 의존하지 않고 효율적으로 추정하는 새로운 방법을 제안한다. 깊이 신경망을 사용해 구조화된 잠재공간 동역학 모델을 학습하고 '물채우기'(water-filling) 알고리즘을 적용함으로써 정확한 에너지함수 계산이 가능해지며, 이는 기울어진 펜듈럼을 안정화시키는 데 성공한 내재적 동기 부여와 터널 환경에서 더 안전한 주행을 이끄는 데에도 효과를 보였다.

ABSTRACT

Mutual Information between agent Actions and environment States (MIAS) quantifies the influence of agent on its environment. Recently, it was found that the maximization of MIAS can be used as an intrinsic motivation for artificial agents. In literature, the term empowerment is used to represent the maximum of MIAS at a certain state. While empowerment has been shown to solve a broad range of reinforcement learning problems, its calculation in arbitrary dynamics is a challenging problem because it relies on the estimation of mutual information. Existing approaches, which rely on sampling, are limited to low dimensional spaces, because high-confidence distribution-free lower bounds for mutual information require exponential number of samples. In this work, we develop a novel approach for the estimation of empowerment in unknown dynamics from visual observation only, without the need to sample for MIAS. The core idea is to represent the relation between action sequences and future states using a stochastic dynamic model in latent space with a specific form. This allows us to efficiently compute empowerment with the "Water-Filling" algorithm from information theory. We construct this embedding with deep neural networks trained on a sophisticated objective function. Our experimental results show that the designed embedding preserves information-theoretic properties of the original dynamics.

연구 동기 및 목표

  • 고차원이며 미지의 환경에서 행동과 상태 간의 상호정보량을 추정하는 데 있어 계산적으로 비현실적인 문제를 해결하기 위해.
  • 전문가가 제공한 보상 함수가 필요 없이 시각 관측을 기반으로 실세계 로봇 시스템에서 내재적 동기 부여를 가능하게 하기 위해.
  • 에너지함수 계산을 위해 원래의 동역학의 정보이론적 성질을 유지하는 표현 학습 프레임워크를 개발하기 위해.
  • 비선형 환경에서 안정화 및 안전한 주행을 위한 내재적 학습이 이 방법으로 효과적으로 가능함을 입증하기 위해.

제안 방법

  • 최종 상태가 행동 시퀀스에 대해 선형인 잠재공간에서 확률적 동역학 모델을 학습함으로써 효율적인 에너지함수 계산을 가능하게 하기 위해.
  • 관측치와 행동을 원래 동역학의 정보이론적 구조를 유지하는 잠재공간에 매핑하기 위해 맞춤형 목적함수를 사용해 딥 네트워크를 훈련시키기 위해.
  • 정보이론에서 유래한 '물채우기' 알고리즘을 적용하여 잠재공간에서 채널 용량(에너지함수)을 효율적으로 계산하기 위해.
  • 계산된 에너지함수를 강화학습에서 정책 학습을 이끄는 내재적 보상 신호로 사용하기 위해.
  • perception, 에너지함수 추정, 정책 최적화를 닫힌 순환 구조로 통합하기 위해 IMPAC(Intrinsically Motivated Perception and Action Cycle) 프레임워크를 설계하기 위해.
  • 두 가지 도메인에서 방법을 검증하기 위해: 비선형 기울어진 펜듈럼의 안정화와 더블터널 환경에서의 안전한 주행.

실험 결과

연구 질문

  • RQ1샘플링 기반 상호정보량 추정 없이도 원시 시각 관측에서 미지의 환경에서 에너지함수를 효율적으로 추정할 수 있는가?
  • RQ2학습된 잠재공간 표현이 정확한 에너지함수 계산을 위해 필요한 원래 동역학의 정보이론적 성질을 유지하는가?
  • RQ3잠재공간에서 계산된 에너지함수는 펜듈럼 안정화와 같은 복잡한 제어 과제를 해결하는 데 의미 있는 내재적 보상으로 기능할 수 있는가?
  • RQ4에너지함수 기반 내재적 보상은 주행 과제에서 더 안전하고 더 견고한 경로를 선호하도록 도와줄 수 있는가?

주요 결과

  • 제안된 방법은 기울어진 펜듈럼에 대해 분석적 해와 정성적으로 일치하는 에너지함수 지도를 성공적으로 생성하여 정확도를 검증하였다.
  • 에이전트는 단지 학습된 에너지함수를 내재적 보상으로 사용하여 기울어진 펜듈럼을 똑바로 자세로 안정화시키는 데 성공했으며, 효과적인 내재적 학습을 보였다.
  • 더블터널 환경에서 에너지함수 지도는 좁은 터널에서 제어 효과가 떨어지는 것을 정확히 반영하여, 방법이 환경 제약 조건을 포착하고 있음을 확인하였다.
  • 내재적 보상 가중치(β)가 증가함에 따라 에이전트는 더 길지만 더 안전한 넓은 터널을 통과하는 경로를 점점 더 선호하게 되었으며, 이는 에너지함수가 보수적이고 안전한 행동을 이끄는 것을 보여주었다.
  • 이전 방법이 실패하는 고차원 시각 공간에서도 샘플링 없이 효율적인 에너지함수 추정을 달성하여 적용 가능성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.