Skip to main content
QUICK REVIEW

[논문 리뷰] Information is Power: Intrinsic Control via Information Capture

Nicholas Rhinehart, Jenny Wang|arXiv (Cornell University)|2021. 12. 07.
Reinforcement Learning in Robotics인용 수 12
한 줄 요약

이 논문은 부분 관찰 환경에서 내재적 탐색과 제어를 가능하게 하는 딥 강화학습 프레임워크인 정보 포착을 통한 내재적 제어(IC2)를 제안한다. 이 방법은 에이전트의 내재 상태 방문 분포의 엔트로피를 최소화하는 잠재 상태공간 모델을 사용하여, 외부 보상 없이도 시각적 관찰만으로도 움직이는 동물이나 기상 패턴과 같은 동적 물체를 탐색하고 표현하며 제어할 수 있도록 한다. 이는 내재적 보상 없이도 전문가 수준의 성능을 달성한다.

ABSTRACT

Humans and animals explore their environment and acquire useful skills even in the absence of clear goals, exhibiting intrinsic motivation. The study of intrinsic motivation in artificial agents is concerned with the following question: what is a good general-purpose objective for an agent? We study this question in dynamic partially-observed environments, and argue that a compact and general learning objective is to minimize the entropy of the agent's state visitation estimated using a latent state-space model. This objective induces an agent to both gather information about its environment, corresponding to reducing uncertainty, and to gain control over its environment, corresponding to reducing the unpredictability of future world states. We instantiate this approach as a deep reinforcement learning agent equipped with a deep variational Bayes filter. We find that our agent learns to discover, represent, and exercise control of dynamic objects in a variety of partially-observed environments sensed with visual observations without extrinsic reward.

연구 동기 및 목표

  • 외부 보상 없이도 부분 관찰 환경에서 동적 요소를 탐색하고 제어할 수 있는 일반적인 내재적 보상 신호를 개발하는 것.
  • 이전 방법들이 상호작용을 피하는(예: 안정적인 굴착지에 숨는 것) 경우나 예측 가능한 환경 변화를 유지하지 못하는 한계를 해결하는 것.
  • 통합된 목표를 통해 정보 수집(불확실성 감소)과 제어(예측 불가능성 감소)를 동시에 달성하는 것.
  • 잠재 상태 표현을 통해 정보 수집과 환경 제어를 모두 포괄하는 자기지도 학습 목표를 정식화하는 것.
  • 잠재 상태 방문 엔트로피를 최소화하는 것이 이전의 내재적 동기 부여 방법보다 더 복잡하고 견고한 행동을 이끌어낼 수 있음을 보여주는 것.

제안 방법

  • 에이전트는 깊이 있는 변동 베이즈 필터를 사용하여 환경의 은폐된 상태에 대한 믿음을 추정하는 잠재 상태공간 모델(LSSM)을 학습한다.
  • 내재적 보상은 에이전트의 잠재 상태 방문 분포의 음수 엔트로피로 정의되며, 정보 수집과 환경 제어를 모두 장려한다.
  • 이 엔트로피 최소화 목표를 기반으로 강화학습을 통해 정책을 훈련시키며, 장기적인 상태 방문 예측 가능성을 최적화한다.
  • 이 방법은 표현 학습과 제어 목표를 결합하며, LSSM은 시각적 관찰에서 시간적 동역학과 믿음 갱신을 모델링한다.
  • 이 방법은 이전 탐색 방법과 수직이며, 초기 탐색 효율성을 향상시키기 위해 이들과 조합할 수 있다.
  • 이 프레임워크는 움직이는 동물과 기상 변화와 같은 동적 요소를 포함한, 시각적으로 복잡한 부분 관찰 환경에서 평가된다.

실험 결과

연구 질문

  • RQ1잠재 상태 방문 엔트로피를 최소화하는 것이 부분 관찰 환경에서 정보 수집과 환경 제어를 동시에 이끌 수 있는가?
  • RQ2이 목표는 낯설음 탐색이나 능력 최대화와 같은 이전의 내재적 동기 부여 방법과 비교해 복잡한 행동을 얼마나 잘 달성하는가?
  • RQ3이 방법은 외부 보상 없이도 동적 물체(예: 암탉, 기상 패턴)를 탐색하고 제어할 수 있는가?
  • RQ4에이전트는 환경의 불확실성을 장기적으로 감소시키기 위해 안정적인 구조물(예: 울타리, 집)을 건설할 수 있는가?
  • RQ5이 방법이 실패하는 조건는 무엇이며, 다른 에이전트나 생명체가 존재하는 환경에 배치할 경우 필요한 보호 조치는 무엇인가?

주요 결과

  • IC2 에이전트는 외부 보상 없이도, 시각적으로 복잡한 부분 관찰 환경에서 움직이는 염소와 변화하는 기상 패턴과 같은 동적 물체를 탐색하고 표현하며 제어하는 데 성공했다.
  • 이 방법은 여러 벤치마크 환경에서 전문가 수준의 성능을 달성하여 이전의 비지도 제어 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 이전 방법들이 은폐나 피하기 행동으로 악화되는 것과 달리, IC2는 불확실성을 줄이고 환경 동역학을 유지하기 위해 적극적으로 노력한다.
  • 에이전트는 숨겨진 물체를 찾고, 환경 상태를 안정화하기 위해 둑을 쌓으며, 장기적인 예측 불가능성을 줄이기 위해 쉼터를 건설하는 행동을 보였다.
  • 이 방법은 놀라움 최소화와 능력 최대화 모두보다 복잡한 환경 요소를 포착하고 제어하는 데 뛰어난 성능을 보였다.
  • 이 방법은 부분 관찰에 대해 견고하며, 자기지도 학습을 통해 복잡한 장기 제어 정책을 학습할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.