Skip to main content
QUICK REVIEW

[논문 리뷰] Model Based Planning with Energy Based Models

Yilun Du, Toru Lin|arXiv (Cornell University)|2019. 09. 15.
Reinforcement Learning in Robotics참고 문헌 33인용 수 5
한 줄 요약

이 논문은 강화학습에서 모델기반 계획을 위해 에너지 기반 모델(EBMs)을 사용함으로써, 상태 경로에 대한 온라인 학습과 최대 엔트로피 추론을 가능하게 한다. EBMs는 온라인 학습에서 피드포워드 네트워크를 능가하며, 새로운 장애물에 대해 더 잘 일반화되며, 탐색되지 않은 접근 가능한 상태에 낮은 에너지를 할당함으로써 자연스럽게 방향성 있는 탐색을 유도한다.

ABSTRACT

Model-based planning holds great promise for improving both sample efficiency and generalization in reinforcement learning (RL). We show that energy-based models (EBMs) are a promising class of models to use for model-based planning. EBMs naturally support inference of intermediate states given start and goal state distributions. We provide an online algorithm to train EBMs while interacting with the environment, and show that EBMs allow for significantly better online learning than corresponding feed-forward networks. We further show that EBMs support maximum entropy state inference and are able to generate diverse state space plans. We show that inference purely in state space - without planning actions - allows for better generalization to previously unseen obstacles in the environment and prevents the planner from exploiting the dynamics model by applying uncharacteristic action sequences. Finally, we show that online EBM training naturally leads to intentionally planned state exploration which performs significantly better than random exploration.

연구 동기 및 목표

  • 학습된 동역학을 사용한 모델기반 계획을 통해 모델프리 강화학습에서 낮은 샘플 효율성과 일반화 문제를 해결한다.
  • 행동 조건 계획의 한계를 극복하여, 모델 정확도의 오류를 악용하거나 새로운 장애물에서 실패하는 것을 방지한다.
  • 실세계 환경에서 변화하는 동역학과 상관된 경험에 적응할 수 있는 EBM의 온라인 학습 프레임워크를 개발한다.
  • EBM 학습을 통해 탐색을 유도하며, 탐색되지 않은 영역에 낮은 에너지를 할당함으로써 자연스럽게 새로운 영역을 햖थ하려는 유도를 가능하게 한다.
  • 행동 조건 없이 상태 공간에서만 계획을 수행할 경우, 더 나은 일반화와 더 안전하고 다양한 경로를 생성함을 입증한다.

제안 방법

  • 에너지 기반 모델이 정의하는 그래픽 모델에서 계획을 추론 문제로 재구성하며, 에너지 함수가 상태 전이의 가능성도를 코딩한다.
  • 실제 전이와 계획된 전이(편이 발생하기 전)를 모두 사용해 EBM을 온라인으로 학습시키며, 실제 전이와 타당한 계획된 전이에 대해 에너지를 최소화하는 대비 목적함수를 사용한다.
  • 랭지에빈 역학 또는 유사한 샘플링 방법을 사용해 상태 경로에 대한 최대 엔트로피 추론을 수행하며, 시작점에서 목표점까지 다양한 계획을 생성한다.
  • 정책 학습을 동역학 모델링에서 분리하기 위해 계획을 시작 상태와 목표 상태에만 조건화함으로써, 행동 공간의 오용을 방지한다.
  • EBM의 조합성과 온라인 학습 특성을 활용해, 훈련 중 상관된 비i.i.d. 경험에 대해서도 강건성을 유지한다.
  • 탐색 유도를 위해 EBMs가 탐색되지 않았지만 접근 가능한 상태에 낮은 에너지를 할당하도록 하여, 에이전트가 새로운 영역을 향해 유도되도록 한다.

실험 결과

연구 질문

  • RQ1에너지 기반 모델은 상관된 경험을 가진 실세계 비정적 환경에서 동역학의 효과적인 온라인 학습을 지원할 수 있는가?
  • RQ2기존에 보지 못한 장애물에 직면했을 때, EBMs를 사용한 상태 공간 계획이 행동 조건 계획보다 더 잘 일반화되는가?
  • RQ3EBM 기반 계획은 명시적 보상 형상화나 탐색 보너스 없이도 자연스럽게 다양하고 고품질의 경로를 생성할 수 있는가?
  • RQ4온라인 EBM 학습이 무작위 또는 내재된 동기 기반 방법에 비해 얼마나 더 방향성 있고 효율적인 탐색을 이끌어내는가?
  • RQ5EBM의 최대 엔트로피 성질이 상태공간 계획에서 강건성과 다양성 향상에 얼마나 기여하는가?

주요 결과

  • EBMs는 온라인 모델 학습에서 해당 피드포워드 네트워크를 크게 능가하며, 상관된 경험에 더 강건하고 더 빠른 수렴을 보인다.
  • EBM 기반 계획은 새로운 장애물에 대해 더 잘 일반화된다: 입자 환경에서 EBM은 -61.94의 보상을 기록했고, 행동 조건 피드포워드 네트워크는 -81.24의 보상을 기록했다.
  • EBM 기반 계획은 다양한 경로를 생성한다: 다단계 계획에서 가능한 경로의 범위가 넓고, Reacher 환경에서 시계방향과 반시계방향 경로를 모두 생성할 수 있다.
  • EBMs는 자연스럽게 탐색을 유도한다: 미로 환경에서 EBM을 기반으로 한 탐색은 10,000개 미만의 전이 안에 전체 미로를 커버했고, 무작위 정책은 최대 공간 점유율에 도달하기 위해 200,000개 이상의 전이가 필요했다.
  • Sawyer 로봇 암 작업에서 EBMs는 랜덤 탐색보다 훨씬 적은 전이 수로 최대 3D 종단기구 점유율(116voxels)에 도달했으며, 이는 방향성 있고 효율적인 탐색임을 보여준다.
  • 훈련 중 탐색되지 않은 영역의 에너지 값이 변동함에 따라 EBMs는 이전에 방문하지 않은 접근 가능한 상태를 향한 계획을 생성하게 되어, 동적인 탐색 유도 메커니즘이 만들어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.