Skip to main content
QUICK REVIEW

[논문 리뷰] Model-based Lookahead Reinforcement Learning

Zhang-Wei Hong, Joni Pajarinen|arXiv (Cornell University)|2019. 08. 15.
Reinforcement Learning in Robotics참고 문헌 45인용 수 9
한 줄 요약

이 논문은 모델리스 강화학습(MFRL)과 모델 예측 제어(MPC)를 결합한 새로운 프레임워크인 MPC-MFRL을 제안한다. 이는 MuJoCo 연속 제어 벤치마크에서 높은 데이터 효율성과 최신 기술 수준의 성능을 달성한다. MFRL의 탐색 정책을 활용해 동역학 모델의 품질을 햖스하고, 가치 함수와 소프트-그리디 액션 선택을 통한 MPC를 활용함으로써, MFRL 수준의 성능를 달성하면서도 MBRL 수준의 샘플 효율성을 유지한다.

ABSTRACT

Model-based Reinforcement Learning (MBRL) allows data-efficient learning which is required in real world applications such as robotics. However, despite the impressive data-efficiency, MBRL does not achieve the final performance of state-of-the-art Model-free Reinforcement Learning (MFRL) methods. We leverage the strengths of both realms and propose an approach that obtains high performance with a small amount of data. In particular, we combine MFRL and Model Predictive Control (MPC). While MFRL's strength in exploration allows us to train a better forward dynamics model for MPC, MPC improves the performance of the MFRL policy by sampling-based planning. The experimental results in standard continuous control benchmarks show that our approach can achieve MFRL`s level of performance while being as data-efficient as MBRL.

연구 동기 및 목표

  • 로봇과 같은 실제 응용 분야에서 모델리스 강화학습(MFRL)의 높은 샘플 복잡도 문제를 해결하기 위해.
  • 모델 근사 오차로 인해 발생하는 MFRL와 모델 기반 강화학습(MBRL) 간의 성능 격차를 극복하기 위해.
  • MFRL의 탐색 능력과 MPC의 계획 능력을 활용하여 데이터 효율성과 최종 성능 향상을 위한 통합 프레임워크를 개발하기 위해.
  • 모델 기반 계획에서 이상적인 동역학 모델이나 2차원 상태 공간과 같은 강력한 가정에 의존하지 않기 위해.
  • MFRL 정책과 가치 함수, 소프트-그리디 액션 선택을 통한 MPC의 조합 효과를 경험적으로 검증하기 위해.

제안 방법

  • 학습된 MFRL 정책을 통해 다양한 고품질 데이터를 수집하여 전방 동역학 모델을 학습함으로써, MBRL 전용 데이터 수집 방식보다 모델 정확도를 향상시킨다.
  • 학습된 전방 동역학 모델을 추론 중인 온라인 계획에 MPC에 적용함으로써 샘플 효율적이고 고성능의 제어를 가능하게 한다.
  • MFRL 정책의 가치 함수를 MPC 계획에 통합하여 액션 선택을 안내하고 장기적인 의사결정 능력을 향상시킨다.
  • 모델 근사 오차 상황에서 과도한 추정 오차를 줄이기 위해 MPC에 소프트-그리디 액션 선택 전략을 구현한다.
  • 완벽한 동역학 모델이나 구조화된 상태 공간이 필요 없이도 정책과 가치 함수를 함께 최적화하여 계획 성능를 향상시킨다.
  • 표준 MuJoCo 연속 제어 환경에 프레임워크를 적용하여 성능와 데이터 효율성을 평가한다.

실험 결과

연구 질문

  • RQ1MFRL의 탐색 행동은 MBRL 전용 데이터 수집 방식에 비해 학습된 전방 동역학 모델의 품질을 향상시키는가?
  • RQ2MFRL의 가치 함수를 MPC 계획에 통합하면 표준 MPC나 MFRL 단독 사용보다 성능 향상이 이루어지는가?
  • RQ3모델 근사 오차 상황에서 MPC의 소프트-그리디 액션 선택 전략은 그리디 또는 무작위 액션 선택 전략에 비해 어떻게 비교되는가?
  • RQ4제안된 프레임워크는 MFRL 수준의 성능를 달성하면서도 얼마나 샘플 복잡도를 줄이는가?
  • RQ5완벽한 동역학 모델이나 제한된 상태공간 구조에 의존하는 기존 접근 방식의 한계는 무엇인가?

주요 결과

  • MPC-MFRL는 상태 최신 기술 수준의 MFRL 방법과 유사한 성능를 달성하면서도 환경 상호작용 횟수를 크게 줄여 MBRL 수준의 데이터 효율성을 확보한다.
  • MFRL를 통한 데이터 수집 방식은 학습된 전방 동역학 모델의 정확도를 향상시켜 MPC 계획 성과를 향상시킨다.
  • MFRL 가치 함수를 MPC 계획에 통합함으로써 장기적인 성능 향상과 근사 모델에서의 과도한 추정 오차 감소 효과를 얻을 수 있다.
  • 제안된 소프트-그리디 액션 선택 전략은 MPC에서 다양한 모델 복잡도 상황에서 그리디 및 무작위 액션 선택 전략을 항상 능가한다.
  • 경험적 결과는 MPC-MFRL가 단독 MFRL나 MPC를 초월하여 특히 복잡한 MuJoCo 작업에서 뛰어난 성능를 보임을 보여준다.
  • 이 프레임워크는 임의의 상태공간과 액션 공간에서 효과적으로 작동하며, 이상적인 동역학 모델이나 2차원 상태 구조에 대한 가정이 필요하지 않다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.