Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Reinforcement Learning for Sequencing Behaviors

Hadi Salman, Jaskaran Grover|arXiv (Cornell University)|2018. 03. 05.
Robot Manipulation and Learning참고 문헌 6인용 수 19
한 줄 요약

이 논문은 깊이 신경망을 활용해 환경 간 일반화를 가능하게 하는 계층적 강화학습 프레임워크를 제안한다. 이 프레임워크는 시각 입력을 기반으로 로봇 주행 기술을 공동으로 학습하고 순서를 정하며, 원시 관측값에서 정책과 상태 표현을 엔드 투 엔드로 학습함으로써 수작업으로 설계된 히وري스틱이 없는 강력한 주행 성능을 달성한다.

ABSTRACT

Recent literature in the robot learning community has focused on learning robot skills that abstract out lower-level details of robot control, such as Dynamic Movement Primitives (DMPs), the options framework in hierarchical RL, and subtask policies. To fully leverage the efficacy of these macro actions, it is necessary to then sequence these primitives to achieve a given task. Our objective is to jointly learn a set of robot skills and a sequence of these learnt skills to accomplish a given task. We consider the task of navigating a robot across various environments using visual input, maximizing the distance traveled through the environment while avoiding static obstacles. Traditional planning methods to solve this problem rely on hand-crafted state representations and heuristics for planning, and often fail to generalize. In contrast, deep neural networks have proved to be powerful function approximators, successfully modeling complex control policies. In addition, the ability of such networks to learn good representations of high-dimensional sensory inputs makes them a valuable tool when dealing with visual inputs. In this project, we explore the capability of deep neural networks to learn and sequence robot skills for navigation, directly using visual input.

연구 동기 및 목표

  • 정적 장애물이 있는 다양한 환경 간 로봇 주행의 일반화 문제를 해결하기 위해.
  • 수작업으로 설계된 상태 표현과 히وري스틱에 의존하는 전통적 계획 방법의 한계를 극복하기 위해.
  • 시각 입력을 사용하여 로봇 기술과 그 순서를 엔드 투 엔드로 학습하기 위해.
  • 고차원 센서 데이터에서 효과적인 상태 표현과 제어 정책을 학습하기 위해 깊이 신경망을 활용하기 위해.
  • 기술 정책과 그 순서 정책를 함께 훈련시켜 강력한 주행 성능를 달성하기 위해

제안 방법

  • 주행을 매크로 액션(기술)과 그들을 순서 정하는 고수준 정책으로 분해하기 위해 계층적 강화학습을 사용한다.
  • 원시 시각 입력을 정책 출력으로 직접 매핑하기 위해 깊이 신경망을 사용하여 수작업으로 설계된 특징이 필요 없도록 한다.
  • 장애물을 피하면서 누적 이동 거리를 최대화하기 위해 강화학습을 통해 시스템을 훈련시킨다.
  • 저수준 기술 정책과 고수준 순서 정책을 공동 최적화 프레임워크에서 학습한다.
  • 깊이 신경망을 통한 함수 근사 기법을 사용하여 시각 입력과 제어 정책 간의 복잡한 비선형 관계를 모델링한다.
  • 시각 관측값을 입력으로 사용하여 계층적 정책 구조를 최적화하기 위해 정책 기반 강화학습 방법을 적용한다.

실험 결과

연구 질문

  • RQ1계층적 강화학습 프레임워크는 수작업으로 설계된 특징 없이 시각 입력에서 효과적인 주행 기술을 학습할 수 있는가?
  • RQ2공동으로 훈련된 기술 정책과 순서 정책는 정적 장애물이 있는 다양한 환경에서 얼마나 잘 일반화되는가?
  • RQ3원시 시각 데이터에서 정책과 표현을 엔드 투 엔드로 학습하는 것이 수작업 히وري스틱이 포함된 전통적 계획 방법보다 우수한가?
  • RQ4깊이 신경망은 장기 주행 작업을 지원하는 의미 있는 상태 표현을 어느 정도 효과적으로 학습할 수 있는가?
  • RQ5평탄한 강화학습 접근법에 비해 계층적 구조는 표본 효율성과 작업 성능을 향상시키는가?

주요 결과

  • 제안된 계층적 강화학습 프레임워크는 원시 시각 입력에서 직접 주행 정책을 학습하여 다양한 환경에서 강력한 성능을 달성한다.
  • 수작업으로 설계된 상태 표현과 히وري스틱에 의존하는 전통적 계획 방법보다 더 우수한 일반화 성능를 보인다.
  • 깊이 신경망은 원시 시각 관측값에서 기술 정책과 그 순서 정책를 효과적으로 학습한다.
  • 기술 정책과 순서 정책를 함께 훈련시킴으로써 장거리 주행이 가능해지며, 장애물을 피할 수 있다.
  • 깊이 신경망의 표현 학습 능력 덕분에 예측 불가능한 환경에도 더 잘 적응함을 보였다.
  • 기본 방법에 비해 더 높은 누적 이동 거리를 기록하여 효과적인 기술 순서 정책를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.