Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Sequence Robot Behaviors for Visual Navigation

Hadi Salman, Puneet K. Singhal|arXiv (Cornell University)|2018. 03. 05.
Reinforcement Learning in Robotics참고 문헌 19인용 수 7
한 줄 요약

이 논문은 단일 카메라 영상 입력만을 사용하여 저수준의 로봇 행동을 학습하고 순서를 정하는 계층적 강화 학습 프레임워크를 제안한다. 환경에 맞는 저수준 정책들 사이에서 동적으로 선택하는 메타정책을 학습함으로써, 복합 환경에서 개별 정책이나 수작업으로 설계된 순서화 방식보다 훨씬 높은 성공률과 누적 보상을 달달한다.

ABSTRACT

Recent literature in the robotics community has focused on learning robot behaviors that abstract out lower-level details of robot control. To fully leverage the efficacy of such behaviors, it is necessary to select and sequence them to achieve a given task. In this paper, we present an approach to both learn and sequence robot behaviors, applied to the problem of visual navigation of mobile robots. We construct a layered representation of control policies composed of low- level behaviors and a meta-level policy. The low-level behaviors enable the robot to locomote in a particular environment while avoiding obstacles, and the meta-level policy actively selects the low-level behavior most appropriate for the current situation based purely on visual feedback. We demonstrate the effectiveness of our method on three simulated robot navigation tasks: a legged hexapod robot which must successfully traverse varying terrain, a wheeled robot which must navigate a maze-like course while avoiding obstacles, and finally a wheeled robot navigating in the presence of dynamic obstacles. We show that by learning control policies in a layered manner, we gain the ability to successfully traverse new compound environments composed of distinct sub-environments, and outperform both the low-level behaviors in their respective sub-environments, as well as a hand-crafted selection of low-level policies on these compound environments.

연구 동기 및 목표

  • 모바일 로봇이 시각 피드백 기반으로 학습된 행동들을 순서화하여 복합적이고 복합적인 환경에서 자율적으로 내비게이션할 수 있도록 하는 것.
  • 동적 또는 이질적인 환경에서 수작업으로 설계된 행동 선택 방식과 고정된 저수준 정책의 한계를 극복하는 것.
  • 오직 원시 시각 관측값만을 사용하여 다양한 하위 환경에 일반화할 수 있는 메타정책을 개발하는 것.
  • 행동 순서를 학습하는 것이 개별 저수준 정책과 결정론적 수작업 정책 선택 방식보다 성능을 향상시킨다는 것을 입증하는 것.

제안 방법

  • 프레임워크는 두 수준의 계층적 아키텍처를 사용한다: 저수준 정책들은 깊이 강화 학습을 통해 원시 단일 카메라 입력을 사용하여 특정 환경에서 이동 및 장애물 회피 행동을 학습한다.
  • 메타레벨 정책은 깊이 강화 학습을 통해 현재 시각 관측값에 기반해 가장 적절한 저수준 정책을 선택하도록 학습된다.
  • 저수준 정책들은 각각 고유한 시각적 및 구조적 특성을 지닌 별도의 하위 환경(예: 질감 있는 벽, 험한 지형, 미로처럼 생긴 길)에 맞게 맞춤화된다.
  • 메타정책은 여러 하위 환경을 조합한 복합 환경에서 학습되어 일반화 및 적응적 전환을 장려한다.
  • 시스템은 시간적 추상화를 포함한 마르코프 결정 과정(MDP) 수식을 사용하여 행동 순서화를 계층적 의사결정 과정으로 모델링한다.
  • 학습은 Gazebo를 사용한 시뮬레이션에서 수행되며, 정적 및 동적 장애물 환경에서의 평가를 통해 내구성을 테스트한다.

실험 결과

연구 질문

  • RQ1오직 시각 입력만을 사용해 학습된 메타정책이 복합 환경 내에서 개별 정책보다 효과적으로 저수준 로봇 행동을 순서화하여 더 높은 성공률을 달성할 수 있는가?
  • RQ2수작업으로 정의된 규칙에 기반해 행동을 선택하는 결정론적 정책과 비교해, 학습된 메타정책의 성능은 어떠한가?
  • RQ3혼합된 시각 입력에서 학습된 메타정책이 다양한 하위 환경으로의 일반화 능력은 어느 정도인가?
  • RQ4행동 순서를 학습하는 것이 단지 저수준 정책을 사용하는 것보다 누적 보상과 작업 성공률 향상에 기여하는가?

주요 결과

  • 학습된 메타정책은 복합 환경에서 10개의 에피소드 평균 누적 보상 988.5를 기록했으며, 수작업 정책(669.3)과 저수준 정책(408.9)보다 뚜렷이 높았다.
  • 메타정책은 복합 환경에서 전체 경로를 성공적으로 통과했으며 성공률 80%를 기록했고, 개별 저수준 정책는 복합 설정에서 완전히 실패(성공률 0%)했다.
  • 메타정책은 시각 피드백에 기반해 행동을 적응적으로 전환하며, 직선 경로에서는 π₁, 도전 경로에서는 π₂를 사용함으로써 강건한 내비게이션을 달성했다.
  • 메타정책이 행동을 유연하게 혼합함으로써, 저수준 정책를 고립적으로 사용했을 때 발생한 충돌을 방지할 수 있었다. 이는 각 정책가 훈련된 환경 내에서도 마찬가지였다.
  • 시스템은 저수준 정책가 원래의 환경에서나 수작업 정책보다 높은 성능을 달성했으며, 이는 학습된 순서화의 이점을 입증한다.
  • 메타정책은 서로 다른 하위 환경들로 구성된 새로운 복합 환경에도 효과적으로 일반화되었으며, 환경 구성 변화에 대한 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.