Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchically Integrated Models: Learning to Navigate from Heterogeneous Robots

Katie Kang, Gregory Kahn|arXiv (Cornell University)|2021. 06. 24.
Modular Robots and Swarm Intelligence인용 수 1
한 줄 요약

이 논문은 이질적인 로봇 데이터셋에서 별도의 인식 모델과 동역학 모델을 훈련하고, 테스트 시계에 계층적으로 통합하여 강건한 주행을 가능하게 하는 딥 강화학습 알고리즘 HInt를 제안한다. 배포 로봇의 물리적 능력을 고려함으로써 HInt는 이동 주행 작업에서 전통적인 계층 정책과 단일 소스 방법보다 뛰어난 성능을 발휘한다.

ABSTRACT

Deep reinforcement learning algorithms require large and diverse datasets in order to learn successful policies for perception-based mobile navigation. However, gathering such datasets with a single robot can be prohibitively expensive. Collecting data with multiple different robotic platforms with possibly different dynamics is a more scalable approach to large-scale data collection. But how can deep reinforcement learning algorithms leverage such heterogeneous datasets? In this work, we propose a deep reinforcement learning algorithm with hierarchically integrated models (HInt). At training time, HInt learns separate perception and dynamics models, and at test time, HInt integrates the two models in a hierarchical manner and plans actions with the integrated model. This method of planning with hierarchically integrated models allows the algorithm to train on datasets gathered by a variety of different platforms, while respecting the physical capabilities of the deployment robot at test time. Our mobile navigation experiments show that HInt outperforms conventional hierarchical policies and single-source approaches.

연구 동기 및 목표

  • 한 대의 로봇을 사용해 대규모 인식 기반 주행 데이터를 수집하는 데 드는 높은 비용을 해결하기 위해.
  • 딥 강화학습 알고리즘이 다름의 동역학을 가진 로봇들로부터 수집된 이질적인 데이터셋을 효과적으로 활용할 수 있도록 하기 위해.
  • 테스트 시 계획 단계에서 배포 로봇의 물리적 제약 조건을 존중하는 방법을 개발하기 위해.
  • 인식 모델과 동역학 모델을 계층적 프레임워크에서 통합함으로써 주행 성능을 향상시키기 위해.

제안 방법

  • HInt는 동역학이 다른 여러 플랫폼에서 수집된 다양한 로봇 데이터셋에서 별도의 인식 모델과 동역학 모델을 훈련한다.
  • 테스트 시계에 HInt는 인식 모델과 동역학 모델을 계층적으로 통합하여, 배포 로봇의 물리적 능력을 존중하는 동작을 생성한다.
  • 계층적 통합은 고수준 인식 결정과 저수준 동역학 제어를 조합한 계획을 가능하게 한다.
  • 이 방법은 이중 수준의 의사결정 구조를 사용한다: 고수준 정책은 인식 기반으로 주행 목표를 선택하고, 저수준 정책은 동역학 모델을 사용해 운동 계획을 실행한다.
  • 인식과 동역학 학습을 분리함으로써 이 프레임워크는 로봇 간 전이 학습을 지원한다.
  • 행동가의 동역학 한계에 제약을 두어 안전하고 실행 가능한 동작 실행을 보장한다.

실험 결과

연구 질문

  • RQ1딥 강화학습이 동역학이 다른 로봇들로부터 수집된 이질적인 로봇 데이터셋을 효과적으로 활용할 수 있는가?
  • RQ2인식 모델과 동역학 모델을 어떻게 계층적으로 통합하여, 로봇 고유의 물리적 제약 조건을 존중하면서도 주행 성능을 향상시킬 수 있는가?
  • RQ3제안된 계층적 통합 방식이 이동 주행 작업에서 기존의 계층 정책과 단일 소스 학습 접근 방식보다 뛰어나게 성능을 발휘하는가?
  • RQ4이 방법은 테스트 시 배포 단계에서 다양한 로봇 플랫폼으로 얼마나 일반화되는가?

주요 결과

  • HInt는 이동 주행 작업에서 기존의 계층 정책보다 뛰어난 주행 성능을 달성한다.
  • 이 방법은 인식 모델과 동역학 모델을 배포 로봇의 물리적 능력을 존중하는 방식으로 통합함으로써 다양한 로봇 플랫폼 간에 성공적으로 일반화된다.
  • HInt는 다양한 이질적인 데이터셋에서 훈련할 경우 더 높은 샘플 효율성과 강건성을 보인다.
  • 모델의 계층적 통합은 종단 간 또는 단일 소스 학습 접근 방식보다 더 나은 행동 계획을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.