Skip to main content
QUICK REVIEW

[논문 리뷰] Map-less Navigation: A Single DRL-based Controller for Robots with Varied Dimensions

Wei Zhang, Yunfeng Zhang|arXiv (Cornell University)|2020. 02. 15.
Reinforcement Learning in Robotics참고 문헌 29인용 수 5
한 줄 요약

이 논문은 재훈련 없이 다양한 크기와 회전 속도 범위를 가진 로봇을 제어할 수 있도록 하는 차원 가변성 기반 기술 이전(DVST) 방법을 제안한다. 메타에이전트와 차원 스케일링된 로봇 간의 관측값과 정책을 스케일링하여, 미리 지도가 없는 동적 환경에서 다양한 로봇 구성에 대해 성공적인 내비게이션을 달성한다.

ABSTRACT

Deep reinforcement learning (DRL) has shown great potential in training control agents for map-less robot navigation. However, the trained agents are generally dependent on the employed robot in training or dimension-specific, which cannot be directly reused by robots with different dimensional configurations. To address this issue, a DRL-based dimension-variable robot navigation method is proposed in this paper. The proposed approach trains a meta-agent with DRL and then transfers the meta-skill to a robot with a different dimensional configuration (named dimension-scaled robot) using a method named dimension-variable skill transfer (DVST). During the training phase, the meta-agent learns to perform self-navigation with the meta-robot in a simulation environment. In the skill-transfer phase, the observations of the dimension-scaled robot are transferred to the meta-agent in a scaled manner, and the control policy generated by the meta-agent is scaled back to the dimension-scaled robot. Simulation and real-world experimental results indicate that robots with different sizes and angular velocity bounds can accomplish navigation tasks in unknown and dynamic environments without any retraining. This work greatly extends the application range of DRL-based navigation methods from the fixed dimensional configuration to varied dimensional configurations.

연구 동기 및 목표

  • DRL 기반 내비게이션 에이전트가 특정 로봇 차원에 종속되어 있어 다양한 크기의 로봇 간 재사용이 제한되는 문제를 해결한다.
  • 메타에이전트에서 다른 물리적 차원과 운동 제약 조건을 가진 로봇으로 내비게이션 정책을 제로샷 전이할 수 있도록 한다.
  • 재훈련 없이도 알려지지 않은 동적 환경에서 내비게이션 성능을 유지하는 확장 가능한 방법을 개발한다.
  • 고정 구성을 가진 로봇을 넘어서 다양한 로봇 플랫폼으로 DRL 기반 내비게이션의 적용 범위를 넓힌다.

제안 방법

  • 특정 차원과 운동 프로파일을 가진 메타로봇을 사용해 시뮬레이션 환경에서 DRL을 통해 자가 내비게이션을 학습하는 메타에이전트를 훈련시킨다.
  • 기하학적 스케일링을 사용해 차원 스케일링된 로봇의 관측값을 메타에이전트에 매핑하기 위해 차원 가변성 기반 기술 이전(DVST)을 구현한다.
  • 차원에 따라 특화된 변환을 사용해 메타에이전트의 행동 출력을 차원 스케일링된 로봇의 제어 공간으로 다시 스케일링한다.
  • 다양한 내비게이션 과제, 예를 들어 동적 장애물과 알려지지 않은 레이아웃을 포함한 시뮬레이션 환경에서 메타에이전트를 훈련시킨다.
  • 관측값과 행동의 비례 스케일링을 유지함으로써 다양한 크기와 각속도 범위를 가진 로봇에 동일한 정책을 적용한다.
  • 다양한 로봇 구성의 분포를 기반으로 메타에이전트를 훈련시켜 차원 변화에 대한 강건성을 향상시키기 위해 정책 일반화를 보장한다.

실험 결과

연구 질문

  • RQ1재훈련 없이도 동일한 DRL 기반 메타에이전트가 상당히 다른 물리적 차원을 가진 로봇으로 일반화 가능한가?
  • RQ2차원 가변성 기반 기술 이전(DVST)이 다양한 크기와 각속도 범위를 가진 로봇 간에 제로샷 정책 전이를 얼마나 효과적으로 지원하는가?
  • RQ3이전된 정책이 알려지지 않은 동적 환경에서 내비게이션 성능을 어느 정도 유지하는가?
  • RQ4다양한 차원을 가진 로봇 간에 일관된 정책 성능을 보장하는 스케일링 전략은 무엇인가?

주요 결과

  • 제안된 DVST 방법은 다양한 크기와 각속도 범위를 가진 로봇에 대해 재훈련 없이도 알려지지 않은 동적 환경에서 성공적인 내비게이션을 가능하게 한다.
  • 시뮬레이션 결과는 메타에이전트의 정책이 크기 차이가 최대 2.5배, 각속도 범위 차이가 최대 3배인 로봇 간에도 일반화됨을 보여준다.
  • 실제 환경 실험을 통해 이전된 정책이 다양한 차원을 가진 물리적 로봇에서 안정적인 내비게이션 성능을 달성함을 확인한다.
  • 장애물의 움직임이 예측 불가능한 복잡한 동적 환경에서도 높은 성공률를 유지한다.
  • 작업별 재훈련이 필요 없어지면서 새로운 로봇 구성에 대한 배포 시간과 계산 비용이 크게 감소한다.
  • 다양한 로봇 플랫폼을 통해 정책 전이의 확장성은 검증되었으며, 차원 변화에 대한 강건성이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.