Skip to main content
QUICK REVIEW

[논문 리뷰] Learning World Transition Model for Socially Aware Robot Navigation

Yuxiang Cui, Haodong Zhang|arXiv (Cornell University)|2020. 11. 08.
Evacuation and Crowd Dynamics참고 문헌 21인용 수 5
한 줄 요약

이 논문은 2차원 레이저 스캔에서 미래 관측치와 보상을 예측하는 심층 세계 전이 모델을 사용하여 사회적 인지 능력을 갖춘 로봇 주행을 위한 모델 기반 강화학습 프레임워크를 제안한다. 자가 운동을 분리하여 스택형 국소 장애물 지도를 생성함으로써 샘플 효율성을 향상시켜 실제 상호작용 데이터를 최소로 사용하면서도 시뮬레이션 및 실제 환경에서 모두 높은 성공률을 달성하며, 암시적 학습 및 모델-무료 강화학습 기반선보다 뛰어난 성능을 보인다.

ABSTRACT

Moving in dynamic pedestrian environments is one of the important requirements for autonomous mobile robots. We present a model-based reinforcement learning approach for robots to navigate through crowded environments. The navigation policy is trained with both real interaction data from multi-agent simulation and virtual data from a deep transition model that predicts the evolution of surrounding dynamics of mobile robots. The model takes laser scan sequence and robot's own state as input and outputs steering control. The laser sequence is further transformed into stacked local obstacle maps disentangled from robot's ego motion to separate the static and dynamic obstacles, simplifying the model training. We observe that our method can be trained with significantly less real interaction data in simulator but achieve similar level of success rate in social navigation task compared with other methods. Experiments were conducted in multiple social scenarios both in simulation and on real robots, the learned policy can guide the robots to the final targets successfully while avoiding pedestrians in a socially compliant manner. Code is available at https://github.com/YuxiangCui/model-based-social-navigation

연구 동기 및 목표

  • 샘플 비효율성 문제를 해결하기 위해 사회적 인지 능력을 갖춘 로봇 주행 정책을 훈련하는 데에 초점을 맞춘다.
  • 변화하는 주변 환경을 모델링하여 동적 보행자 환경에서의 일반화 능력과 안전성을 향상시킨다.
  • 합성 데이터 생성을 통해 광범위한 실제 세계 상호작용 데이터 의존도를 줄인다.
  • 자기지도 세계 모델을 통해 정책을 직접 실제 로봇에 전이할 수 있도록 한다.
  • 분리된 국소 장애물 지도를 통해 정적 및 동적 장애물을 구분함으로써 의사결정 능력을 향상시킨다.

제안 방법

  • 자기지도 방식으로 훈련된 심층 세계 전이 모델이 현재 레이저 스캔과 로봇 상태에서 미래 레이저 관측치와 관련 보상을 예측한다.
  • 자기 운동을 분리하여 레이저 스캔 시퀀스를 스택형 국소 장애물 지도로 변환함으로써 정적 및 동적 장애물을 분리한다.
  • 정책 네트워크는 실제 상호작용 데이터와 세계 모델에 의해 생성된 풍부한 가상 데이터의 조합을 사용하여 훈련되며, 이로 인해 샘플 효율성이 향상된다.
  • 데센트라라이즈드이고 정책을 공유하는 다중 에이전트 시뮬레이션 환경을 사용하여 정책을 훈련함으로써 현실적인 사회적 상호작용 역학을 구현한다.
  • 장애물 지도 표현 방식은 정적 및 동적 장애물 간의 공간적 구분을 명확히 하여 정책 학습을 단순화한다.
  • 세계 모델을 사용해 상호작용을 시뮬레이션하고 정책 최적화를 가속화하는 모델 기반 강화학습 프레임워크를 채택한다.

실험 결과

연구 질문

  • RQ1자기지도 세계 전이 모델이 사회적 인지 능력을 갖춘 주행 정책 훈련에서 샘플 효율성을 크게 향상시킬 수 있는가?
  • RQ2레이저 스캔에서 자기 운동을 분리하는 것이 정책 성능과 훈련 안정성에 어떤 영향을 미치는가?
  • RQ3모델 기반 접근 방식이 더 적은 실제 세계 상호작용 데이터로도 모델-무료 또는 암시적 학습 기반선과 비교해 유사하거나 더 뛰어난 성능을 달성할 수 있는가?
  • RQ4시뮬레이션에서 훈련된 정책이 실제로 로봇에 성공적으로 전이될 수 있는 정도는 어느 정도인가?
  • RQ5학습된 세계 모델에서 생성된 가상 데이터 사용이 수렴 속도와 최종 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 실질적인 상호작용 데이터를 훨씬 적게 사용함에도 불구하고 FDMCA 및 MNDS보다 더 높은 평균 보상과 더 빠른 수렴 속도를 달성한다.
  • 가상 데이터 생성을 통한 모델 기반 접근 방식은 광범위한 실제 세계 상호작용을 줄이며 효율적인 정책 훈련을 가능하게 한다.
  • 시뮬레이션에서는 통과 시나리오에서 92%, 향하는 시나리오에서 90%의 성공률을 기록하며 기반선을 초월한다.
  • 실제 로봇에서는 보행자와의 안전하고 사회적으로 적합한 거리를 유지하면서 통과, 통과, 향하는 시나리오를 성공적으로 주행한다.
  • 실제 평가에서 안전 거리 준수 점수는 94.3%에 달하고, 사회적 거리 준수 점수는 89.1%에 이른다.
  • 절단 실험 결과, 예측 세계 모델과 장애물 지도 표현 방식이 성능에 결정적인 영향을 미치며, 이를 제거할 경우 수렴 속도가 느려지고 성공률도 낮아지는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.