Skip to main content
QUICK REVIEW

[논문 리뷰] Sim-to-Real Strategy for Spatially Aware Robot Navigation in Uneven Outdoor Environments

Kasun Weerakoon, Adarsh Jagan Sathyamoorthy|arXiv (Cornell University)|2022. 05. 18.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 사전 훈련된 DRL 정책에서 유도한 중간 주의 특징을 활용하여 불균형한 외부 지형에서 안정적인 로봇 주행을 위한 시뮬레이션에서 실제 환경으로의 전이 전략을 제안한다. 이 방법은 IMU와 경사도 기울기 기반의 적응형 속도 제약을 통합한 DWA와 결합하여 실제 외부 환경에서 엔드 투 엔드 DRL 대비 진동을 13.09% 감소시키고 평균 속도를 19.33% 감소시키며 성공률을 5% 향상시켰다.

ABSTRACT

Deep Reinforcement Learning (DRL) is hugely successful due to the availability of realistic simulated environments. However, performance degradation during simulation to real-world transfer still remains a challenging problem for the policies trained in simulated environments. To close this sim-to-real gap, we present a novel hybrid architecture that utilizes an intermediate output from a fully trained attention DRL policy as a navigation cost map for outdoor navigation. Our attention DRL network incorporates a robot-centric elevation map, IMU data, the robot's pose, previous actions, and goal information as inputs to compute a navigation cost-map that highlights non-traversable regions. We compute least-cost waypoints on the cost map and utilize the Dynamic Window Approach (DWA) with velocity constraints on high cost regions to follow the waypoints in highly uneven outdoor environments. Our formulation generates dynamically feasible velocities along stable, traversable regions to reach the robot's goals. We observe an increase of 5% in terms of success rate, 13.09% of the decrease in average robot vibration, and a 19.33% reduction in average velocity compared to end-to-end DRL method and state-of-the-art methods in complex outdoor environments. We evaluate the benefits of our method using a Clearpath Husky robot in both simulated and real-world uneven environments.

연구 동기 및 목표

  • 복잡하고 불균형한 외부 환경에서 로봇 주행을 위한 딥 강화 학습의 시뮬레이션-실제 전이 갭을 해소하기 위해.
  • 언덕이나 돌 등 험한 기울기 지형에서 주행 중 로봇의 안정성 향상과 진동 감소를 위해.
  • 감지 기능과 제어 기능을 분리함으로써 시뮬레이션 및 실제 외부 환경 모두에서 일관된 성능을 달성하기 위해.
  • 중간 DRL 특징을 활용한 지형 인식 비용 지도 생성과 속도 제약이 적용된 경로 계획을 위한 하이브리드 아키텍처를 개발하기 위해.
  • 경량 또는 수동으로 주석 처리된 지형 특징에 대한 의존도를 최소화하기 위해 원시 센서 입력(점군, IMU, 자세, 목표)에서 학습하기 위해.

제안 방법

  • 새로운 주목적 기반 DRL 네트워크가 로봇 중심의 고도 지도, IMU 데이터, 로봇 자세, 이전 행동 정보 및 목표 정보를 처리하여 비이동 가능한 영역을 강조하는 주행 비용 지도를 생성한다.
  • 비용 지도를 사용하여 최소비용 웨이포인트를 계산하고, 이는 낮은 고도 기울기를 갖는 안정적인 이동 경로를 따라 로봇을 안내한다.
  • 실시간 진동 및 자세 피드백 기반으로 고속 주행을 경사지거나 험한 지형에서 방지하는 속도 공간 제약을 적용한 동적 윈도우 접근(DWA)이 개선된다.
  • DRL 훈련 중에 IMU와 고도 기울기 기반 보상이 사용되어 불안정한 영역를 식별하고 안전한 주행 행동을 장려한다.
  • 감지(중간 DRL을 통한)와 제어(DWA를 통한)를 분리함으로써 시뮬레이션에서 실제 환경 배포로의 이식 가능성을 확보한다.
  • 3D 점군을 2D 로봇 중심 고도 지도로 변환하여 입력으로 사용함으로써 비정형 외부 환경에서의 공간 인식 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1사전 훈련된 DRL 정책의 중간 특징이 외부 환경에서의 시뮬레이션-실제 전이를 향상시킬 수 있는가?
  • RQ2불균형한 지형에서 로봇의 진동을 줄이고 넘치는 것을 방지하기 위해 속도 제약을 어떻게 동적으로 적응시킬 수 있는가?
  • RQ3DRL 기반 감지와 DWA 기반 제어를 조합한 하이브리드 아키텍처가 실제 외부 환경 주행에서 엔드 투 엔드 DRL보다 우수한 성능을 내는가?
  • RQ4지형 인식 속도 제어가 복잡한 외부 환경에서 안정성과 성공률을 얼마나 향상시키는가?
  • RQ5이 방법은 특히 기울기나 험한 표면에서 시뮬레이션과 실제 환경 모두에서 유사한 성능을 유지할 수 있는가?

주요 결과

  • 제안된 방법은 실제 외부 환경에서 엔드 투 엔드 DRL 대비 5% 높은 성공률을 달성했으며, 시나리오 2에서는 89%의 성공률, 시나리오 3에서는 78%의 성공률 기록.
  • 엔드 투 엔드 DRL 대비 평균 로봇 진동이 13.09% 감소했으며, 실제 시나리오 3에서 모든 방법 중 가장 낮은 평균 진동(0.079) 기록.
  • 엔드 투 엔드 DRL 대비 평균 주행 속도가 19.33% 감소했으며, 실제 시나리오 3에서 0.357 m/s를 기록하여 더 안전하고 제어 가능한 동작을 나타냄.
  • 엔드 투 엔드 DRL이 실제 환경 전이에서 심각한 성능 저하를 보이는 것과는 달리, 이 방법은 시뮬레이션과 실제 환경 모두에서 높은 성능 유지.
  • 적응형 속도 제약 덕분에 특히 기울기 있는 경사면에서 진동이나 불안정성에 덜 민감한 더 안정적인 궤적 생성.
  • DWA와 TERP보다 더 길지만 더 안전한 궤적을 생성하여 경로 길이보다 안정성과 진동 감소를 우선시함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.