Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning-based UAV Navigation and Control: A Soft Actor-Critic with Hindsight Experience Replay Approach

Myoung‐Hoon Lee, Jun Moon|arXiv (Cornell University)|2021. 06. 02.
Reinforcement Learning in Robotics참고 문헌 27인용 수 5
한 줄 요약

이 논문은 UAV 항법에서 샘플 효율성과 학습 최적성 향상을 위해 소프트 액터-크리틱(SAC)과 후회 경험 재현(HER)을 결합한 새로운 딥 강화학습 알고리즘인 SACHER를 제안한다. 실패한 경로로부터도 뒤돌아보는 목표를 통해 학습할 수 있도록 함으로써, SAC 및 DDPG에 비해 더 빠른 수렴 속도와 훨씬 높은 성공률을 달성하였으며, 복잡한 장애물 환경에서 2,000 에피소드 중 568개의 성공 경로를 기록하였다.

ABSTRACT

In this paper, we propose SACHER (soft actor-critic (SAC) with hindsight experience replay (HER)), which constitutes a class of deep reinforcement learning (DRL) algorithms. SAC is known as an off-policy model-free DRL algorithm based on the maximum entropy framework, which outperforms earlier DRL algorithms in terms of exploration, robustness and learning performance. However, in SAC, maximizing the entropy-augmented objective may degrade the optimality of learning outcomes. HER is known as a sample-efficient replay method that enhances the performance of off-policy DRL algorithms by allowing the agent to learn from both failures and successes. We apply HER to SAC and propose SACHER to improve the learning performance of SAC. More precisely, SACHER achieves the desired optimal outcomes faster and more accurately than SAC, since HER improves the sample efficiency of SAC. We apply SACHER to the navigation and control problem of unmanned aerial vehicles (UAVs), where SACHER generates the optimal navigation path of the UAV under various obstacles in operation. Specifically, we show the effectiveness of SACHER in terms of the tracking error and cumulative reward in UAV operation by comparing them with those of state-of-the-art DRL algorithms, SAC and DDPG. Note that SACHER in UAV navigation and control problems can be applied to arbitrary models of UAVs.

연구 동기 및 목표

  • 높은 탐색성과 강건성에도 불구하고 목표 도달 성능이 최적화되지 않는 SAC의 문제를 해결하기 위해.
  • 후회 경험 재현(HER)을 활용하여 UAV 제어를 위한 딥 강화학습의 샘플 효율성을 향상시키기 위해.
  • 정밀한 UAV 모델 또는 환경 지식이 없이도 복잡한 장애물이 있는 환경에서 신뢰할 수 있고 최적의 UAV 경로 계획을 가능하게 하기 위해.
  • SAC의 안정적이고 엔트로피 최대화 프레임워크를 통합하여 연속 제어 과제에서 DDPG의 불안정성과 열악한 수렴 문제를 해결하기 위해.
  • SACHER가 다양한 환경 조건에서 정확하고 안정적인 항법 경로를 생성하는 데 효과적인지 검증하기 위해.

제안 방법

  • SACHER는 소프트 액터-크리틱(SAC)과 후회 경험 재현(HER)을 통합하여, 재현 버퍼를 초기 목표를 함께 저장하도록 수정한다.
  • 학습 중에 SACHER는 각 에피소드 동안 방문한 상태들로부터 추가 목표를 샘플링하고, 실패한 경로를 새로운 목표에 대해 성공으로 재평가한다.
  • 알고리즘은 희소 이진 보상 함수를 사용하지만, 실패한 전이에 의미 있는 후회 보상을 할당하여 정책 최적화를 향상시킨다.
  • SACHER는 탐색을 보장하기 위해 SAC의 최대 엔트로피 목표를 유지하면서도, HER를 통해 최종 정책의 최적성과 수렴 속도를 향상시킨다.
  • SACHER는 재현 버퍼를 사용하는 SAC의 옹호 학습을 적용하지만, 샘플 재사용을 향상시키기 위해 목표 조건부 경험 재현을 확장한다.
  • 목표 조건부 재현 메커니즘을 통해 에이전트는 성공적일 수도 있고 실패한 에피소드일 수도 있는 모든 데이터로부터 학습할 수 있으며, 이는 데이터 효율성을 크게 향상시킨다.

실험 결과

연구 질문

  • RQ1엔트로피 최대화가 최종 성능을 떨어뜨릴 수 있는 연속 제어 과제에서 HER가 SAC의 최적성 향상에 기여할 수 있는가?
  • RQ2장애물이 있는 환경에서 UAV 항법에서 SACHER는 SAC 및 DDPG에 비해 샘플 효율성과 성공률 측면에서 어떻게 비교되는가?
  • RQ3모델 특화 조정 없이도 SACHER는 다양한 UAV 모델과 환경 설정에 일반화 가능한가?
  • RQ4SAC에 HER를 통합함으로써 DDPG 기반 HER 접근법에서 관찰된 불안정성 문제를 완화할 수 있는가?
  • RQ5후회 학습은 복잡한 UAV 항법 과제에서 수렴 속도를 얼마나 가속화하고 최종 경로 정확도를 얼마나 향상시키는가?

주요 결과

  • SACHER는 16개의 장애물이 있는 환경에서 2,000 에피소드 중 568개의 성공 항법 경로를 기록한 반면, SAC는 33개, DDPG는 13개에 그쳤다.
  • SACHER의 누적 보상은 약 -31에 안정화되어 학습 후 안정적이고 일관된 성능을 나타내었다.
  • SACHER로 제어된 헥사로터 UAV는 장애물을 피하면서 착륙 지점에 성공적으로 도착한 반면, SAC나 DDPG로 제어된 UAV는 그렇지 못했다.
  • SACHER가 생성한 최적 경로와 실제 UAV 궤적 간의 추적 오차는 근본적으로 무시할 수 있었으며, 높은 경로 따라하기 정확도를 보여주었다.
  • 낮은 누적 보상에도 불구하고, SACHER는 초기 학습 단계 동안에도 부드럽고 안정적인 UAV 궤적을 유지하였다.
  • 환경 설정의 변화, 즉 높은 속도(v₁=8)와 장애물 수 증가(N=16)에도 불구하고 SACHER는 효과적으로 일반화되었으며, 높은 성공률를 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.