Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Interactive Reinforcement Learning for Path Following of Autonomous Underwater Vehicle

Qilei Zhang, Jinying Lin|arXiv (Cornell University)|2020. 01. 10.
Underwater Vehicles and Communication Systems참고 문헌 31인용 수 6
한 줄 요약

이 논문은 인간의 형태를 띤 보상과 환경 보상의 조합을 통해 자율 수중 항법 차량(AUV)의 경로 추종 학습을 가속화하는 딥 인터랙티브 강화학습(Dirl) 프레임워크를 제안한다. 학습 중 인간 피드백을 통합하고 환경 보상에 의해 지속적인 적응을 가능하게 함으로써, 순수하게 환경 보상에 의존해 훈련된 DQN 에이전트에 비해 더 빠른 수렴 속도와 뛰어난 강건성을 달성하였으며, 시뮬레이션에서 순수 인간 보상 방법에 맞추거나 그 이상의 성능을 보였다.

ABSTRACT

Autonomous underwater vehicle (AUV) plays an increasingly important role in ocean exploration. Existing AUVs are usually not fully autonomous and generally limited to pre-planning or pre-programming tasks. Reinforcement learning (RL) and deep reinforcement learning have been introduced into the AUV design and research to improve its autonomy. However, these methods are still difficult to apply directly to the actual AUV system because of the sparse rewards and low learning efficiency. In this paper, we proposed a deep interactive reinforcement learning method for path following of AUV by combining the advantages of deep reinforcement learning and interactive RL. In addition, since the human trainer cannot provide human rewards for AUV when it is running in the ocean and AUV needs to adapt to a changing environment, we further propose a deep reinforcement learning method that learns from both human rewards and environmental rewards at the same time. We test our methods in two path following tasks---straight line and sinusoids curve following of AUV by simulating in the Gazebo platform. Our experimental results show that with our proposed deep interactive RL method, AUV can converge faster than a DQN learner from only environmental reward. Moreover, AUV learning with our deep RL from both human and environmental rewards can also achieve a similar or even better performance than that with the deep interactive RL method and can adapt to the actual environment by further learning from environmental rewards.

연구 동기 및 목표

  • AUV 경로 추종을 위한 딥 강화학습(DRL)에서 보상의 희박성과 느린 학습 문제를 해결한다.
  • 기존 DRL 방법이 순수하게 환경 보상에 의존해 샘플 효율성이 열 劣한 문제를 해결한다.
  • 형태화된 보상으로 인간 전문 지식을 통합한 인터랙티브 강화학습(IRL)을 도입해 정책 학습을 가속화한다.
  • 인간 보상과 환경 보상을 모두 활용하는 하이브리드 학습 프레임워크를 개발해 실제 해양 환경에서의 장기적 적응 능력을 확보한다.
  • Gazebo 시뮬레이션 플랫폼을 사용해 직선 및 정현파 경로 추적 두 가지 경로 추종 과제에서 제안된 방법의 효과성을 입증한다.

제안 방법

  • 인간이 제공한 보상과 환경이 제공한 보상을 통합해 학습 신호를 형태화하는 딥 인터랙티브 강화학습(Dirl) 방법을 제안한다.
  • 원시 상태 관측값(예: 위치, 속도, 헤딩)을 액션 Q-값으로 매핑하기 위해 딥 Q-네트워크(DQN)를 가치 함수 근사기로 사용한다.
  • 빠른 학습을 위한 인간이 지정한 형태화된 보상과 장기적 적응을 위한 환경 정의의 희박한 보상을 조합한 하이브리드 보상 함수를 설계한다.
  • 이중 단계 학습 과정을 구현: 초기 단계에서는 인간 피드백을 통해 수렴 속도를 가속화하고, 이후 단계에서는 환경 보상에 의존해 강건성을 확보한다.
  • 직선 및 정현파 경로 추적 두 가지 경로 추종 과제를 위해 Gazebo 기반 시뮬레이션 환경에서 에이전트를 훈련하고 평가한다.
  • 커리큘럼 학습 원칙을 적용해 훈련이 진행됨에 따라 점차 인간 피드백을 줄이고 환경 보상에 더 의존하도록 한다.

실험 결과

연구 질문

  • RQ1환경 보상만을 사용하는 표준 DQN과 비교해, 인간의 형태화된 보상과 함께 인터랙티브 강화학습을 적용할 경우 AUV 경로 추종 과제에서 샘플 복잡도를 크게 줄이고 수렴 속도를 빠르게 할 수 있는가?
  • RQ2인간 보상과 환경 보상을 조합할 경우, 동적인 불확실한 해양 환경에서 AUV 정책의 최종 성능과 강건성에 어떤 영향을 미치는가?
  • RQ3인간 피드백이 더 이상 제공되지 않는 상황에서도 인간과 환경 보상을 모두 사용해 훈련된 DRL 에이전트가 높은 성능 유지를 하고 새로운 환경 변화에 적응할 수 있는가?
  • RQ4환경 보상만, 인간 보상만, 또는 둘 다 사용한 경우, 각 에이전트의 상대적 학습 속도와 최종 추적 정확도는 어떻게 다른가?
  • RQ5하이브리드 보상 전략이 정현파 경로 추적과 같은 복잡한 경로 추종 과제에서 일반화 능력과 안정성을 얼마나 향상시키는가?

주요 결과

  • 인간 보상만으로 학습하는 DQNH 에이전트는 환경 보상만으로 학습하는 DQNE 에이전트와 동일한 추적 오차 수준을 제60회차에 도달했지만, 이 성능에 도달하는 데 20회차만 소요되어 수렴 속도가 3배 빠르다는 것을 입증했다.
  • 인간과 환경 보상을 모두 사용하는 DQNHE 에이전트는 DQNH 및 DQNE 에이전트보다 추적 오차를 더 빨리 감소시켰으며, 제25회차에 거의 최적의 성능에 도달했다.
  • DQNHE 에이전트의 누적 환경 보상은 약 20회차에 최고에 도달했고, DQNE 에이전트는 비슷한 수준에 도달하기까지 약 80회차가 소요되어 하이브리드 보상 전략이 정책 최적화 속도를 빠르게 한다는 것을 시사했다.
  • 정현파 곡선 추종 과제에서 DQNHE 에이전트는 DQNE 에이전트가 제100회차에 도달한 성능을 단 25회차 만에 달성해 뛰어난 샘플 효율성을 보였다.
  • 인간 피드백이 중단된 후에도 DQNHE 에이전트는 높은 성능과 적응 능력을 유지했으며, 실제 운영 환경에서의 강건성을 입증했다.
  • 제안된 딥 인터랙티브 강화학습 방법은 순수하게 환경 보상만을 사용하는 표준 DQN보다 더 빠르고 안정적인 학습을 가능하게 했으며, AUV 제어에서 인간이 개입하는 형태화된 보상의 효과성을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.