[논문 리뷰] Proportional integral derivative controller assisted reinforcement learning for path following by autonomous underwater vehicles
이 논문은 비례-적분-미분(PID) 컨트롤러를 통합하여 딥 강화학습(DRL) 훈련을 지원함으로써, 자율 잠수선(AUV)에서 3D 경로 추종을 위한 새로운 딥 강화학습(DRL) 방법을 제안한다. PID 보조 방법은 조종장치, 엣류에이터, 추력의 세 가지 액추에이터로 제어를 분할하여, 시간 단위 수를 줄이고 불안정한 해류 조건에서도 안정적이고 효율적인 훈련을 가능하게 하며, 종래의 엔드 투 엔드 DRL보다 안정성과 수렴성 면에서 뛰어나다.
Control theory provides engineers with a multitude of tools to design controllers that manipulate the closed-loop behavior and stability of dynamical systems. These methods rely heavily on insights about the mathematical model governing the physical system. However, if a system is highly complex, it might be infeasible to produce a reliable mathematical model of the system. Without a model most of the theoretical tools to develop control laws break down. In these settings, machine learning controllers become attractive: Controllers that can learn and adapt to complex systems, developing control laws where the engineer cannot. This article focuses on utilizing machine learning controllers in practical applications, specifically using deep reinforcement learning in motion control systems for an autonomous underwater vehicle with six degrees-of-freedom. Two methods are considered: end-to-end learning, where the vehicle is left entirely alone to explore the solution space in its search for an optimal policy, and PID assisted learning, where the DRL controller is essentially split into three separate parts, each controlling its own actuator.
연구 동기 및 목표
- 복잡하고 불확실한 수중 환경에서 6자유도 자율 잠수선(AUV)을 제어하는 데 도전하는 것.
- 정확한 수학적 모델에 의존하는 전통적 제어 방법의 한계를 극복하여 비선형성과 외란에 대응하는 것.
- AUV 경로 추종을 위한 모델 기반 제어의 대안으로 데이터 기반 기계학습 제어(MLC)의 타당성을 탐색하는 것.
- DRL 훈련에 PID 컨트롤러를 감독 계층으로 통합하여 훈련 안정성과 수렴 속도를 향상시키는 것.
- 훈련 중에 이러한 조건을 고려하지 않은 상태에서 다양한 해류와 같은 새로운 외란에 대해 DRL 제어기가 어떻게 작동하는지 검증함으로써 일반화 능력을 입증하는 것.
제안 방법
- 3D 공간 경로 추종을 위해 에이전트가 3D 경로를 따라가도록 훈련시키기 위해 Proximal Policy Optimization(PPO) 알고리즘을 사용하여 딥 강화학습(DRL)을 수행한다.
- DRL 에이전트가 한 번에 하나의 액추에이터(조종장치, 엣류에이터, 또는 추력)만 제어하고, 나머지 두 액추에이터는 고정된 PID 컨트롤러에 의해 안정화되는 PID 보조 학습 프레임워크를 구현한다.
- 추적 오차와 제어 노력의 최소화를 위해 제곱형 비용 함수를 보상 신호로 사용한다.
- 해류가 없는 환경에서 시뮬레이션된 환경에서 DRL 에이전트를 훈련한 후, 예측되지 않은 해류 외란 조건에서 성능을 평가한다.
- 엔드 투 엔드 DRL(전체 에이전트 제어)과 PID 보조 DRL(액추에이터별 모듈화된 제어) 간의 훈련 효율성, 수렴성, 내성 강도를 비교한다.
- 고정밀 AUV 시뮬레이션 모델에서 생성된 합성 데이터를 사용하여 훈련 경로와 보상 신호를 생성한다.
실험 결과
연구 질문
- RQ1엔드 투 엔드 DRL과 비교해 볼 때, PID 보조 제어를 통한 DRL은 AUV의 3D 경로 추종을 위한 더 빠르고 안정적인 훈련을 달성할 수 있는가?
- RQ2훈련 시 해류 조건을 고려하지 않은 상태에서, DRL 제어기는 예측되지 않은 해류 외란에 대해 어떻게 작동하는가?
- RQ3PID 보조 아키텍처는 수렴에 필요한 시뮬레이션 시간 단위 수를 얼마나 줄일 수 있는가?
- RQ4재훈련 없이도 DRL 에이전트는 새로운, 이전에 훈련되지 않은 환경 조건에 일반화할 수 있는가?
- RQ5블랙박스 DNN 대비 하이브리드 PID-DRL 제어 구조를 사용할 경우 해석 가능성과 성능 사이의 상충 관계는 어떠한가?
주요 결과
- PID 보조 DRL 접근법은 엔드 투 엔드 학습 대비 제어기 훈련에 필요한 시뮬레이션 시간 단위 수를 크게 감소시켰다.
- 훈련 시 물결이 없는 환경에서 수행되었음에도 불구하고, DRL 에이전트는 다양한 강도의 해류가 존재하는 상황에서도 안정적인 3D 경로 추종을 달성했다.
- 해류 존재 시 일정한 수직 제어 편차가 관찰되어 부분적인 보상은 이루어졌지만 완전한 외란 제거는 이루어지지 않았다.
- 엔드 투 엔드 DRL 방법은 유망한 결과를 보였지만, 훈련 설정에 매우 민감하고 복잡한 보상 형태 조정이 필요로 했다.
- PID 보조 방법은 예측되지 않은 외란에 대해 뛰어난 내성 강도를 보이며, 실세계 적용에서의 일반화 가능성 잠재력을 시사했다.
- 사전 모델 지식의 부재와 탐색 및 이용을 통한 DRL의 자가 조정 능력은 전통적 제어 방법에 비해 핵심적인 장점임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.