[논문 리뷰] Learning Unmanned Aerial Vehicle Control for Autonomous Target Following
이 논문은 자율 UAV 목표 추적을 위한 안정적이고 데이터 효율적인 훈련을 가능하게 하기 위해 컨volutional 신경망 정책과 PID 제어기를 조합한 계층적 딥 강화학습 접근법을 제안한다. 저수준의 모터 동작 대신 고수준의 기준 명령을 학습함으로써, 이 방법은 시뮬레이션에서 실제 DJI 복리포터에 정책 전이를 강력하게 수행하며, 치명적인 실패를 최소화한다.
While deep reinforcement learning (RL) methods have achieved unprecedented successes in a range of challenging problems, their applicability has been mainly limited to simulation or game domains due to the high sample complexity of the trial-and-error learning process. However, real-world robotic applications often need a data-efficient learning process with safety-critical constraints. In this paper, we consider the challenging problem of learning unmanned aerial vehicle (UAV) control for tracking a moving target. To acquire a strategy that combines perception and control, we represent the policy by a convolutional neural network. We develop a hierarchical approach that combines a model-free policy gradient method with a conventional feedback proportional-integral-derivative (PID) controller to enable stable learning without catastrophic failure. The neural network is trained by a combination of supervised learning from raw images and reinforcement learning from games of self-play. We show that the proposed approach can learn a target following policy in a simulator efficiently and the learned behavior can be successfully transferred to the DJI quadrotor platform for real-world UAV control.
연구 동기 및 목표
- 모델-자유 딥 강화학습이 실제 UAV 제어에서 높은 샘플 복잡도와 불안정성 문제를 해결한다.
- 수동으로 튜닝된 제어기와 전문가 레이블이 필요한 전통적인 두 단계 파ip라인의 한계를 극복한다.
- 다양한 환경에서 일반화 가능한 인식 및 제어 정책의 엔드 투 엔드 학습을 가능하게 한다.
- 기존 PID 제어기와 딥 강화학습 정책 네트워크를 통합하여 안정적이고 안전한 훈련을 실현한다.
- 학습된 정책을 실제 물리적 DJI 복리포터 플랫폼으로 성공적으로 시뮬레이션에서 실제 환경으로 전이함을 입증한다.
제안 방법
- 제어 정책을 원시 이미지 관측을 고수준 기준 명령으로 매핑하는 단일 컨volutional 신경망(CNN)으로 표현하며, 이를 PID 제어기에 공급한다.
- 훈련을 원시 이미지 기반의 지도 학습 전처리와 자가 대결 게임을 통한 강화학습 최적화로 분해하여 정책 최적화의 안정성을 향상시킨다.
- 딥 강화학습 정책이 고정된 PID 제어기의 설정값을 생성하는 계층적 제어 아키텍처를 사용하여 학습 중 시스템의 안정성을 확보한다.
- 목표 추적 성능 기반 스칼라 보상 신호를 사용하여 정책 기울기 방법을 통해 전체 네트워크를 훈련시킨다.
- 도메인 랜덤라이제이션과 시뮬레이션 내 자가 대결을 활용하여 다양한 환경에서의 강건성과 일반화 능력을 향상시킨다.
- ROS를 통해 실제 DJI 매트릭스 100 복리포터 플랫폼에 학습된 정책을 배포하며, 지상 GPU에서 추론을 수행하고 NUC를 통한 실시간 명령 매핑을 구현한다.
실험 결과
연구 질문
- RQ1탐색 과정에서 치명적인 실패 없이 시뮬레이션에서 UAV 목표 추적을 위한 딥 강화학습 정책을 안정적으로 훈련시킬 수 있는가?
- RQ2시뮬레이션에서 훈련된 정책이 센서 노이즈, 제어 지연, 하드웨어 차이 등 실제 환경에서 얼마나 잘 일반화되는가?
- RQ3학습된 정책과 기존 PID 제어기를 조합함으로써 데이터 효율성과 훈련 안정성이 얼마나 향상되는가?
- RQ4인식-제어 정책의 엔드 투 엔드 학습이 별도의 인식 및 제어 모듈보다 더 나은 일반화 성능을 달성할 수 있는가?
- RQ5정밀 조정 없이도 시뮬레이션에서 훈련된 정책이 실제 UAV에 직접 전이되었을 때의 성능은 어떠한가?
주요 결과
- 제안된 계층적 방법은 동일한 설정에서 표준 모델-자유 강화학습과는 달리 치명적인 실패 없이 안정적인 훈련을 달성했다.
- 엔드 투 엔드로 훈련된 정책는 시뮬레이션에서 목표를 목표 상태 근처의 작은 범위 내에서 5000개 이상의 시간 단위 동안 유지했으며, 정규화된 상태 공간에서 평균 편차는 0.1 이하를 기록했다.
- 다른 배경과 간섭 물체가 있는 새로운 시나리오에 대해서도 정책이 잘 일반화되었으며, 시각적 변형에 대해 중간 정도의 강건성을 보였다.
- 실제 환경 테스트에서 정책는 센서 노이즈, IMU/GPS 지연, 하드웨어 차이에도 불구하고 최대 4000개의 시간 단위(약 3분) 동안 이동하는 목표를 성공적으로 추적했다.
- 실제 환경에서 시뮬레이션 대비 제어 정밀도가 약간 감소했지만, 이는 강력한 시뮬레이션-실세계 전이 가능성을 시사한다.
- 부분적인 가림 상태에서도 정책는 효과적인 일반화를 보였지만, 간섭 물체가 목표와 시각적으로 유사할 경우 성능이 다소 저하되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.