[논문 리뷰] Aggressive Quadrotor Flight Using Curiosity-Driven Reinforcement Learning
이 논문은 사전 정의된 경로 없이 종단 간 공격적인 큐드로터 비행을 가능하게 하기 위해 유사도 기반의 궁금증 모듈과 분기 구조 탐색(BSE)을 갖춘 궁금증 기반 딥 강화학습 방법을 제안한다. 이 방법은 학습을 가속화하고 정책의 강건성을 향상시키며 뛰어난 시뮬레이션에서 실제 환경으로의 전이 성능을 확보한다. 슬라롬 및 좁은 창문 미션에서의 시뮬레이션 및 실제 실험에서 기준 RL 및 경로 계획 기반 방법을 모두 능가한다.
The ability to perform aggressive movements, which are called aggressive flights, is important for quadrotors during navigation. However, aggressive quadrotor flights are still a great challenge to practical applications. The existing solutions to aggressive flights heavily rely on a predefined trajectory, which is a time-consuming preprocessing step. To avoid such path planning, we propose a curiosity-driven reinforcement learning method for aggressive flight missions and a similarity-based curiosity module is introduced to speed up the training procedure. A branch structure exploration (BSE) strategy is also applied to guarantee the robustness of the policy and to ensure the policy trained in simulations can be performed in real-world experiments directly. The experimental results in simulations demonstrate that our reinforcement learning algorithm performs well in aggressive flight tasks, speeds up the convergence process and improves the robustness of the policy. Besides, our algorithm shows a satisfactory simulated to real transferability and performs well in real-world experiments.
연구 동기 및 목표
- 공격적인 큐드로터 비행 미션에서 시간이 많이 소요되는 경로 계획이 필요 없도록 하는 것.
- 부족한 보상 문제를 해결하기 위해 불안정한 고속 큐드로터 제어에 대한 강화학습에서 발생하는 문제를 해결하는 것.
- 유사도 기반 궁금증 모듈을 통해 학습 효율성과 정책의 강건성을 향상시키는 것.
- 분기 구조 탐색(BSE) 전략을 활용하여 시뮬레이션-실제 전이 성능을 향상시키는 것.
- 시뮬레이션에서 학습된 정책를 직접 실제 공격적인 비행 작업에 배포할 수 있도록 하는 것.
제안 방법
- 유사도 기반 궁금증 모듈은 상태(위치 및 속도)의 유사도를 기반으로 내재 보상을 계산하여 보상이 흐린 환경에서의 탐색을 장려한다.
- 이 방법은 TD3 알고리즘과 궁금증 모듈을 통합하여 종단 간 제어 정책 학습을 위한 궁금증 기반 TD3 에이전트를 구성한다.
- BSE(분기 구조 탐색) 전략은 다수의 액션 분기를 허용하여 학습 다양성을 향상시키고, 정책의 일반화 및 강건성을 향상시킨다.
- 장애물의 위치와 자세를 랜덤하게 샘플링하여 학습 중 환경 적응 능력을 향상시킨다.
- 정책은 시뮬레이션에서만 학습되고, 정밀 조정 없이 실제 실험에 직접 배포된다.
- 상태 관측치는 큐드로터의 위치, 속도 및 장애물 기하학적 정보를 포함하여 실시간 의사결정을 가능하게 한다.
실험 결과
연구 질문
- RQ1궁금증 기반 강화학습 접근법이 사전 정의된 경로 없이도 공격적인 큐드로터 비행 정책를 효과적으로 학습시킬 수 있는가?
- RQ2유사도 기반 궁금증 모듈은 보상이 흐린 공격적인 비행 작업에서 샘플 효율성과 수렴 속도를 어떻게 향상시키는가?
- RQ3BSE 전략은 학습된 정책의 강건성과 시뮬레이션-실제 전이 성능을 어느 정도 향상시키는가?
- RQ4제안된 방법은 경로 계획 기반 접근법과 표준 RL 기준선에 비해 성능 및 전이 성능에서 어떻게 비교되는가?
- RQ5시뮬레이션에서 학습된 정책는 실제 큐드로터에서 재학습 없이도 공격적인 비행 작업에 직접 배포될 수 있는가?
주요 결과
- 슬라롬 경로 미션에서 본 방법은 평균 위치 오차 0.044m와 평균 회전 오차 2.06°를 기록하여 비선형 추적 제어기(0.057m 및 3.17°)와 TD3 기준선(0.456m 및 5.31°)을 모두 능가했다.
- 좁은 창문 미션에서 본 방법은 위치 오차 0.187m와 회전 오차 6.02°를 기록하여 TD3 기준선(0.431m 및 8.81°)보다 뚜렷이 우수했다.
- 시뮬레이션-실제 위치 차이는 0.12m, 각도 차이는 3.8°였으며, 이는 시뮬레이션과 실제 도메인 간 격차가 존재함에도 불구하고 강력한 전이 성능을 보여주었다.
- 궁금증과 BSE의 조합은 표준 TD3에 비해 시뮬레이션-실제 궤적 불일치를 30% 감소시켜 강건성을 향상시켰다.
- 제거 실험을 통해 궁금증과 BSE가 각각 성능과 전이 성능 향상에 기여했으며, 전체 방법이 가장 우수한 성능을 달성했다.
- 시뮬레이션에서 학습된 정책는 재학습 없이도 실제 환경에서 공격적인 비행 작업을 성공적으로 수행하여 직접적인 시뮬레이션-실제 배포 가능성을 검증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.