Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning based Air Combat Maneuver Generation

Muhammed Murat Ozbek, Emre Koyuncu|arXiv (Cornell University)|2022. 01. 14.
Guidance and Control Systems인용 수 5
한 줄 요약

이 논문은 투자식 지연 딥 디터미니스틱 정책 기반 알고리즘(TD3)과 뒤처진 경험 재구성(HER)을 사용하여 무인 항공기(UAV)의 자율 공중 전투 기동을 위한 강화학습 기반 접근법을 제안한다. 이 방법은 고정된 회전 반경을 가진 두빙 차량 모델을 사용하여 2차원 공간에서 최적의 경로를 탐색할 수 있도록 하며, 복잡한 전투 상황에서도 뛰어난 샘플 효율성과 강건성을 입증한다.

ABSTRACT

The advent of artificial intelligence technology paved the way of many researches to be made within air combat sector. Academicians and many other researchers did a research on a prominent research direction called autonomous maneuver decision of UAV. Elaborative researches produced some outcomes, but decisions that include Reinforcement Learning(RL) came out to be more efficient. There have been many researches and experiments done to make an agent reach its target in an optimal way, most prominent are Genetic Algorithm(GA) , A star, RRT and other various optimization techniques have been used. But Reinforcement Learning is the well known one for its success. In DARPHA Alpha Dogfight Trials, reinforcement learning prevailed against a real veteran F16 human pilot who was trained by Boeing. This successor model was developed by Heron Systems. After this accomplishment, reinforcement learning bring tremendous attention on itself. In this research we aimed our UAV which has a dubin vehicle dynamic property to move to the target in two dimensional space in an optimal path using Twin Delayed Deep Deterministic Policy Gradients (TD3) and used in experience replay Hindsight Experience Replay(HER).We did tests on two different environments and used simulations.

연구 동기 및 목표

  • 고정 날개 UAV를 위한 딥 강화학습 기반 자율 공중 전투 기동 시스템 개발.
  • 동적이고 적대적인 2차원 전투 환경에서 샘플 효율성과 정책 강건성 향상.
  • TD3와 HER를 활용하여 희박한 보상 환경에서 학습하고 최적 경로 계획 달성.
  • 일반화성과 성능을 검증하기 위해 두 가지 서로 다른 시뮬레이션 환경에서 접근법 검증.
  • 공중 도그패티팅 시나리오에서 인공지능 기반 자율 의사결정의 발전 기여.

제안 방법

  • UAV는 고정된 회전 반경을 가진 비홀로노믹 운동 제약을 가진 두빙 차량 모델로 모델링된다.
  • 정책 네트워크는 연속적 제어 알고리즘인 투자식 지연 딥 디터미니스틱 정책 기반 알고리즘(TD3)을 사용하여 훈련된다.
  • 실패한 궤적을 달성 가능한 목표로 재라벨링함으로써 샘플 효율성을 향상시키기 위해 뒤처진 경험 재구성(HER)이 통합된다.
  • 환경은 적대적 역학을 포함한 2차원 공간에서 시뮬레이션되며, 목표물과 잠재적 장애물이 포함된다.
  • 경험 재생 버퍼는 에피소드에서의 전이를 저장하여 안정적인 훈련과 오프-폴리시 학습을 가능하게 한다.
  • 보상 함수는 목표물에 가까이 가도록 유도하면서 충돌과 과도한 경로 길이에 대해 벌점을 주도록 설계된다.

실험 결과

연구 질문

  • RQ1TD3에 HER를 적용하면 2차원 UAV 환경에서 최적의 공중 전투 기동을 효과적이고 효율적으로 학습할 수 있는가?
  • RQ2HER의 통합은 희박한 보상 환경에서의 공중 전투 시나리오에서 샘플 효율성을 어떻게 향상시키는가?
  • RQ3제안된 방법은 다양한 2차원 전투 환경 구성에 대해 얼마나 일반화되는가?
  • RQ4두빙 차량 모델은 학습된 기동의 실현 가능성과 성능에 어떤 영향을 미치는가?
  • RQ5보상 형태 설계가 수렴성과 정책 품질에 어떤 영향을 미치는가?

주요 결과

  • TD3-HER 접근법은 두 시뮬레이션 환경 모두에서 50,000개의 훈련 스텝 이내에 안정적인 훈련과 수렴을 달성했다.
  • HER는 샘플 효율성을 크게 향상시켜 희박한 보상 환경에서도 효과적인 기동을 학습할 수 있도록 했다.
  • UAV는 복잡한 2차원 환경에서 장애물을 피하면서 목표물에 성공적으로 도달하였고, 경로 최적성도 유지했다.
  • 정책은 다양한 초기 위치와 목표 위치와 같은 환경 변화에 대해 강건성을 보였다.
  • 두빙 차량 모델의 사용은 물리적으로 타당한 기동을 보장하여 실제 UAV 동역학과 일치시켰다.
  • 모의 전투 과제에서 수렴 속도와 최종 정책 성능 측면에서 베이스라인 접근법을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.