Skip to main content
QUICK REVIEW

[논문 리뷰] Comparative Analysis of Agent-Oriented Task Assignment and Path Planning Algorithms Applied to Drone Swarms

Rohith Gandhi Ganesan, Samantha Kappagoda|arXiv (Cornell University)|2021. 01. 13.
Robotic Path Planning Algorithms참고 문헌 15인용 수 4
한 줄 요약

이 논문은 지식이 제한된 환경에서 드론 스웜의 작업 할당 및 경로 계획을 위한 탈중앙화된 강화학습 기반 프레임워크를 제안한다. 정책 그래เดียน트 네트워크를 웨이브프론트 및 퍼텐셜 필드 계획자와 결합하여 제안한다. 충돌 회피를 향상시키기 위해 허버 손실을 통한 적응형 속도 제어를 도입하였으며, 3D 시뮬레이션에서 드론 2台와 PoI 25개를 대상으로 309단계의 빠른 커버리지 성능을 기록하여 기준 L1 손실(561단계)보다 뛰어난 성능을 달성하였다.

ABSTRACT

Autonomous drone swarms are a burgeoning technology with significant applications in the field of mapping, inspection, transportation and monitoring. To complete a task, each drone has to accomplish a sub-goal within the context of the overall task at hand and navigate through the environment by avoiding collision with obstacles and with other agents in the environment. In this work, we choose the task of optimal coverage of an environment with drone swarms where the global knowledge of the goal states and its positions are known but not of the obstacles. The drones have to choose the Points of Interest (PoI) present in the environment to visit, along with the order to be visited to ensure fast coverage. We model this task in a simulation and use an agent-oriented approach to solve the problem. We evaluate different policy networks trained with reinforcement learning algorithms based on their effectiveness, i.e. time taken to map the area and efficiency, i.e. computational requirements. We couple the task assignment with path planning in an unique way for performing collision avoidance during navigation and compare a grid-based global planning algorithm, i.e. Wavefront and a gradient-based local planning algorithm, i.e. Potential Field. We also evaluate the Potential Field planning algorithm with different cost functions, propose a method to adaptively modify the velocity of the drone when using the Huber loss function to perform collision avoidance and observe its effect on the trajectory of the drones. We demonstrate our experiments in 2D and 3D simulations.

연구 동기 및 목표

  • 제한된 전역 지식을 가진 드론 스웜을 이용한 미지 환경에서 최적의 커버리지 달성 문제를 해결하기 위해.
  • 다중 드론 시스템에서 탈중앙화된 작업 할당을 위한 딥 강화학습 아키텍처를 비교하기 위해.
  • 사전 환경 지식 없이도 실시간 장애물 회피를 위한 지역 경로 계획과 작업 할당을 통합하기 위해.
  • 허버 손실을 통한 적응형 속도 제어가 궤적 안전성과 커버리지 효율성에 미치는 영향을 평가하기 위해.
  • 2D 및 3D 시뮬레이션에서 다양한 정책 네트워크와 경로 계획 전략에 대한 성능을 벤치마킹하기 위해.

제안 방법

  • 작업 할당을 위해 순서에서 순서로, 어텐션 증강 순서에서 순서로, 포인터 넷, 트랜스포머 네트워크를 활용한 정책 그래디언트 강화학습을 적용하였다.
  • 작업 할당을 두 가지 경로 계획 전략과 결합하였다: 전역 계획을 위한 격자 기반 웨이브프론트와 지역 장애물 회피를 위한 기울기 기반 퍼텐셜 필드.
  • 허버 손실 함수를 활용한 동적 속도 스케일링 방법을 제안하였으며, δ는 시야 범위와 장애물 부피의 교차 영역에 기반해 적응적으로 조정된다.
  • δ를 δ = (Vol(FoV)) / (Vol(FoV) + α(Vol(FoV) ∩ Vol(Obstacle))^β) × d/2로 정의하여 주행 중 단계 크기를 조절하였다.
  • 기준으로 L1 손실을 사용하고, 3D 시뮬레이션에서 α와 β 파라미터를 다양하게 조정한 조건에서 허버 손실과 성능을 비교하였다.
  • 모든 구성 요소를 세 번의 시뮬레이션 런에 걸쳐 평가하였으며, 커버리지 시간과 효율성의 지표로 시간 단계를 측정하였다.

실험 결과

연구 질문

  • RQ1어느 딥 강화학습 아키텍처가 미지 환경에서 드론 스웜의 작업 할당에 가장 효과적이고 효율적인가?
  • RQ2허버 손실을 통한 적응형 속도 제어는 드론 경로 계획에서 충돌 회피와 커버리지 시간에 어떤 영향을 미치는가?
  • RQ3강화학습 기반 작업 할당과 통합되었을 때 웨이브프론트 및 퍼텐셜 필드 계획자의 비교 성능는 어떠한가?
  • RQ4퍼텐셜 필드 계획자에서 다양한 비용 함수는 궤적 안정성과 안전성에 어떤 영향을 미치는가?
  • RQ5탈중앙화된 작업 할당과 지역 경로 계획의 하이브리드 접근 방식은 기준 방법보다 더 빠르고 안전한 커버리지 달성에 기여하는가?

주요 결과

  • 허버 손실 함수에서 α=1 및 β=1 조건의 적응형 δ를 사용할 경우, 3D 시뮬레이션에서 시간 단계를 309로 감소시켜 L1 손실 기준(561단계)보다 뛰어난 성능을 기록하였다.
  • 높은 α 및 β 값(예: α=4, β=1)은 너무 보수적인 행동을 유도하여 속도 업데이트가 너무 작아져 시간 단계가 469로 증가하였다.
  • 트랜스포머 기반 정책 네트워크는 뛰어난 성능를 보였지만, 시간 단계와 계산 부하 외에 구체적인 비교 지표는 제공되지 않았다.
  • 적응형 δ를 적용한 퍼텐셜 필드 계획자는 고정 속도 또는 비적응 전략보다 더 빠른 커버리지 속도와 더 부드러운 궤적을 달성하였다.
  • 웨이브프론트 계획자는 강력한 전역 경로 계획 능력을 보였지만, 다이나믹하거나 고밀도 장애물 환경에서는 기울기 기반 퍼텐셜 필드에 비해 성능이 열 劣하였다.
  • 강화학습 기반 작업 할당과 적응형 지역 계획의 조합은 전역 장애물 지식이 없이도 커버리지 시간을 크게 감소시키고 안전성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.