Skip to main content
QUICK REVIEW

[논문 리뷰] DATT: Deep Adaptive Trajectory Tracking for Quadrotor Control

Kevin Huang, Rwik Rana|arXiv (Cornell University)|2023. 10. 13.
Adaptive Dynamic Programming Control인용 수 7
한 줄 요약

DATT는 편향-피드백-적응형 아키텍처와 $ι_1$ 적응 제어를 결합한 딥 강화학습 기반 제어 프레임워크를 제안한다. 이는 실제 풍속 간섭 상황에서도 부드럽고 비가능한 궤적을 정밀하게 추적하는 데 성공한다. 기준선 대비 부드러운 궤적에서 34–54% 낮은 추적 오차를 기록하며, 추론 시간은 3.2ms 이하이며, 시뮬레이션에서 모델링되지 않은 난류에 대해 제로샷 일반화 성능을 보인다.

ABSTRACT

Precise arbitrary trajectory tracking for quadrotors is challenging due to unknown nonlinear dynamics, trajectory infeasibility, and actuation limits. To tackle these challenges, we present Deep Adaptive Trajectory Tracking (DATT), a learning-based approach that can precisely track arbitrary, potentially infeasible trajectories in the presence of large disturbances in the real world. DATT builds on a novel feedforward-feedback-adaptive control structure trained in simulation using reinforcement learning. When deployed on real hardware, DATT is augmented with a disturbance estimator using L1 adaptive control in closed-loop, without any fine-tuning. DATT significantly outperforms competitive adaptive nonlinear and model predictive controllers for both feasible smooth and infeasible trajectories in unsteady wind fields, including challenging scenarios where baselines completely fail. Moreover, DATT can efficiently run online with an inference time less than 3.2 ms, less than 1/4 of the adaptive nonlinear model predictive control baseline

연구 동기 및 목표

  • 알 수 없는 비선형 역학, 구동 제한 및 외부 간섭 상황에서 큼지막한 드론의 정밀 궤적 추적 문제를 해결한다.
  • 기존의 차등 평탄 제어기로는 도달할 수 없는, 특히 급격한 회전이나 고곡률 경로를 포함한 임의의 궤적—가능한지 여부에 관계없이—정확하게 추적할 수 있도록 한다.
  • 재학습 없이도 알 수 없는 시간에 따라 변화하는 간섭(예: 풍속, 저항판)에 대해 견고한 적응성을 확보하고 제로샷 시뮬레이션-실세계 일반화를 통해 실현한다.
  • 계산 비용이 높은 모델 예측 제어(MPC) 기준선을 능가하면서도, 추론 지연 시간이 3.2ms 이하인 실시간 성능을 유지를 한다.
  • 학습 기반 제어와 피드백 루프 $ι_1$ 적응 제어를 통합하여, 실세계 구현에서 간섭 제거 능력과 안정성을 향상시킨다.

제안 방법

  • 실세계에서의 지정된 선형 외부 간섭을 고려하여, 시뮬레이션에서 PPO를 통해 훈련한 새로운 피드포워드-피드백-적응 정책 아키텍처를 설계한다.
  • 훈련 중에 실제 외부 힘을 보완할 수 있도록 시뮬레이션된 간섭 모델을 감독 신호로 사용하여, 정책이 외부 힘을 보상할 수 있도록 훈련한다.
  • 실제 하드웨어에 정책을 구현하고, 재학습 없이도 실시간 간섭을 추정하고 제거할 수 있도록 피드백 루프에 닫힌 $ι_1$ 적응 제어 추정기로 보완한다.
  • 피드백 루프에 $ι_1$ 추정기를 통합하여, 시뮬레이션에 존재하지 않는 비모델링된 동역학 및 시간에 따라 변화하는 간섭(예: 풍속, 저항판)을 보정한다.
  • 학습 안정성을 높이기 위해 첫 250만 스텝 동안 궤적 기준선을 고정하고, 궤적 추적 정확도를 우선시하며 페널티를 적용하는 보상 형태를 사용한다.
  • 실시간으로 간섭을 추정할 수 있도록 $ι_1$ 적응 제어 구조를 활용하여, 시뮬레이션에 존재하지 않는 상태에 의존적인 힘(예: 풍속)에 대한 견고한 성능을 확보한다.
Figure 1: Trajectory visualizations for example infeasible trajectories. (a-c) Long-exposure photos of different methods for an equilateral triangle reference trajectory. (d) Long-exposure photo of our method for a five-pointed star reference trajectory. (e) Quantitative comparisons between our appr
Figure 1: Trajectory visualizations for example infeasible trajectories. (a-c) Long-exposure photos of different methods for an equilateral triangle reference trajectory. (d) Long-exposure photo of our method for a five-pointed star reference trajectory. (e) Quantitative comparisons between our appr

실험 결과

연구 질문

  • RQ1시뮬레이션에서 훈련된 학습 기반 제어기가 재학습 없이도 실세계 간섭 상황에서 비가능한 궤적을 실시간으로 정밀하게 추적할 수 있는가?
  • RQ2딥 강화학습 정책에 $ι_1$ 적응 제어를 통합할 경우, 독립적인 적응 제어나 MPC 기반 제어기 대비 간섭 제거 능력이 어떻게 향상되는가?
  • RQ3시뮬레이션에 모델링되지 않은 고도로 동적인 상태에 의존적인 간섭(예: 풍속, 저항판)에 대해 정책이 제로샷으로 얼마나 잘 일반화되는가?
  • RQ4공격적인 궤적 상황에서 DATT와 비선형 적응 제어 및 MPC 기준선을 비교했을 때, 추적 정확도와 계산 비용 간의 상호 보완적 특성은 어떠한가?
  • RQ5기존 제어기들이 실패하는 경우에도, 특히 구동 제한 및 고곡률 조작 상황에서 제안된 아키텍처가 안정성과 성능을 유지하는가?

주요 결과

  • 부드럽고 가능한 궤적에서 DATT는 비선형 적응 제어 및 적응 MPC 기준선 대비 추적 오차를 34–36% 감소시킨다.
  • 비가능한 궤적(예: 오각별) 상황에서 DATT는 MPC 대비 54% 낮은 오차를 기록하며, 계산 시간은 1/4 수준이며, 비선형 기준선는 완전히 실패한다.
  • 저항판이 있는 강풍 상황에서 DATT는 최신 비선형 적응 제어기 대비 부드러운 궤적에서 48% 낮은 오차를 기록한다.
  • 풍속과 저항판이 함께 작용하는 비가능한 궤적 상황에서 DATT는 적응 MPC 대비 오차를 34% 감소시키며, 계산 비용은 1/4 수준이다.
  • DATT는 추론 지연 시간을 3.2ms 이하로 유지하여 경량 하드웨어(Crazyflie 2.1)에서도 실시간 구현이 가능하다.
  • $ι_1$ 적응 제어 통합은 RMA 기반 적응보다 성능 향상을 크게 이끌어내어, 시뮬레이션-실세계 전이 과정에서 견고한 간섭 추정의 중요성을 입증한다.
Figure 2: Algorithm Overview. Blue, yellow, and green blocks represent feedforward, feedback, and adaptation modules respectively. In training the policy has access to the true disturbance $\bm{d}$ whereas in real we use $\mathcal{L}_{1}$ adaptive control to get the disturbance estimation $\hat{\bm{
Figure 2: Algorithm Overview. Blue, yellow, and green blocks represent feedforward, feedback, and adaptation modules respectively. In training the policy has access to the true disturbance $\bm{d}$ whereas in real we use $\mathcal{L}_{1}$ adaptive control to get the disturbance estimation $\hat{\bm{

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.