Skip to main content
QUICK REVIEW

[논문 리뷰] Reach-Avoid Problems via Sum-of-Squares Optimization and Dynamic Programming

Benoit Landry, Mo Chen|arXiv (Cornell University)|2018. 07. 30.
Advanced Control Systems Optimization참고 문헌 7인용 수 5
한 줄 요약

이 논문은 다항 동역학을 갖는 시스템에 대해 목표 집합으로의 도달 가능성과 비안전 상태 회피를 보장하는 피드백 제어기를 합성하기 위해 제곱합(SOS) 최적화와 동적 프로그래밍 기법을 제안한다. 이 방법은 다항식 동역학에 대해 6차원의 도달-피하기 집합을 스케일러블하게 계산할 수 있으며, 적대적 외란이 존재하더라도 공식적인 안전 보장을 제공한다. 실험적으로 운동학적 자동차 모델에서 성능이 입증되었다.

ABSTRACT

Reach-avoid problems involve driving a system to a set of desirable configurations while keeping it away from undesirable ones. Providing mathematical guarantees for such scenarios is challenging but have numerous potential practical applications. Due to the challenges, analysis of reach-avoid problems involves making trade-offs between generality of system dynamics, generality of problem setups, optimality of solutions, and computational complexity. In this paper, we combine sum-of-squares optimization and dynamic programming to address the reach-avoid problem, and provide a conservative solution that maintains reaching and avoidance guarantees. Our method is applicable to polynomial system dynamics and to general problem setups, and is more computationally scalable than previous related methods. Through a numerical example involving two single integrators, we validate our proposed theory and compare our method to Hamilton-Jacobi reachability. Having validated our theory, we demonstrate the computational scalability of our method by computing the reach-avoid set of a system involving two kinematic cars.

연구 동기 및 목표

  • 적대적 외란이 존재하는 상황에서 고차원 시스템에 대해 공식적인 안전 보장을 갖는 도달-피하기 집합을 계산하는 데 도전하는 데 목적을 두다.
  • 일반적인 다항식 동역학과 임의의 문제 설정을 유지하면서 도달-피하기 분석의 계산 복잡도를 줄이는 것.
  • 목표 집합에 도달하면서 비안전 상태를 피하는 것을 보장하는 스케일러블하고 보수적인 피드백 제어기 설계 방법을 개발하는 것.
  • 기존 해밀턴-자코비 방법의 6차원 한계를 초월한 시스템에 도달-피하기 제어를 적용할 수 있도록 하는 것.
  • 합성곱의 제곱합 최적화와 동적 프로그래밍을 조합하여 최적성과 계산 가능성을 상충하는 것.

제안 방법

  • 이 방법은 시간 이산화된 단계에서 동적 프로그래밍 재귀를 통해 도달-피하기 문제를 수식화하며, 값 함수는 제곱합(SOS) 다항식으로 정의된다.
  • 이들은 피하기 집합의 불변성과 목표 집합 도달 가능성 보장을 보장하기 위해 리아푸노프 유사 조건을 SOS 프로그래밍을 통해 강제한다.
  • 이 접근법은 제한된 차수의 다항식 제어기와 값 함수를 찾기 위해 SOS 제약 조건에서 유도된 정수형 프로그램을 해결한다.
  • 시간 이산화가 동적 프로그래밍 재귀에 적용되며, 삼각함수 항목을 다루기 위해 체비셰프 다항식 전개를 통해 상태공간을 근사한다.
  • 제어기는 임의의 외란 정책, 특히 최악의 적대적 행동까지도 증명 가능하게 강건한 피드백 정책으로 합성된다.
  • 슬랙 및 수렴 허용 오차와 같은 하이퍼파rameter는 보수성과 계산 효율성의 균형을 맞추기 위해 조정된다.

실험 결과

연구 질문

  • RQ1합성곱의 제곱합 최적화를 동적 프로그래밍과 효과적으로 조합하여 고차원 시스템의 도달-피하기 집합을 계산할 수 있는가?
  • RQ26차원 시스템에서 기존 해밀턴-자코비 도달가능성 분석과 비교해 본다면, 제안된 방법은 계산 스케일러비리티와 보수성 측면에서 어떻게 다른가?
  • RQ3체비셰프 전개를 통해 다항식 시스템의 동역학을 어느 정도 근사할 수 있는가? 이는 SOS 기반 분석을 가능하게 한다.
  • RQ4이 방법은 동적 장애물 환경에서 운동학적 차량에 대해 공식적으로 보장되는 피드백 제어기를 생성할 수 있는가?
  • RQ5SOS 기반 도달-피하기 집합 계산에서 솔루션의 보수성과 계산 타당성 사이의 상충 관계는 어떠한가?

주요 결과

  • 표준 해밀턴-자코비 방법으로는 이전에 불가능했던 다항식 동역학을 갖는 두 대의 운동학적 자동차에 대해 6차원의 도달-피하기 집합을 성공적으로 계산하였다.
  • 계산된 도달-피하기 집합은 보수적이지만, 수비수의 정책이 어떠한 경우이든 공격자가 목표에 도달하면서 수비수와 충돌하지 않는다는 공식적인 보장을 제공한다.
  • 시뮬레이션 결과는 계산된 도달-피하기 집합 내에서 출발하는 모든 궤적들이 피하기 제약 조건을 위반하지 않고 목표에 성공적으로 도달하는 것으로 확인되었다.
  • 계산은 표준 데스크톱 컴퓨터(AMD Ryzen 7 1800X, 32GB RAM)에서 약 4시간이 소요되었으며, Spotless 도구상자와 MOSEK 솔버를 사용하였다.
  • 이 방법은 리아푸노프 유사 함수와 제어기 다항식에 대해 SOS 제약 조건을 강제하여 공식적인 안전 보장을 달성한다.
  • 테스트 결과, 수비수가 고정된 방향으로 최대 속도를 내는 정책을 따를 경우에도 이 방법이 임의의 외란 정책에 대해 강건함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.