Skip to main content
QUICK REVIEW

[논문 리뷰] Using Neural Networks to Compute Approximate and Guaranteed Feasible Hamilton-Jacobi-Bellman PDE Solutions

Frank J. Jiang, Glen Chou|arXiv (Cornell University)|2016. 11. 10.
Model Reduction and Neural Networks참고 문헌 31인용 수 19
한 줄 요약

이 논문은 최적 제어에서 해밀턴-자코비-벨리만(HJB) 편미분방정식(PDE)의 값 함수를 근사하기 위해 그리드 기반이 아닌 신경망 기반 방법을 제안한다. 이 방법은 상태공간 이산화 없이도 보존적이고 타당한 궤적을 보장하며, 동적 프로그래밍의 보존성과 기계학습의 확장성 및 효율성을 결합한다. 신경망을 통해 제약 조건을 엄격히 충족하는 근사 최적 제어를 학습시킴으로써 계산 복잡도를 감소시키고 장기 계획 가능성을 확보한다. 검증 결과, 더블린스 카 모델에서 전통적인 레벨셋 방법 대비 빠른 성능 향상을 보였다.

ABSTRACT

To sidestep the curse of dimensionality when computing solutions to Hamilton-Jacobi-Bellman partial differential equations (HJB PDE), we propose an algorithm that leverages a neural network to approximate the value function. We show that our final approximation of the value function generates near optimal controls which are guaranteed to successfully drive the system to a target state. Our framework is not dependent on state space discretization, leading to a significant reduction in computation time and space complexity in comparison with dynamic programming-based approaches. Using this grid-free approach also enables us to plan over longer time horizons with relatively little additional computation overhead. Unlike many previous neural network HJB PDE approximating formulations, our approximation is strictly conservative and hence any trajectories we generate will be strictly feasible. For demonstration, we specialize our new general framework to the Dubins car model and discuss how the framework can be applied to other models with higher-dimensional state spaces.

연구 동기 및 목표

  • HJB PDE를 동적 프로그래밍으로 풀이할 때 발생하는 차원의 저주 문제를 해결하기 위해.
  • 상태공간 이산화를 피하면서도 타당하고 근사 최적의 궤적을 보장하는 방법을 개발하기 위해.
  • 동적 프로그래밍의 장점(보존성)과 기계학습의 장점(확장성 및 효율성)을 융합하기 위해.
  • 최소한의 계산 오버헤드로 장기 계획을 가능하게 하기 위해.
  • 부적절한 학습 데이터에 대해 강건하고 고차원 시스템으로의 확장이 가능한 프레임워크를 제공하기 위해.

제안 방법

  • 학습된 신경망은 타당한 궤적 주변 국소 영역에서 값 함수를 근사하며, 전체 상태공간을 커버하지는 않는다.
  • 이중 단계 학습 프로세스를 사용한다: 먼저 탐색을 통해 다양한 궤적을 생성하고, 그 다음 보수적인 필터링 메커니즘을 사용해 이를 정제한다.
  • 원추형 목표 필터(R_O)는 비타당하거나 근사 최적이 아닌 상태를 제거하여, 목표 집합의 ε 이내에 도달하는 궤적만 유지한다.
  • 길이 필터는 너무 긴 궤적을 제거하여, 부적절한 학습 데이터에 대한 강건성을 향상시키고 학습 데이터 품질을 향상시킨다.
  • 값 함수 근사는 엄격히 보존적이며, 생성된 모든 궤적이 역학적으로 타당하다는 보장을 갖는다.
  • 검증을 위해 도달 가능성 분석을 활용하며, 레벨셋 방법으로 계산된 기준값과 비교하여 신경망 기반 값 함수를 평가한다.

실험 결과

연구 질문

  • RQ1신경망 기반 접근법이 생성된 궤적의 타당성을 보장하는 방식으로 HJB 값 함수를 근사할 수 있는가?
  • RQ2기존의 동적 프로그래밍 및 레벨셋 방법에 비해 그리드 기반의 데이터 기반 방법이 계산 복잡도를 얼마나 줄일 수 있는가?
  • RQ3다양한 초기 조건과 장기 계획 작업에 대해 이 방법이 얼마나 잘 일반화되는가?
  • RQ4값 함수 근사에서 엄격한 보존성을 유지하면서도 근사 최적이 유지되는가?
  • RQ5길이 필터 및 목표 필터와 같은 필터링 메커니즘의 포함이 노이즈가 있거나 부적절한 학습 데이터에 대해 강건성을 어떻게 향상시키는가?

주요 결과

  • 고성능 데스크톱에서 4일이 소요되던 계산을 2012년형 맥북 프로에서 5분 이내로 단축시켰다.
  • 통로 계산에 대해 신경망 기반 값 함수 근사는 179MB의 스토리지만 필요로 했고, 저해상도 레벨셋 방법은 7GB가 필요했다.
  • 더블린스 카의 경우, 신경망이 생성한 궤적은 근사 최적이었으며, 비용 값이 진짜 최적 비용과 유사했다: 예를 들어 상태 (-12,5,2)에서 26.51 vs. 14.84.
  • 길이 필터는 Figure 5(a)에서 5(b)와 비교해 볼 때, 부적절한 제어로부터 생성된 상태를 제거함으로써 학습 데이터 품질을 크게 향상시켰다.
  • 원추형 목표 필터는 목표 ε-근접 영역 외부의 상태를 성공적으로 제거하여, 최종 궤적이 모두 수용 가능한 거리 내에 도달함을 보장했다.
  • 이 방법은 목표에서 멀리 떨어진 초기 상태, 예를 들어 (10,-4,-3)에서도 타당성과 근사 최적성을 보였으며, 이 경우 신경망 비용은 16.20, 진짜 비용은 13.36이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.