Skip to main content
QUICK REVIEW

[논문 리뷰] Algorithms of Data Development For Deep Learning and Feedback Design

Wei Kang, Qi Gong|arXiv (Cornell University)|2019. 12. 01.
Model Reduction and Neural Networks참고 문헌 31인용 수 14
한 줄 요약

이 논문은 최적 피드백 제어에서 깊은 신경망을 훈련시키기 위한 고차원 데이터 생성을 위한 원인관계 없음 알고리즘을 제안한다. 이는 효율적이고 격자 기반 없이 병렬 처리 가능한 훈련을 가능하게 한다. 각 점에서 값 함수 해를 독립적으로 계산함으로써, 이 방법은 적응형 데이터 생성과 경험적 오차 검증을 지원하며, 6차원 강체 제어 문제에서 4,096개의 데이터 포인트로 구현되었고, 네 번의 훈련 라운드 동안 신경망 정확도가 향상되었다.

ABSTRACT

Recent research reveals that deep learning is an effective way of solving high dimensional Hamilton-Jacobi-Bellman equations. The resulting feedback control law in the form of a neural network is computationally efficient for real-time applications of optimal control. A critical part of this design method is to generate data for training the neural network and validating its accuracy. In this paper, we provide a survey of existing algorithms that can be used to generate data. All the algorithms surveyed in this paper are causality-free, i.e., the solution at a point is computed without using the value of the function at any other points. At the end of the paper, an illustrative example of optimal feedback design using deep learning is given.

연구 동기 및 목표

  • 고차원 시스템에서 최적 제어를 위한 해밀토니안-자비-벨만(Hamilton-Jacobi-Bellman) 방정식을 풀이할 때 발생하는 차원의 극복 문제를 해결하기 위해.
  • 각 점에서 값 함수 해를 상호 의존 없이 독립적으로 계산하는 원인관계 없음 알고리즘을 개발하여 격자 의존성을 제거하고 병렬 처리를 가능하게 하기 위해.
  • 값 함수의 복잡하거나 급격한 영역에서 정확도가 높은 데이터 수집이 가능하도록, 복잡한 영역에 맞춰 데이터를 적응적으로 생성할 수 있도록 지원하기 위해.
  • 독립된 데이터 세트를 통한 검증을 통해 신뢰할 수 있고 경험적으로 검증된 방법으로 신경망을 훈련시켜 피드백 제어기로 사용하기 위해.
  • 원인관계 없음 데이터 생성을 활용하여 딥러닝 기반 피드백 제어의 실현 가능성과 확장성을 6차원 고차원 최적 제어 문제에서 입증하기 위해.

제안 방법

  • 이웃 값에 의존하지 않고 개별 점에서 값 함수 $ V(t, \mathbf{x}) $ 를 계산하는 원인관계 없음 수치 해법을 사용하여 격자 기반 방법을 피한다.
  • 초기 데이터 세트로 $ N_d $ 개의 무작위 초기 상태 $ \mathbf{x}^{(i)} $ 를 생성하고, TPBVP 해법기를 통해 $ V^{(i)} $ 와 그 기울기 $ \bm{\lambda}^{(i)} $ 를 계산한다.
  • 값 오차와 기울기 오차를 조합한 손실 함수를 사용하여 깊은 신경망이 $ V(t, \mathbf{x}) $ 를 근사하도록 훈련한다: $ \mathcal{L} = \frac{1}{N_d}\sum (V^{(i)} - V^{NN})^2 + \frac{\mu}{N_d}\sum \|\bm{\lambda}^{(i)} - V_{\mathbf{x}}^{NN}\|^2 $.
  • 훈련된 네트워크를 후속 TPBVP 해법의 온전한 시작 조건으로 사용하여 오차 또는 복잡성이 높은 영역에서 더 빠르고 적응적인 데이터 생성을 가능하게 한다.
  • 적응형 루프를 적용: 각 훈련 라운드 이후, 근사 오차가 높은 영역에 데이터 세트를 확장하고, 사전 정의된 기준에 따라 데이터 배치를 유도한다.
  • 최종 신경망을 별도의 몬테카를로 기반 검증 세트로 검증하여 경험적 정확도와 신뢰성을 확보한다.

실험 결과

연구 질문

  • RQ1원인관계 없음 알고리즘은 고차원 최적 제어 문제에서 딥러닝을 위한 훈련 데이터 생성에 어떻게 활용될 수 있는가?
  • RQ2확장성과 병렬 처리 측면에서 전통적인 격자 기반 방법에 비해 원인관계 없음 데이터 생성이 가지는 장점은 무엇인가?
  • RQ3신경망 오차 추정치를 기반으로 한 적응형 데이터 생성은 학습된 피드백 제어기의 정확도를 향상시킬 수 있는가?
  • RQ4손실 함수에 값과 기울기 양쪽을 동시에 감시하는 것이 값 함수의 신경망 근사 훈련을 어떻게 향상시키는가?
  • RQ5원인관계 없음 데이터 생성을 사용한 6차원 강체 자세 제어 문제에서 딥러닝 기반 피드백 제어의 경험적 성능은 어떠한가?

주요 결과

  • 원인관계 없음 접근법은 격자 기반 없이 병렬적으로 값 함수 해를 계산할 수 있게 하여 고차원 문제를 해결 가능하게 한다.
  • 오차 기반 샘플링을 통한 적응형 데이터 생성이 네 번의 훈련 라운드 동안 신경망 정확도를 향상시켰으며, 데이터 크기는 64개에서 4,096개로 증가하였다.
  • 손실 함수에 값과 기울기 양쪽을 감시하는 것이 신경망이 진짜 값 함수와 그 도함수를 근사하는 능력을 크게 향상시켰다.
  • 훈련된 신경망은 안정적이고 정확한 피드백 제어 법칙을 도출하였으며, 별도의 몬테카를로 테스트 세트에서 검증되어 경험적으로 신뢰할 수 있음을 입증하였다.
  • 신경망 온전한 시작 조건을 활용하여 시간 적으로 진행하는 해법기의 의존도를 줄였고, 이후 훈련 라운드에서 데이터 생성 속도를 높였다.
  • 정확하고 신속하며 경험적으로 검증된 최적 제어 법칙의 신경망 근사가 가능해져 실시간 피드백 제어에 실용적인 응용을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.