Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Deep Stochastic Optimal Control Policies using Forward-Backward SDEs

Marcus A. Pereira, Ziyi Wang|arXiv (Cornell University)|2019. 02. 11.
Model Reduction and Neural Networks참고 문헌 40인용 수 25
한 줄 요약

이 논문은 순환신경망(LSTM)을 활용해 시간적 의존성을 모델링하고, 지르산وف의 정리(Girsanov's theorem)를 적용해 효율적인 탐색을 수행하는, 후방-전방 확률미분방정식(FBSDEs)을 이용한 딥러닝 프레임워크를 제안한다. 이 방법은 특히 제어 제약 조건 하에서 완전히 연결된 신경망보다 더 부드럽고 확장 가능한 제어 정책을 달성하며, 펜듈럼, 카트폴, 펌프쿼드코pter 시뮬레이션에서 뛰어난 성능을 보인다.

ABSTRACT

In this paper we propose a new methodology for decision-making under uncertainty using recent advancements in the areas of nonlinear stochastic optimal control theory, applied mathematics, and machine learning. Grounded on the fundamental relation between certain nonlinear partial differential equations and forward-backward stochastic differential equations, we develop a control framework that is scalable and applicable to general classes of stochastic systems and decision-making problem formulations in robotics and autonomy. The proposed deep neural network architectures for stochastic control consist of recurrent and fully connected layers. The performance and scalability of the aforementioned algorithm are investigated in three non-linear systems in simulation with and without control constraints. We conclude with a discussion on future directions and their implications to robotics.

연구 동기 및 목표

  • 불확실성 하에서 비선형 시스템에 대한 확장 가능한, 미분 가능한 스토하스틱 최적 제어 프레임워크를 개발한다.
  • 고차원 스토하스틱 제어 문제에서 전통적 동적계획법의 제약과 차원의 저주를 극복한다.
  • FBSDE 기반 제어에서 완전히 연결된 신경망 대신 순환 LSTM을 사용해 제어 정책의 부드러움과 훈련 효율성을 향상시킨다.
  • 실제 로봇 응용 분야에서 핵심적인 제어 제약 조건을 처리할 수 있도록 프레임워크를 확장한다.
  • 펜듈럼, 카트폴, 펌프쿼드코터와 같은 복잡한 시스템에서 확장성과 성능을 입증한다.

제안 방법

  • 스토하스틱 최적 제어를 위한 해밀토니안-자코비-벨만(HJB) 방정식을 재구성하기 위해 전방-후방 확률미분방정식(FBSDEs)을 사용한다.
  • 전방 SDE의 드리프트 항을 수정함으로써 궤적을 재가중하고 효율적인 탐색을 가능하게 하기 위해 지르산오프의 정리를 적용한다.
  • 제어 정책의 시간적 의존성을 학습하기 위해 장단기 기억(LSTM) 신경망을 사용하며, 각 시간 단계에서 독립된 완전히 연결된 신경망 대신 사용한다.
  • 신경망을 통한 조건부 기대값 추정을 통해 후방 SDE의 해를 신경망 기반 알고리즘으로 근사한다.
  • 엔드 투 엔드 백프로파게이션을 통해 제어 정책과 가치 함수를 동시에 최적화하는 미분 가능한 아키텍처를 구현한다.
  • 정책 학습 중 제어 입력에 상자형 제약 조건을 통합함으로써 제어 제약 조건을 처리할 수 있도록 프레임워크를 확장한다.

실험 결과

연구 질문

  • RQ1순환 아키텍처를 갖춘 딥 네트워크를 사용해 FBSDE 기반 스토하스틱 최적 제어를 효과적으로 학습할 수 있는가?
  • RQ2완전히 연결된 레이어 대신 LSTM을 사용할 경우, 스토하스틱 제어에서 제어 정책의 부드러움, 훈련 효율성, 확장성에 어떤 영향을 미치는가?
  • RQ3제어와 노이즈 간의 제한적인 가정 없이도 지르산오프의 정리는 FBSDE 기반 제어에서 탐색 성능을 얼마나 향상시킬 수 있는가?
  • RQ4완전히 연결된 신경망과 비교했을 때, 제어 제약 조건이 있는 고차원 비선형 시스템에서 제안된 방법의 성능과 확장성은 어떠한가?
  • RQ5비아핀(affine) 제어 동역학 또는 레비 유형의 노이즈를 가진 시스템으로 이 프레임워크를 확장할 수 있는가?

주요 결과

  • 모든 작업에서 LSTM 기반 정책은 훈련 시간을 최소 20% 감소시키고, 완전히 연결된 신경망보다 훨씬 적은 파라미터를 사용했다.
  • LSTM로 학습된 제어 정책은 제약 조건 하에서 완전히 연결된 신경망에서 관찰된 스팁과 같은 이凹형 제어 입력을 피하는 부드러운 제어 궤적을 생성했다.
  • 펜듈럼과 카트폴 작업에서 LSTM 정책은 더 낮은 분산과 운동량 처리 능력으로 성공적인 스윙업을 달성했으며, 특히 제약 조건이 없는 설정에서 두드러진 성능을 보였다.
  • 2초의 예측 수평선을 가진 펌프쿼드코터 작업에서, FC 기반 정책은 100개의 별도 네트워크가 필요했고 조정이 어려웠지만, LSTM 기반 정책은 공유 가중치와 더 빠른 그래프 구축을 통해 효율적으로 확장되었다.
  • 특히 Z축 및 요행(Yaw) 상태에서, LSTM 정책은 더 나은 장기적 시간 의존성 모델링 덕분에 목표 위치와 자세 추적 성능에서 FC 정책을 능가했다.
  • 세 시스템 전반에서 제어 제약 조건을 성공적으로 처리했으며, 특히 토크 제한 조건 하에서도 LSTM 기반 정책은 완전히 연결된 신경망과 달리 부드러운 제어 입력을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.