Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Locomotion Controllers for Walking Using Deep FBSDE

Bolun Dai, Virinchi Roy Surabhi|arXiv (Cornell University)|2021. 07. 16.
Robotic Locomotion and Control참고 문헌 17인용 수 4
한 줄 요약

이 논문은 상태 제약 조건이 있는 선형 역립판 모델(LIPM)에 대해 최적 제어 문제를 해결하기 위해 LSTM 기반 신경망을 사용하는 딥 프론트-백워드 스토케스틱 미분방정식(FBSDE) 컨트롤러를 제안한다. 이 방법은 CVX 기반 최적화보다 6.67배 빠른 계산 속도를 기록하며 실시간 고주기 제어를 가능하게 하여 노이즈와 제약 조건 하에서도 20번 이상의 사이클을 반복하는 안정적인 보행을 구현한다.

ABSTRACT

In this paper, we propose a deep forward-backward stochastic differential equation (FBSDE) based control algorithm for locomotion tasks. We also include state constraints in the FBSDE formulation to impose stable walking solutions or other constraints that one may want to consider (e.g., energy). Our approach utilizes a deep neural network (i.e., LSTM) to solve, in general, high-dimensional Hamilton-Jacobi-Bellman (HJB) equation resulting from the stated optimal control problem. As compared to traditional methods, our proposed method provides a higher computational efficiency in real-time; thus yielding higher frequency implementation of the closed-loop controllers. The efficacy of our approach is shown on a linear inverted pendulum model (LIPM) for walking. Even though we are deploying a simplified model of walking, the methodology is applicable to generalized and complex models for walking and other control/optimization tasks in robotic systems. Simulation studies have been provided to show the effectiveness of the proposed methodology.

연구 동기 및 목표

  • 딥 러닝을 활용한 계산 효율성이 높고 실시간 제어 방법을 개발하여 로봇 보행 작업에 적용한다.
  • 보행 로봇과 같은 이산 전이(예: 발자국 전환)를 포함하는 하이브리드 동역학계를 다룰 수 있도록 딥 FBSDE를 확장한다.
  • 목표 동적 행동을 유도하기 위해 FBSDE 프레임워크에 상태 제약 조건(예: 최소 질량중심 속도)을 통합한다.
  • 국소 발 기준 프레임에서 상태 재초기화를 통해 단일 스텝 정책을 다단계 보행으로 일반화한다.
  • 기존 최적화 기반 방법(예: CVX)과 비교해 고차원 설정에서 뛰어난 계산 효율성을 입증한다.

제안 방법

  • 보행 제어 문제를 스토케스틱 최적 제어 과제로 공식화하여 힐버트-자코비-벨만(HJB) 방정식을 도출한다.
  • 딥 네ural 네트워크(LSTM)를 사용해 HJB 방정식의 해를 근사함으로써 가치 함수와 최적 제어 정책의 엔드 투 엔드 학습을 가능하게 한다.
  • 상태 역학과 쌍대(비용상태) 역학을 결합하기 위해 프론트-백워드 스토케스틱 미분방정식(FBSDE) 프레임워크를 활용하여 타임 트래버스를 통한 역전파를 가능하게 한다.
  • 패널티 기반 방법을 사용해 FBSDE 수식에 상태 제약 조건을 통합하여 질량중심(CoM) 속도의 범위를 강제함으로써 내성적 안정성과 강건성을 확보한다.
  • 각 발자국에서 상태를 국소 프레임으로 재초기화함으로써 정책을 다단계 보행에 적응시키며, 종료 속도에 기반한 동적 스텝 길이를 조정한다.
  • 컨트롤러를 시뮬레이션에서 단일 스텝 보행에 대해 훈련하고, 상태 재정의 및 속도 기반 스텝 조정을 통해 장기적인 시퀀스로 일반화한다.

실험 결과

연구 질문

  • RQ1딥 FBSDE는 이산 발자국 전이를 포함하는 하이브리드 동역학계인 이족 보행에 효과적으로 적용될 수 있는가?
  • RQ2실시간 제어 시나리오에서 기존 최적화 솔버(CVX)와 비교해 제안된 딥 FBSDE 컨트롤러의 계산 효율성은 어떠한가?
  • RQ3최소 질량중심 속도 등의 상태 제약 조건이 FBSDE 프레임워크에 효과적으로 통합되어 원하는 보행 행동을 유도할 수 있는가?
  • RQ4상태 재초기화 및 동적 스텝 길이 조정을 통해 단일 스텝 정책을 얼마나 잘 다단계 보행으로 일반화할 수 있는가?
  • RQ5LIPM 프레임워크에서 과정 노이즈와 모델 불확실성 하에서 학습된 컨트롤러는 얼마나 강건한가?

주요 결과

  • 딥 FBSDE 컨트롤러는 CVX 기반 최적화 대비 제어 계산 속도가 6.67배 빠르며 분산도 낮아 고주기 실시간 제어에 적합하다.
  • 노이즈가 없는 경우와 노이즈가 있는 경우 모두에서 LIPM 시뮬레이션에서 20단계 이상의 안정적이고 사이클리컬한 보행 행동을 유지하며, 종료 속도가 명목값 주변 좁은 밴드로 수렴한다.
  • 모든 64개의 샘플링된 궤적에서 최소 질량중심 속도 제약 조건 1.0 m/s를 성공적으로 준수하였으며, 제약 조건이 없는 경우에 비해 제약 위반 빈도가 현저히 낮다.
  • 각 스텝에서 국소 발 기준 프레임으로 상태를 재초기화함으로써 단일 스텝 정책이 다단계 보행으로 효과적으로 일반화되었으며, 종료 속도에 기반한 동적 스텝 길이 조정이 가능해졌다.
  • 노이즈 조건 하에서도 종료 속도가 명목값 주변으로 매우 좁게 군집되어 있어 외부 간섭에 대한 내성적 저항력이 뛰어나다는 것을 보여준다.
  • 이 방법은 계산적으로 확장 가능하며, 고차원 시스템과 더 긴 프리뷰 화이어에 비해 전통적 솔버 대비 성능 향상이 크게 증가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.