Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Probabilistic Trajectory Optimization via Efficient Approximate Inference

Yunpeng Pan, Xinyan Yan|arXiv (Cornell University)|2016. 08. 22.
Gaussian Processes and Bayesian Inference참고 문헌 23인용 수 7
한 줄 요약

이 논문은 효율적인 근사 추론을 활용한 희소 스펙트럼 가우시안 프로세스(Sparse Spectrum Gaussian Processes, SSGP)를 사용하여 적응형 확률적 궤적 최적화를 제안한다. 이는 불확실한 환경에서 빠르고 온라인 학습 및 제어를 가능하게 한다. 증분적 신뢰도 공간 최적화와 DDP 기반 궤적 정밀화를 결합함으로써, 이 방법은 로봇 제어 과제에서 실시간 성능과 강건성을 달성하며, 이전의 모델 기반 강화학습 및 MPC 접근법보다 샘플 효율성과 적응 가능성에서 뛰어나다.

ABSTRACT

Robotic systems must be able to quickly and robustly make decisions when operating in uncertain and dynamic environments. While Reinforcement Learning (RL) can be used to compute optimal policies with little prior knowledge about the environment, it suffers from slow convergence. An alternative approach is Model Predictive Control (MPC), which optimizes policies quickly, but also requires accurate models of the system dynamics and environment. In this paper we propose a new approach, adaptive probabilistic trajectory optimization, that combines the benefits of RL and MPC. Our method uses scalable approximate inference to learn and updates probabilistic models in an online incremental fashion while also computing optimal control policies via successive local approximations. We present two variations of our algorithm based on the Sparse Spectrum Gaussian Process (SSGP) model, and we test our algorithm on three learning tasks, demonstrating the effectiveness and efficiency of our approach.

연구 동기 및 목표

  • 로봇 제어에서 모델 자유형 강화학습의 느린 수렴 문제를 해결하기 위해.
  • 비모수적 확률적 모델의 근사 추론에서 발생하는 계산 병목 현상을 극복하기 위해.
  • 모델 기반 강화학습의 샘플 효율성과 모델 예측 제어(MPC)의 반응성(reactivity)을 통합하기 위해.
  • 불확실성 하에서 동적 모델과 제어 정책의 온라인, 증분적 학습을 가능하게 하기 위해.
  • 실시간 로봇 의사결정에 적합한 확장 가능한 추론 기법을 개발하기 위해.

제안 방법

  • 이 방법은 효율적이고 확장 가능한 근사 추론을 가능하게 하는 희소 스펙트럼 가우시안 프로세스(SSGP)를 사용하여 시스템 동역학을 모델링한다.
  • 비용과 동역학의 국소 2차 근사화를 사용한 미분 동적 프로그래밍(DDP)을 활용한 신뢰도 공간 궤적 최적화를 수행한다.
  • 알고리즘은 각 시간 단계에서 온라인 재최적화를 수행하여 변화하는 동역학에 적응한다. 이는 MPC와 유사하다.
  • 제어 제약 조건은 피드백 구조를 유지하면서도 투영 뉴턴 최적화를 사용한 2차 프rogamming(QP)을 통해 처리한다.
  • 이 방법은 실시간으로 새로운 데이터를 활용해 SSGP 모델과 신뢰도 상태를 증분적으로 업데이트한다.
  • 확장성 향상을 위해 서로 다른 SSGP 추론 전략을 기반으로 한 알고리즘의 두 가지 변종을 제안한다.

실험 결과

연구 질문

  • RQ1확률적 동역학 모델에서의 확장 가능한 근사 추론이 로봇 시스템에서 실시간, 적응형 제어를 가능하게 할 수 있는가?
  • RQ2DDP 기반 궤적 최적화와 온라인 모델 업데이트를 결합함으로써 샘플 효율성과 강건성이 어떻게 향상되는가?
  • RQ3제어 응용 분야에서 표준 GP 추론 대비 SSGP 기반 추론이 계산 비용을 얼마나 줄일 수 있는가?
  • RQ4변화하는 동역학 또는 부분 관측 가능성(Partial observability)이 있는 과제에서 이 방법의 성능은 어떠한가?
  • RQ5신뢰도 공간 DDP와 온라인 재최적화가 불확실한 환경에서 표준 MPC 및 모델 자유형 강화학습보다 뛰어나게 성능을 발휘할 수 있는가?

주요 결과

  • 제안된 방법은 세 가지 로봇 제어 과제에서 실시간 성능을 달성하여 빠른 수렴과 모델 불확실성에 대한 강건성을 입증하였다.
  • SSGP의 사용으로 표준 GP 기반 방법 대비 추론 시간을 크게 단축시켜 온라인 학습을 가능하게 하였다.
  • 증분적 모델 업데이트와 온라인 재최적화를 통해 동역학의 변화를 성공적으로 학습하고 적응하였다.
  • 투영 뉴턴 최적화를 사용한 QP를 통한 제어 제약 조건 처리로 안정성과 타당성을 유지하면서도 피드백 제어 구조를 그대로 유지하였다.
  • 샘플 효율성과 최종 과제 성능 측면에서 기준 모델 자유형 및 모델 기반 강화학습 접근법보다 뛰어난 성능을 보였다.
  • 실증 결과에 따르면, SSGP 추론을 사용한 신뢰도 공간 DDP는 제한된 데이터 조건에서도 안정적이고 고정밀도 제어를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.