Skip to main content
QUICK REVIEW

[논문 리뷰] Derivative-Free Policy Optimization for Linear Risk-Sensitive and Robust Control Design: Implicit Regularization and Sample Complexity

Kaiqing Zhang, Xiangyuan Zhang|arXiv (Cornell University)|2021. 01. 04.
Reinforcement Learning in Robotics참고 문헌 72인용 수 8
한 줄 요약

이 논문은 선형 위험 감수성 및 강건 제어를 위한 최초의 도함수 없는 정책 최적화 방법을 제안하며, 궤적 샘플링을 통해 전역 수렴성과 유한 샘플 복잡도를 달성한다. 학습 중에도 강건성을 유지하는 암묵적 정규화를 확립하여 안전이 중요한 시스템에서의 안정성을 보장한다.

ABSTRACT

Direct policy search serves as one of the workhorses in modern reinforcement learning (RL), and its applications in continuous control tasks have recently attracted increasing attention. In this work, we investigate the convergence theory of policy gradient (PG) methods for learning the linear risk-sensitive and robust controller. In particular, we develop PG methods that can be implemented in a derivative-free fashion by sampling system trajectories, and establish both global convergence and sample complexity results in the solutions of two fundamental settings in risk-sensitive and robust control: the finite-horizon linear exponential quadratic Gaussian, and the finite-horizon linear-quadratic disturbance attenuation problems. As a by-product, our results also provide the first sample complexity for the global convergence of PG methods on solving zero-sum linear-quadratic dynamic games, a nonconvex-nonconcave minimax optimization problem that serves as a baseline setting in multi-agent reinforcement learning (MARL) with continuous spaces. One feature of our algorithms is that during the learning phase, a certain level of robustness/risk-sensitivity of the controller is preserved, which we termed as the implicit regularization property, and is an essential requirement in safety-critical control systems.

연구 동기 및 목표

  • 모델 프리 정책 그라디언트(PG) 방법이 위험 감수성 및 강건 제어 설정에서 이론적 수렴 보장을 갖지 못하는 문제를 해결한다.
  • 선형 지수 제곱형 가우시안(LEQG) 및 선형-제곱형(LQ) 교란 감소 문제에서 비강력한 목적 함수의 과제를 극복한다.
  • 이러한 비凸, 비상동 최소화-최대화 제어 문제에서 PG 방법의 유한 샘플 복잡도를 확립한다.
  • 학습 중 강건성이 유지되도록 보장하는 모델 프리 설정에서의 최초의 암묵적 정규화 분석을 제공한다.
  • 기존의 알려진 모델 설정에서의 암묵적 정규화 결과를 샘플 기반, 도함수 없는 PG 방법으로 확장한다.

제안 방법

  • 선형-제곱형 동적 게임으로의 등가성에 기반해 LEQG 및 LQ 교란 감소 문제에 대한 통합된 정책 최적화 프레임워크를 개발한다.
  • 시스템 궤적 샘플을 사용해 그라디언트를 추정하는 도함수 없는 PG 방법을 제안하여 분석적 도함수를 회피한다.
  • 비강력한 목적 함수에도 불구하고 PG 반복이 강건성 타당 집합 내에 머물도록 보장하는 새로운 암묵적 정규화 논증을 도입한다.
  • 모델 프리 설정에서 통계적 오차를 견딜 수 있는 균일한 마진 한계를 확립하여 이전의 모델 기반 IR 접근법의 한계를 극복한다.
  • 리카티 방정식과 게임 이론적 공식화의 구조를 활용해 컨트롤러 및 코스트레이트 행렬의 노름을 유한하게 제한하기 위해 리아푸노프 유사 분석과 행렬 섭동 이론을 사용한다.
  • 리카티 방정식의 구조와 게임 이론적 공식화를 활용해 정책 그라디언트의 리프시츠 연속성을 유도한다.

실험 결과

연구 질문

  • RQ1모델 프리 정책 그라디언트 방법이 비강력한 목적 함수를 가진 위험 감수성 및 강건 제어 문제에서 전역 수렴을 달성할 수 있는가?
  • RQ2LEQG 및 LQ 교란 감소 문제에 대한 도함수 없는 PG 방법에서 암묵적 정규화가 나타나는가?
  • RQ3유한 시간 영역을 가진 이러한 강건 제어 문제를 해결할 때 PG 방법의 샘플 복잡도는 무엇인가?
  • RQ4명시적 장벽 함수나 모델 지식 없이도 학습 중 강건성이 유지될 수 있는가?
  • RQ5모델 프리 설정에서의 암묵적 정규화는 알려진 모델 설정과 비교해 마진과 안정성 측면에서 어떻게 다른가?

주요 결과

  • 논문은 선형 위험 감수성 및 강건 제어에서 모델 프리 정책 그라디언트 방법에 대한 최초의 유한 샘플 복잡도 결과를 확립한다.
  • 비강력한 목적 함수에도 불구하고 암묵적 정규화 덕분에 PG 반복이 강건성 타당 집합 내에 머무르며 수렴함을 증명한다.
  • 이 방법은 유한 시간 영역의 LEQG 및 LQ 교란 감소 문제에 대해 최적의 컨트롤러로 전역 수렴을 달성한다.
  • 암묵적 정규화 성질은 학습 전반에 걸쳐 학습된 컨트롤러가 일정 수준의 위험 감수성과 강건성을 유지하도록 보장한다.
  • 컨트롤러 노름과 코스트레이트 행렬의 노름에 대한 명시적 한계를 제공하여 유한 샘플 수렴 보장을 가능하게 한다.
  • 결과는 0-합 선형-제곱형 동적 게임으로 확장되어 연속 행동 공간을 가진 다중 에이전트 강화 학습(MARL)에서 전역 수렴에 대한 최초의 샘플 복잡도를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.