Skip to main content
QUICK REVIEW

[논문 리뷰] First Order Optimization in Policy Space for Constrained Deep Reinforcement Learning.

Yiming Zhang, Quan Vuong|arXiv (Cornell University)|2020. 02. 16.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

FOCOPS는 비모수적 정책 공간에서 제약 최적화 문제를 해결하고 해를 다시 매개변수 정책 공간으로 투영함으로써 딥 강화학습에서 누적 보상 최대화와 엄격한 비용 제약을 동시에 충족시키는 1차 최적화 방법이다. 학습 중 제약 조건을 보장하며, 제약이 있는 로봇 보행 작업에서 최신 기법들을 능가한다.

ABSTRACT

In reinforcement learning, an agent attempts to learn high-performing behaviors through interacting with the environment, such behaviors are often quantified in the form of a reward function. However some aspects of behavior, such as ones which are deemed unsafe and are to be avoided, are best captured through constraints. We propose a novel approach called First Order Constrained Optimization in Policy Space (FOCOPS) which maximizes an agent's overall reward while ensuring the agent satisfies a set of cost constraints. Using data generated from the current policy, FOCOPS first finds the optimal update policy by solving a constrained optimization problem in the nonparameterized policy space. FOCOPS then projects the update policy back into the parametric policy space. Our approach provides a guarantee for constraint satisfaction throughout training and is first-order in nature therefore extremely simple to implement. We provide empirical evidence that our algorithm achieves better performance on a set of constrained robotics locomotive tasks compared to current state of the art approaches.

연구 동기 및 목표

  • 안전하지 않은 행동을 피해야 하는 딥 강화학습에서 안전 제약을 이행하는 데 도전하는 것.
  • 학습 과정 全 주기 동안 제약 조건 이행을 보장하는 방법을 개발하는 것.
  • 구현이 쉽고 실용적으로 효과적인 단순한 1차 최적화 접근법을 설계하는 것.
  • 기존 최신 기법들에 비해 제약이 있는 제어 작업에서 성능을 향상시키는 것.

제안 방법

  • 현재 정책로부터 수집한 데이터를 이용해 비모수적 정책 공간에서 제약 최적화 문제를 수립한다.
  • 이 제약 문제를 해결하여 최적의 업데이트 정책을 계산함으로써 비용 제약 조건이 충족됨을 보장한다.
  • 최적의 업데이트 정책을 매개변수 정책 공간으로 투영하여 신경망 파라미터를 갱신한다.
  • 1차 방법이므로 기울기 정보만을 사용하여 계산적으로 효율적이고 쉽게 구현할 수 있다.
  • 정책 기울기 스타일 업데이트를 활용하지만, 제약 조건을 제약 최적화 프레임워크를 통해 명시적으로 통합한다.
  • 알고리즘은 설계상 모든 학습 단계에서 제약 조건 이행을 유지하며, 후행 보정에 의존하지 않는다.

실험 결과

연구 질문

  • RQ1정책 공간에서의 1차 최적화 방법이 딥 강화학습에서 안전 제약을 효과적으로 이행할 수 있는가?
  • RQ2FOCOPS는 보행 작업에서 제약 이행 및 성능 측면에서 최신 기법들과 비교해 어떻게 성과를 내는가?
  • RQ3최적의 정책을 매개변수 공간으로 다시 투영할 때 제약 준수와 성능 향상이 유지되는가?
  • RQ4간단한 1차 방법이 더 복잡한 접근법보다 제약이 있는 강화학습에서 더 나은 성능을 낼 수 있는가?

주요 결과

  • FOCOPS는 테스트 시점에만 제약을 보장하는 방법들과 달리 전체 학습 과정 내내 제약 이행을 보장한다.
  • 최신 기법들과 비교해 제약이 있는 로봇 보행 작업에서 뛰어난 성능을 달성한다.
  • 1차 성격과 기울기 기반 업데이트에 의존함으로써 계산적으로 효율적이고 구현이 간편하다.
  • 실험 결과 FOCOPS가 엄격한 비용 제약 조건 하에서도 높은 샘플 효율성과 안정적인 학습을 유지함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.