Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Policy Search for Lifelong Reinforcement Learning with Sublinear Regret

Haitham Bou Ammar, Rasul Tutunov|arXiv (Cornell University)|2015. 05. 21.
Reinforcement Learning in Robotics참고 문헌 25인용 수 21
한 줄 요약

이 논문은 정책 그래디언트를 사용하여 하위선형 회귀를 갖는 안전한 수명 주기 강화 학습 알고리즘을 제안한다. 이는 적대적 온라인 다중작업 학습과 안전 제약 조건을 활용하며, R라운드 동안 $\mathcal{O}(\sqrt{R})$의 회귀를 달성하고, 제약 조건 최적화를 통해 안전한 정책을 구현한다. 이는 기준 PG 및 PG-ELLA보다 벤치마크 시스템과 큼지막한 드론 제어에서 학습 속도와 안전성 준수 면에서 뛰어나다.

ABSTRACT

Lifelong reinforcement learning provides a promising framework for developing versatile agents that can accumulate knowledge over a lifetime of experience and rapidly learn new tasks by building upon prior knowledge. However, current lifelong learning methods exhibit non-vanishing regret as the amount of experience increases and include limitations that can lead to suboptimal or unsafe control policies. To address these issues, we develop a lifelong policy gradient learner that operates in an adversarial set- ting to learn multiple tasks online while enforcing safety constraints on the learned policies. We demonstrate, for the first time, sublinear regret for lifelong policy search, and validate our algorithm on several benchmark dynamical systems and an application to quadrotor control.

연구 동기 및 목표

  • 수명 주기 강화 학습에서 점점 커지는 경험에도 불구하고 사라지지 않는 회귀를 해결하기 위해.
  • 고차원 제어 작업에서 치명적인 실패를 방지하면서 안전한 정책 학습을 가능하게 하기 위해.
  • 다양한 작업 간 지식 공유를 유지하면서도 하위선형 회귀를 유지하는 수명 주기 정책 그래디언트 방법을 개발하기 위해.
  • 제약 인식 최적화를 통해 정책의 안전성을 확보하여 무한대이거나 해로운 제어 정책을 피하기 위해.
  • 역동적 시스템과 큼지막한 드론 제어에서 방법을 검증하여 빠른 수렴과 안전성 준수를 입증하기 위해.

제안 방법

  • 수명 주기 학습을 적대적 작업 순서를 고려한 온라인 다중작업 학습으로 수식화하여 회귀를 최소화한다.
  • 정책을 매개변수화하기 위해 공유 기저 행렬 $\bm{L}$ 과 작업별 특화 계수 $\bm{s}_{t}$ 로 구성된 잠재 지식 기반을 사용한다.
  • 각 작업마다 $\bm{L}$ 과 $\bm{s}_{t}$ 를 번갈아가며 갱신하여 효율적인 지식 전이를 보장한다.
  • 정책 매개변수에 대해 타당 영역으로의 투영을 통해 안전 제약 조건을 적용하여 위험한 행동을 방지한다.
  • 국소적으로 최적의 정책 주변에서 두 번째 순서 테일러 전개를 기반으로 한 가중치가 부여된 2차 근사에 기반한 정책 그래디언트 목표를 적용한다.
  • 이론적 분석을 통해 $R$라운드 동안 회귀가 $\mathcal{O}(\sqrt{R})$로 스케일링됨을 증명한다. 이는 하위선형 회귀를 달성한다.

실험 결과

연구 질문

  • RQ1수명 주기 정책 그래디언트 학습이 온라인 다중작업 설정에서 하위선형 회귀를 달성할 수 있는가?
  • RQ2정책 전이 중에 치명적인 실패를 방지하기 위해 안전 제약 조건을 효과적으로 어떻게 구현할 수 있는가?
  • RQ3공유된 잠재 표현이 다양한 작업 간 빠른 수렴과 향상된 성능을 가능하게 할 수 있는가?
  • RQ4학습 속도와 안전성 측면에서 비제약 PG 및 PG-ELLA와 비교해 본다면, 이 방법은 어떻게 다른가?
  • RQ5번갈아가며 최적화하는 반복 횟수의 증가는 수렴과 제약 준수에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 $R$라운드 동안 $\mathcal{O}(\sqrt{R})$의 회귀를 달성하여, 점점 커지는 회귀를 보이는 방법보다 뚜렷이 뛰어나다.
  • 간단한 질량과 카트폴과 같은 벤치마크 시스템에서, 이 방법은 표준 PG 및 PG-ELLA보다 初기 성능과 학습 속도 면에서 모두 뛰어나다.
  • 모든 제약 조건이 있는 작업에서 이 방법은 안전 제약 조건을 성실히 준수하지만, 표준 PG 및 PG-ELLA는 자주 이를 위반한다.
  • 드론 제어에서, 이 방법은 단 한 번의 관측만으로 안전한 정책을 확보할 수 있었고, 반면 PG-ELLA 및 표준 PG는 평균 510~545회 관측이 필요했다.
  • 번갈아가며 최적화하는 반복 횟수를 늘일수록 최적의 정책으로 향하는 경로가 더 직접적이 되어 수렴 효율성이 향상된다.
  • 실험 결과는 이 방법이 여러 연속된 작업에서 높은 성능를 유지하면서도 안전성과 하위선형 회귀를 확보하고 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.