[논문 리뷰] Supervised Policy Update.
이 논문은 표본 효율적인 딥 강화 학습 방법인 감독 정책 업데이트(SPU)를 소개한다. SPU는 먼저 근접 영역 내에서 비매개변수 정책을 최적화한 후, 이를 매개변수 정책으로 감지하기 위해 감독 회귀를 사용하여 표본 생성을 수행한다. SPU는 단일 최적화 프레임워크 아래 TRPO와 PPO를 통합함으로써 로봇 운동 과제에서 PPO보다 더 뛰어난 표본 효율성을 달성한다.
We propose a new sample-efficient methodology, called Supervised Policy Update (SPU), for deep reinforcement learning. Starting with data generated by the current policy, SPU optimizes over the proximal policy space to find a non-parameterized policy. It then solves a supervised regression problem to convert the non-parameterized policy to a parameterized policy, from which it draws new samples. There is significant flexibility in setting the labels in the supervised regression problem, with different settings corresponding to different underlying optimization problems. We develop a methodology for finding an optimal policy in the non-parameterized policy space, and show how Trust Region Policy Optimization (TRPO) and Proximal Policy Optimization (PPO) can be addressed by this methodology. In terms of sample efficiency, our experiments show SPU can outperform PPO for simulated robotic locomotion tasks.
연구 동기 및 목표
- 고차원 연속 제어 과제에서 특히 표본 비효율성 문제를 해결하기 위해.
- TRPO와 PPO와 같은 기존의 근접 정책 최적화 방법들을 단일 유연한 프레임워크 아래 통합하고 일반화하기 위해.
- 감독 회귀 단계를 통해 정책 최적화를 매개변수화로부터 분리하여 정책 학습 효율성을 향상시키기 위해.
- 배포를 위한 매개변수 정책으로의 감지 이전에 안정적인 최적화를 위해 비매개변수 정책을 사용할 수 있도록 하기 위해.
제안 방법
- SPU는 현재 정책를 사용하여 오프-폴리시 롤아웃을 생성하여 상태-행동 쌍의 데이터셋을 구성한다.
- 그런 다음 현재 정책의 근접 영역 내에서 비매개변수 정책을 최적화하여 안정성과 향상을 보장한다.
- 감독 회귀 문제를 정의하여 상태를 행동으로 매핑한다. 레이블은 최적화된 비매개변수 정책에서 유도된다.
- 이 회귀 모델은 비매개변수 정책의 행동을 모방하는 매개변수 정책을 생성하도록 훈련된다.
- 유연한 레이블 설계를 허용하여, TRPO와 PPO를 특수 케이스로 복원하거나 일반화할 수 있다.
- 업데이트된 매개변수 정책에서 새로운 롤아웃을 수집하여 반복적 향상을 위한 루프를 완성한다.
실험 결과
연구 질문
- RQ1비매개변수 정책 최적화와 감독 감지를 조합한 이중 단계 접근법이 딥 강화 학습의 표본 효율성을 향상시킬 수 있는가?
- RQ2근접 정책 업데이트와 감독 회귀를 사용하여 TRPO와 PPO를 단일 최적화 프레임워크 아래 통합할 수 있는가?
- RQ3감독 회귀 단계에서 어떤 레이블 구성이 최적의 정책 성능와 안정성을 이끌어내는가?
- RQ4제안된 방법이 연속 제어 벤치마크에서 표준 PPO보다 표본 효율성이 뛰어나게 되는가?
주요 결과
- SPU는 시뮬레이션된 로봇 운동 과제에서 PPO보다 뛰어난 표본 효율성을 달성하여 환경 상호작용 수를 줄이고 더 빠르게 학습한다.
- 감독 회귀 단계에서의 레이블 설계 조정을 통해 TRPO와 PPO를 성공적으로 일반화한다.
- 비매개변수 정책 공간에서 최적화함으로써 신경망 매개변수화에 의존하지 않고도 안정적이고 효과적인 정책 업데이트를 가능하게 한다.
- 비매개변수 정책에서 매개변수 정책으로의 감지 단계는 성능를 유지하면서 동시에 훈련을 위한 효율적인 롤아웃을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.