[논문 리뷰] MUSBO: Model-based Uncertainty Regularized and Sample Efficient Batch Optimization for Deployment Constrained Reinforcement Learning
MUSBO는 불확실성 정규화된 정책 업데이트와 능동적 데이터 수집을 조합하여 배포 제약이 있는 강화학습에서 샘플 효율성을 향상시키는 모델 기반 강화학습 프레임워크이다. 불확실성 인식 부트스트랩을 통해 저지원, 고불확실성 영역의 업데이트를 낮게 조정하고 새로운 고품질 전이를 우선순위에 두어, 더 적은 배포와 데이터로 최신의 성능을 달성한다.
In many contemporary applications such as healthcare, finance, robotics, and recommendation systems, continuous deployment of new policies for data collection and online learning is either cost ineffective or impractical. We consider a setting that lies between pure offline reinforcement learning (RL) and pure online RL called deployment constrained RL in which the number of policy deployments for data sampling is limited. To solve this challenging task, we propose a new algorithmic learning framework called Model-based Uncertainty regularized and Sample Efficient Batch Optimization (MUSBO). Our framework discovers novel and high quality samples for each deployment to enable efficient data collection. During each offline training session, we bootstrap the policy update by quantifying the amount of uncertainty within our collected data. In the high support region (low uncertainty), we encourage our policy by taking an aggressive update. In the low support region (high uncertainty) when the policy bootstraps into the out-of-distribution region, we downweight it by our estimated uncertainty quantification. Experimental results show that MUSBO achieves state-of-the-art performance in the deployment constrained RL setting.
연구 동기 및 목표
- 의료, 금융, 로봇 분야와 같은 실제 강화학습 응용 분야에서 온라인 상호작용이 비용이 많이 들거나 안전하지 않은 경우 정책 배포 횟수 제약이 있는 문제를 해결하기 위해.
- 순수한 오프라인 강화학습과 온라인 강화학습 사이의 격차를 메우기 위해 제약된 환경 상호작용으로도 효율적이고 반복적인 정책 개선을 가능하게 하기 위해.
- 데이터 수집이 배치 처리되고 흔치 않은 환경에서 샘플 효율성과 정책 성능을 향상시키기 위해.
- 각 배포 중에 새로운 고품질 전이를 능동적으로 탐지함으로써 모델 정확도와 정책 학습을 향상시키는 프레임워크를 개발하기 위해.
- 모델 생성 롤아웃에서의 불확실성 측정을 기반으로 정책 업데이트를 가중함으로써 분포 이탈과 외삽 오차를 줄이기 위해.
제안 방법
- MUSBO는 오프라인 훈련 중에 학습된 환경 모델을 사용해 가짜 롤아웃을 생성하며, 이를 정책 업데이트에 활용한다.
- 낮은 지원(고불확실성) 영역에서는 영향을 줄이고 높은 지원(저불확실성) 영역에서는 영향을 늘리기 위해 불확실성 정규화 계수를 적용하여 정책 업데이트를 가중한다.
- 데이터 수집 정책은 새로운 배치와 이전에 수집된 데이터 간의余弦 거리(코사인 거리)를 최대화함으로써 새로운 전이를 탐지하도록 최적화되어, 탐색되지 않은 상태-행동 영역의 커버리지가 보장된다.
- 프레임워크는 배포와 오프라인 훈련을 번갈아가며 수행한다: 각 배포에서 새로운 데이터 배치가 수집되고, 이는 역동성 모델을 정밀화하고 정책 성능을 향상시키는 데 사용된다.
- 불확실성 계수는 모델의 예측 분산에서 유도되며, 분포 외 영역에서 낙관적인 업데이트를 방지하고 안정성을 확보한다.
- 이 방법은 불확실성 정규화와 능동적 데이터 수집 전략을 모두 조합하며, 아블레이션 연구를 통해 이들이 성능과 모델 정확도에 상호 보완적인 영향을 미친다는 것이 입증되었다.
실험 결과
연구 질문
- RQ1불확실성 정규화된 정책 업데이트는 배포 제약이 있는 강화학습에서 샘플 효율성과 강인성을 향상시키는가?
- RQ2새로운 전이를 우선순위에 두는 능동적 데이터 수집은 수렴 속도를 높이고 정책 성능을 향상시키는가?
- RQ3불확실성 정규화와 데이터 수집 전략은 배치 최적화 강화학습에서 모델 정확도와 누적 보상에 개별적으로나 공동으로 어떤 영향을 미치는가?
- RQ4MUSBO는 데이터 효율성과 최종 성능 측면에서 BREMEN 및 MOPO와 같은 기존의 배포 제약이 있는 강화학습 베이스라인을 능가할 수 있는가?
- RQ5불확실성 인식 부트스트랩은 모델 기반 강화학습에서 분포 이탈과 외삽 오차를 어느 정도 줄일 수 있는가?
주요 결과
- Cheetah-Run 환경에서 MUSBO는 단 두 번의 배포로 누적 보상 550점을 기록했으며, 베이스라인들은 동일한 점수에 도달하기 위해 네에서 다섯 번의 배포가 필요했다.
- 250만 건의 총 데이터로 설정된 Walker2D와 Hopper 환경에서 MUSBO는 후속 배포에서 특히 두드러진 성능 격차를 보였으며, 이는 더 빠른 학습과 더 높은 샘플 효율성을 의미한다.
- 아블레이션 연구에서 불확실성 계수는 데이터 수집 전략만 사용하는 것보다 누적 보상에 더 강한 영향을 미쳤지만, 후자는 모델 역동성 향상에 더 크게 기여했다.
- 불확실성 정규화와 능동적 데이터 수집의 조합이 모델 정확도(에너지 거리와 MSE로 측정)와 최종 정책 수익 모두에서 최고의 성능을 달성했다.
- MUSBO는 무작위 또는 베이스라인 정책보다 매 배포당 훨씬 더 많은 새로운 전이를 탐지했으며, 이는 이전 데이터 배치와의 평균 코사인 거리로 측정되었다.
- 데이터 크기를 줄였을 때(250만 대비 500만)에도 MUSBO는 강력한 성능 유지를 보였으며, 이는 데이터 제약 하에서도 강인하고 효율적임을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.