[논문 리뷰] Behavioral Priors and Dynamics Models: Improving Performance and Domain Transfer in Offline RL
이 논문은 불확실성 추정을 필요로 하지 않고 성능과 도메인 일반화 능력을 향상시키기 위해 적응형 행동 사전과 학습된 동역학 모델을 결합한 모델 기반 오프라인 강화학습 알고리즘인 MABE를 제안한다. MABE는 D4RL 벤치마크에서 최고 성능을 기록하며, 특히 KL 발산을 통해 정책을 적응형 행동 사전에 명시적으로 정규화하는 방식으로 이전의 모델-프리 및 모델 기반 방법들을 능가하는 도메인 간 전이 성능을 보여준다.
Offline Reinforcement Learning (RL) aims to extract near-optimal policies from imperfect offline data without additional environment interactions. Extracting policies from diverse offline datasets has the potential to expand the range of applicability of RL by making the training process safer, faster, and more streamlined. We investigate how to improve the performance of offline RL algorithms, its robustness to the quality of offline data, as well as its generalization capabilities. To this end, we introduce Offline Model-based RL with Adaptive Behavioral Priors (MABE). Our algorithm is based on the finding that dynamics models, which support within-domain generalization, and behavioral priors, which support cross-domain generalization, are complementary. When combined together, they substantially improve the performance and generalization of offline RL policies. In the widely studied D4RL offline RL benchmark, we find that MABE achieves higher average performance compared to prior model-free and model-based algorithms. In experiments that require cross-domain generalization, we find that MABE outperforms prior methods. Our website is available at https://sites.google.com/berkeley.edu/mabe .
연구 동기 및 목표
- 낮은 품질이거나 비전문가의 오프라인 데이터가 존재하는 환경에서 오프라인 강화학습 알고리즘의 성능와 내구성을 향상시키기 위해.
- 불확실성 추정에 의존하지 않고 오프라인 강화학습에서 도메인 일반화 및 전이 학습 능력을 향상시키기 위해.
- 내부 도메인 일반화(동역학 모델을 통한)와 도메인 간 일반화(행동 사전을 통한)를 모두 활용하는 모델 기반 강화학습 프레임워크를 개발하기 위해.
- 명시적인 정책 정규화를 통해 적응형 행동 사전를 활용하면 불확실성 기반의 보수성보다 오프라인 강화학습에서 더 우수한 성능을 낼 수 있음을 입증하기 위해.
제안 방법
- MABE는 지도학습을 통해 오프라인 데이터셋에서 동역학 모델과 보상 함수를 학습한다.
- 데이터셋 내 고보상 트레이젝터리에 더 높은 중요도를 할당하는 적응형 행동 사전를 구성한다.
- 학습된 동역학 모델을 사용해 시뮬레이션된 롤아웃을 생성함으로써 모델 기반 강화학습을 수행한다.
- 정책은 SAC를 통해 훈련되며, 정책이 적응형 행동 사전에 가까이 있도록 하는 명시적 KL 발산 페널티를 적용하여 보수성을 확보한다.
- 적응형 행동 사전는 강화학습 미세조정을 통해 엔드 투 엔드로 학습되며, 가중치 없는 사전보다 안정성과 점진적 성능 향상을 향상시킨다.
- 복잡한 불확실성 추정에 의존하지 않도록 적응형 행동 사전를 직접 정규화 신호로 사용함으로써 불확실성 추정을 회피한다.
실험 결과
연구 질문
- RQ1동역학 모델과 적응형 행동 사전를 조합하면 기존의 모델-프리 및 모델 기반 방법을 뛰어넘는 오프라인 강화학습 성능 향상을 이룰 수 있는가?
- RQ2트레이젝터리 수익에 따라 가중치를 부여한 적응형 행동 사전는 가중치 없거나 비적응형 사전보다 학습 안정성과 최종 정책 성능 향상에 기여하는가?
- RQ3동역학 모델의 불확실성 추정이 필요 없이 MABE는 강력한 제로샷 도메인 전이 성능를 달성할 수 있는가?
- RQ4D4RL 벤치마크에서 MABE는 샘플 효율성과 데이터 품질에 대한 내구성 측면에서 최고 수준의 오프라인 강화학습 알고리즘과 비교해 어떻게 성능를 낼 수 있는가?
주요 결과
- MABE는 D4RL 벤치마크의 9개 환경에서 평균 성능가장 높으며, 9개 데이터셋 중 7개에서 최고 성능 기록.
- 도메인 간 일반화 작업에서 MABE는 이전 방법들을 크게 능가하며, 다양한 도메인 간 전이 가능성에서 뛰어난 성능를 보여준다.
- 적응형 행동 사전의 사용은 가중치 없는 또는 정규화되지 않은 사전보다 더 안정적인 학습과 향상된 점진적 성능를 이끌어낸다.
- MABE는 동역학 모델의 불확실성 추정이 필요 없이 최고 성능를 달성하여, 고차원 또는 혼란스러운 환경에서 불확실성 추정이 어려운 상황에서도 적용 가능하다.
- 제거 실험 결과, 행동 사전의 강화학습 미세조정이 성능 향상에 핵심적임을 확인하였으며, 가중치 없는 사전는 열등한 성능를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.