[논문 리뷰] DreamerPro: Reconstruction-Free Model-Based Reinforcement Learning with Prototypical Representations
DreamerPro는 재구성 기반 모델 기반 강화 학습 에이gent의 한계를 보완하기 위해 원형 표현을 활용하여 시각적 방해 요소에 대해 강건하면서도 표준 환경에서 뛰어난 성능을 유지하는 재구성 불필요 모델 기반 강화 학습 에이gent를 제안한다. 순환 세계 모델 상태에서 원형을 학습함으로써 시간적 동역학을 군집 중심으로 압축하여, 표준 및 자연 배경 환경에서의 DeepMind Control 과제에서 Dreamer와 대비 기반 TPC를 모두 능가한다.
Top-performing Model-Based Reinforcement Learning (MBRL) agents, such as Dreamer, learn the world model by reconstructing the image observations. Hence, they often fail to discard task-irrelevant details and struggle to handle visual distractions. To address this issue, previous work has proposed to contrastively learn the world model, but the performance tends to be inferior in the absence of distractions. In this paper, we seek to enhance robustness to distractions for MBRL agents. Specifically, we consider incorporating prototypical representations, which have yielded more accurate and robust results than contrastive approaches in computer vision. However, it remains elusive how prototypical representations can benefit temporal dynamics learning in MBRL, since they treat each image independently without capturing temporal structures. To this end, we propose to learn the prototypes from the recurrent states of the world model, thereby distilling temporal structures from past observations and actions into the prototypes. The resulting model, DreamerPro, successfully combines Dreamer with prototypes, making large performance gains on the DeepMind Control suite both in the standard setting and when there are complex background distractions. Code available at https://github.com/fdeng18/dreamer-pro .
연구 동기 및 목표
- 재구성 기반 세계 모델의 한계를 해결하기 위해, 임의의 작업과 관련 없는 시각적 세부 정보에 과적합되고 계산 비용이 높은 MBRL에서의 문제점을 해결한다.
- 재구성 불필요 MBRL에서 대비 학습의 불안정성과 배치 크기 의존성을 해결하기 위해 원형 기반 접근법을 채택한다.
- 표준 군집화 방법이 忽시하는 순차적 구조를 유지하기 위해 시간적 동역학을 원형 표현에 통합한다.
- 표준 RL 벤치마크에서 성능을 훼손하지 않으면서도 시각적 방해 요소에 대한 강건성을 향상시킨다.
- 원형 기반 표현 학습이 세계 모델 동역학과 효과적으로 조합될 수 있음을 입증한다.
제안 방법
- 원시 관측값이 아닌 세계 모델의 동역학 네트워크의 순환 은닉 상태에서 원형을 학습한다.
- 배치 전체에 걸쳐 균일한 군집 할당을 장려하는 대비 유사 목적함수를 사용하여 서로 다른 관측값을 분리한다.
- 각 관측값의 군집 할당을 재구성하도록 세계 모델을 훈련시되, 원시 관측값을 재구성하는 것이 아니라, 저수준의 시각적 노이즈에 초점을 줄이기 위해 이를 감소시킨다.
- 백프로파게이션을 통한 엔드 투 엔드 훈련을 가능하게 하기 위해 기저의 미분 가능한 순환 상태공간 모델(RSSM)을 유지한다.
- 표준 관측 재구성 손실 대신 원형 재구성 손실을 도입하여 표현 학습과 픽셀 수준의 세부 정보를 분리한다.
- MoCo나 SwAV와 유사하게 모멘텀 인코더를 사용하여 원형 업데이트를 안정화시켜 훈련 안정성을 향상시킨다.
실험 결과
연구 질문
- RQ1재구성 없이도 원형 표현 학습이 모델 기반 강화 학습에서 시각적 방해 요소에 대해 강건성을 향상시킬 수 있는가?
- RQ2원형과 순환 세계 모델 동역학을 조합했을 때 장기 계획 및 샘플 효율성에 어떤 영향을 미치는가?
- RQ3원형 기반 세계 모델이 다양한 시각적 환경에서 재구성 기반(Dreamer) 및 대비 기반(TPC) 접근법을 모두 능가하는가?
- RQ4원형 학습이 표준 제어 과제에서 높은 성능를 유지하면서도 방해 요소가 많은 배경에서 뛰어난 성능를 발휘할 수 있는가?
- RQ5명시적 지도 학습이나 인스턴스 수준의 대비 비교 없이도 시간적 구조를 원형에 압축하는 것이 가능한가?
주요 결과
- DreamerPro는 DeepMind Control 스위트의 모든 과제에서 Dreamer와 TPC를 일관되게 능가하며, 특히 자연 배경 방해 요소가 있는 경우에 두드러진 성능을 보인다.
- 표준 DMC 설정에서는 재구성 손실을 제거했음에도 불구하고 Dreamer와 비교해 유사하거나 뛰어난 성능를 달성한다.
- 배경에 실제 세계 영상 클립을 삽입한 자연 배경 설정에서는 Dreamer와 TPC를 크게 능가한다.
- 원형 기반 접근법은 시각적 노이즈와 작업과 관련 없는 세부 정보에 대한 민감도를 감소시켜, 더 안정적이고 정확한 세계 모델 롤아웃을 보여준다.
- 원형에 포함된 예측 가능한, 작업 관련 동역학에 초점을 맞춤으로써 더 뛰어난 샘플 효율성과 정책 성능를 달성한다.
- 제거 분석 결과, 순환 상태를 원형 학습에 사용하는 것이 핵심임을 확인하였으며, 직접 관측값 기반 원형은 시간적 구조를 포착하지 못하고 성능이 열 劣한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.