Skip to main content
QUICK REVIEW

[논문 리뷰] Denoised MDPs: Learning World Models Better Than the World Itself

Tongzhou Wang, Simon S. Du|arXiv (Cornell University)|2022. 06. 30.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 관찰에서 제어할 수 없고 보상과 관련이 없는 노이즈를 명시적으로 분리함으로써 세계 모델을 학습하는 Denoised MDPs를 제안한다. 이는 더 효율적이고 강건한 강화학습을 가능하게 한다. 신호(제어 가능하고 보상과 관련된 요소)와 노이즈를 분리함으로써, 다양한 제어 및 비제어 작업에서 뛰어난 성능을 달성하며, 노이즈가 많은 환경과 원시 이미지 관찰에서 이전 방법들을 능가한다.

ABSTRACT

The ability to separate signal from noise, and reason with clean abstractions, is critical to intelligence. With this ability, humans can efficiently perform real world tasks without considering all possible nuisance factors.How can artificial agents do the same? What kind of information can agents safely discard as noises? In this work, we categorize information out in the wild into four types based on controllability and relation with reward, and formulate useful information as that which is both controllable and reward-relevant. This framework clarifies the kinds information removed by various prior work on representation learning in reinforcement learning (RL), and leads to our proposed approach of learning a Denoised MDP that explicitly factors out certain noise distractors. Extensive experiments on variants of DeepMind Control Suite and RoboDesk demonstrate superior performance of our denoised world model over using raw observations alone, and over prior works, across policy optimization control tasks as well as the non-control task of joint position regression.

연구 동기 및 목표

  • 실세계 강화학습 환경에서 신호와 노이즈의 구분을 체계적으로 정의하기 위해.
  • 제어할 수 없거나 보상과 관련이 없는 노이즈 요소를 식별하고 제거함으로써 세계 모델의 품질을 향상시키기 위해.
  • 이러한 노이즈를 자동으로 분리할 수 있는 학습 가능한 프레임워크를 개발하여 더 효율적이고 강건한 정책 최적화를 이끌기 위해.
  • 세계 모델이 제어 작업을 넘어선 비제어적 회귀 작업으로도 일반화됨을 입증하기 위해.

제안 방법

  • 제어 가능성과 보상 관련성 기반으로 환경 정보를 네 가지 유형으로 분류: 제어 가능/보상 관련, 제어 가능/관련 없음, 제어 불가능/보상 관련, 제어 불가능/관련 없음.
  • Denoised MDPs를 프레임워크로 제안하여, 핵심 상태 표현으로 제어 가능하고 보상과 관련된 구성요소만 명시적으로 모델링한다.
  • 변동형 오토인코더 기반 아키텍처를 사용하여 관찰을 신호와 노이즈 성분으로 분리하며, 노이즈가 보상과 독립적이도록 제약을 둔다.
  • 신호 공간이 향후 상태와 보상을 예측할 수 있도록 하는 대비 학습 목표를 적용한다.
  • 신호가 제어 가능하고, 노이즈가 제어 불가능하고 보상과 관련이 없도록 하는 인덕티브 편향을 도입한다.
  • 재구성, 대비, 보상 예측 목표의 조합을 사용하여 세계 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1제어 가능성과 보상 관련성 기반으로 환경 정보를 시스템적으로 신호와 노이즈로 분류할 수 있는가?
  • RQ2제어할 수 없고 보상과 관련이 없는 노이즈를 명시적으로 제거하는 학습된 세계 모델이 원시 관찰에 기반한 모델보다 성능이 뛰어나게 되는가?
  • RQ3노이즈 제거가 제어 작업 외에도 비제어적 지도 학습 회귀 작업에서 성능 향상에 기여하는가?
  • RQ4제안된 프레임워크 하에서 다양한 노이즈 유형에 직면했을 때, TIA 및 CURL과 같은 기존 방법들과의 비교는 어떻게 되는가?

주요 결과

  • Denoised MDPs는 DeepMind Control Suite에서 센서 노이즈, 카메라 흔들림, 영상 배경, 노이즈 있는 센서 등 네 가지 노이즈 유형 전반에서 TIA, CURL 및 기타 베이스라인을 일관되게 능가한다.
  • 이 방법은 제어 작업과 공동 위치 회귀 모두에서 최고 성능을 기록하여 강화학습을 넘어선 일반화 능력을 입증한다.
  • 비디오 배경이 있는 Reacher Easy 설정에서 Denoised MDPs는 TIA보다 평균 수익률이 25% 높고, CURL보다 15% 높다.
  • 시각화 결과는 Denoised MDPs가 에이전트의 운동을 올바르게 신호로 분리하고 배경 변화는 노이즈로 모델링하는 반면, TIA는 이를 분리하지 못함을 확인한다.
  • Denoised MDPs 기반 모델 기반 에이전트는 모델리스 베이스라인 대비 뛰어난 샘플 효율성과 강건성을 보였다.
  • 노이즈 제거 세계 모델은 정확한 공동 위치 회귀를 가능하게 하여, 깔끔한 표현이 표준 강화학습 목표 외부에서도 유용함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.