[논문 리뷰] Mutual Information Maximization for Robust Plannable Representations
MIRO는 모델 기반 강화 학습에서 강건하고 계획 가능한 잠재 표현을 학습하기 위해 상호정보량 최대화 접근법을 제안한다. 노이즈 대비 추정기(NCE)를 사용하여 잠재 상태와 향후 관측치 간의 상호정보량을 최적화함으로써, 재구성 기반 방법에 비해 시각적 방해물과 혼잡한 환경에서 훨씬 더 뛰어난 강건성을 확보하면서도 표준 제어 벤치마크에서 뛰어난 성능을 유지한다.
Extending the capabilities of robotics to real-world complex, unstructured environments requires the need of developing better perception systems while maintaining low sample complexity. When dealing with high-dimensional state spaces, current methods are either model-free or model-based based on reconstruction objectives. The sample inefficiency of the former constitutes a major barrier for applying them to the real-world. The later, while they present low sample complexity, they learn latent spaces that need to reconstruct every single detail of the scene. In real environments, the task typically just represents a small fraction of the scene. Reconstruction objectives suffer in such scenarios as they capture all the unnecessary components. In this work, we present MIRO, an information theoretic representational learning algorithm for model-based reinforcement learning. We design a latent space that maximizes the mutual information with the future information while being able to capture all the information needed for planning. We show that our approach is more robust than reconstruction objectives in the presence of distractors and cluttered scenes
연구 동기 및 목표
- 모델 자유형 강화 학습의 샘플 비효율성과 재구성 기반 모델 기반 강화 학습에서 불필요한 세부 사항에 대한 과적합 문제를 해결하기 위해.
- 고차원 관측치에서 노이즈와 방해물 등을 제거하고 임의의 작업 관련 동역학만 포착하는 잠재 공간을 학습하기 위해.
- 정보 이론 기반 표현 학습을 통해 실세계 환경에서의 시각적 혼잡성과 외란에 대한 강건성을 향상시키기 위해.
- 샘플 효율성을 확보하면서도 시각적 노이즈 하에서 계획 성능을 유지할 수 있는 방법을 개발하기 위해.
- 상호정보량 최대화가 재구성 목표에 비해 더 강건하고 일반화 가능한 표현을 이끌어내는지 증명하기 위해.
제안 방법
- 방법은 잠재 상태와 향후 관측치 간의 상호정보량에 대한 노이즈 대비 추정기(NCE) 하한을 최적화한다.
- 분포 가정을 피하기 위해 에너지 기반 모델을 사용하며, 이는 잠재 표현의 분류적 학습을 가능하게 한다.
- 잠재 공간은 예측 모델, 보상 예측기, 필터링 함수와 함께 엔드 투 엔드 학습을 통해 함께 학습된다.
- 잠재 전이 모델에 재구성 기법을 적용하여 미분 가능한 샘플링과 역전파를 가능하게 한다.
- 모델 예측 제어(MPC-CEM)를 사용하여 계획을 수행하며, 온라인 데이터 수집과 모델 재학습을 수행한다.
- NCE 목표 함수의 음성 샘플은 향후 관측치의 배치에서 추출된다.
실험 결과
연구 질문
- RQ1시각적 방해물이 존재할 경우, 상호정보량 최대화가 재구성 기반 목표에 비해 더 강건한 잠재 표현을 생성할 수 있는가?
- RQ2최첨단 재구성 기반 방법과 비교할 때, MIRO는 샘플 효율성과 점점 향한 성능에서 어떻게 성과를 내는가?
- RQ3환경에 시각적 노이즈를 포함시키면 MIRO와 재구성 기반 모델의 성능은 향상되는가, 악화되는가?
- RQ4장면에 혼잡함과 불필요한 물체가 존재하더라도 MIRO는 임의의 작업 관련 동역학만 포착하는 잠재 공간을 학습할 수 있는가?
- RQ5잠재 상태와 향후 관측치 간의 상호정보량을 최대화하면, 비정형 환경에서 더 나은 계획 성능을 달성할 수 있는가?
주요 결과
- MIRO는 랜덤하게 배치된 빨간 구와 초록 큐브와 같은 방해물이 존재하는 상황에서도 성능을 유지하거나 향상시키며, PlaNet과 같은 재구성 기반 방법은 심각하게 성능이 떨어진다.
- 청타 환경에서 MIRO는 시각적 노이즈가 있을수록 성능이 향상되며, 이는 방해물이 모델이 작업 관련 특징에 집중하도록 돕는다는 것을 시사한다.
- 카트폴 밸런스 환경에서 PlaNet은 방해물 하에서 효과적으로 학습하지 못하지만, MIRO는 안정적이고 성공적인 학습을 달성한다.
- 방해물이 없는 조건에서는 MIRO가 모든 네 가지 벤치마크 환경(CartPole, Reacher, Finger, 하프 체타)에서 PlaNet과 동일하거나 더 높은 점점 향한 성능을 확보한다.
- NCE 기반 상호정보량 목표는 불필요한 시각적 세부 정보와 노이즈를 제거한 더 강건한 잠재 공간을 가능하게 한다.
- 잠재 표현과 예측 모델의 공동 최적화는 실세계 유사 환경에서 계획의 강건성과 샘플 효율성을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.