Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised Visual Reinforcement Learning with Object-centric Representations

Andrii Zadaianchuk, Maximilian Seitzer|arXiv (Cornell University)|2020. 11. 29.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 이미지 관측만을 사용하고 정답 지도 없이, 복합적 구성 환경에서 재사용 가능한 스킬을 탐지하고 학습하기 위해 구성형 생성 세계 모델(SCALOR)에서 유도된 물체 중심 표현을 활용하는 자기지도 시각 강화학습 프레임워크인 SMORL을 제안한다. 구조적이고 분리된 물체 표현과 목표 조건부 어텐션 정책을 활용함으로써, SMORL는 다중 물체 환경에서 다중 물체 재배치와 같은 복잡한 구성 작업에서 VAE 기반 기준선보다 뛰어난 성능을 달성한다.

ABSTRACT

Autonomous agents need large repertoires of skills to act reasonably on new tasks that they have not seen before. However, acquiring these skills using only a stream of high-dimensional, unstructured, and unlabeled observations is a tricky challenge for any autonomous agent. Previous methods have used variational autoencoders to encode a scene into a low-dimensional vector that can be used as a goal for an agent to discover new skills. Nevertheless, in compositional/multi-object environments it is difficult to disentangle all the factors of variation into such a fixed-length representation of the whole scene. We propose to use object-centric representations as a modular and structured observation space, which is learned with a compositional generative world model. We show that the structure in the representations in combination with goal-conditioned attention policies helps the autonomous agent to discover and learn useful skills. These skills can be further combined to address compositional tasks like the manipulation of several different objects.

연구 동기 및 목표

  • 단순한 시각 관측만을 사용하여 다수의 물체를 포함한 구성 환경에서 유용하고 일반적인 목적의 스킬을 학습하는 데 도전한다.
  • 고정 길이 VAE 잠재 표현 대신 구조적이고 분리된 물체 중심 표현을 활용하여 시각 강화학습의 샘플 효율성과 탐색 능력을 향상시킨다.
  • 인간이 제공한 보상 함수나 정답 애너테이션 없이도 자율적인 목표 탐지와 스킬 학습을 가능하게 한다.
  • 물체 중심 표현이 시각 강화학습에서 분포 외 일반화 능력과 구성 작업 해결 능력을 향상시키는지 평가한다.

제안 방법

  • 방법론은 원시 이미지 관측에서 물체 중심 표현을 학습하기 위해 SCALOR 아키텍처를 활용하여, 장면을 이산적이고 구조화된 실체로 분해한다.
  • 목표 조건부 어텐션 정책을 학습하여 현재 관측과 목표 표현에 기반해 행동을 선택함으로써 목표 조건부 제어를 가능하게 한다.
  • 학습 중에 목표 표현은 초기 관측의 표현에서 조건부로 샘플링되며, 이는 에이전트가 다양한 목표를 탐색할 수 있도록 한다.
  • 테스트 시점에는 외부 목표 이미지가 후보 목표 표현으로 인코딩되며, 에이전트는 가장 잘 매칭되는 목표를 선택하여 순차적으로 추적한다.
  • 밀도 또는 희박한 보상 설계에 의존하지 않고, 물체 중심 잠재 공간의 구조에서 유도된 자기지도 보상 신호를 사용한다.
  • 생성 세계 모델을 통합하여 장면 분해와 표현 학습을 동시에 수행함으로써 데이터 효율성과 이식 가능성 향상을 도모한다.

실험 결과

연구 질문

  • RQ1구성형 생성 모델을 통해 학습된 물체 중심 표현은 다중 물체 시각 환경에서 스킬 탐지 및 강화학습 성능 향상에 기여하는가?
  • RQ2복잡한 구성 작업에서 SMORL는 VAE 기반 자기지도 강화학습 방법과 비교해 샘플 효율성과 성능 면에서 어떻게 다른가?
  • RQ3학습 중에 관측한 물체 수와 다른 수의 물체를 포함한 환경으로 SMORL 에이전트가 얼마나 잘 일반화되는가?
  • RQ4구조적이고 분리된 표현을 사용할 경우 표준 VAE 기반 접근법에 비해 분포 외 일반화 능력이 향상되는가?

주요 결과

  • 다중 물체 시각 재배치 환경에서 SMORL는 RIG와 Skew-Fit를 모두 뛰어넘는 성능을 보이며, 복잡한 작업에서 물체 중심 표현의 이점을 입증했다.
  • 더 단순한 다중 물체 시각 밀기 환경에서는 SMORL가 최고의 기준선과 유사한 성능을 달성하여 다양한 작업 복잡도에서의 강건성을 보였다.
  • 두 개의 물체로 이루어진 재배치 작업에서 훈련된 SMORL 에이전트는 한 개의 물체로 이루어진 테스트 환경으로도 효과적으로 일반화되어, 한 개의 물체로 사전 훈련된 에이전트와 유사한 성능을 기록했다.
  • 강력한 결과에도 불구하고, SMORL는 정답 표현을 사용하는 SAC보다 성능이 열등했으며, 이는 SCALOR의 음영 처리 및 표현 노이즈로 인한 한계를 시사한다.
  • 이 방법론은 물체 중심 표현이 학습된 하위 작업들을 순차적으로 실행할 수 있도록 하여, 스킬을 조합함으로써 복잡한 구성 목표를 해결할 수 있음을 보여주었다.
  • SCALOR 학습의 계산 비용은 VAE보다 높지만, 추론 오버헤드는 낮아 사전 훈련 후 배포에 있어 확장성이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.