Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Adversarial Imitation Learning using Variational Models

Rafael Rafailov, Tianhe Yu|arXiv (Cornell University)|2021. 07. 16.
Reinforcement Learning in Robotics참고 문헌 47인용 수 5
한 줄 요약

이 논문은 시각적 시연에서 시각운동 정책을 학습하기 위해 잠재공간 동역학 모델과 판별기(구분기)를 사용하는 변동형 모델 기반 적대적 모방학습 프레임워크인 V-MAIL을 제안한다. 모델 내에서 온정책 롤아웃을 가능하게 함으로써 V-MAIL은 안정적이고 샘플 효율적인 학습을 달성하며, 환경 상호작용 없이도 새로운 작업으로의 제로샷 전이를 가능하게 하여 최적의 성능에 도달한다.

ABSTRACT

Reward function specification, which requires considerable human effort and iteration, remains a major impediment for learning behaviors through deep reinforcement learning. In contrast, providing visual demonstrations of desired behaviors often presents an easier and more natural way to teach agents. We consider a setting where an agent is provided a fixed dataset of visual demonstrations illustrating how to perform a task, and must learn to solve the task using the provided demonstrations and unsupervised environment interactions. This setting presents a number of challenges including representation learning for visual observations, sample complexity due to high dimensional spaces, and learning instability due to the lack of a fixed reward or learning signal. Towards addressing these challenges, we develop a variational model-based adversarial imitation learning (V-MAIL) algorithm. The model-based approach provides a strong signal for representation learning, enables sample efficiency, and improves the stability of adversarial training by enabling on-policy learning. Through experiments involving several vision-based locomotion and manipulation tasks, we find that V-MAIL learns successful visuomotor policies in a sample-efficient manner, has better stability compared to prior work, and also achieves higher asymptotic performance. We further find that by transferring the learned models, V-MAIL can learn new tasks from visual demonstrations without any additional environment interactions. All results including videos can be found online at \url{https://sites.google.com/view/variational-mail}.

연구 동기 및 목표

  • 시각적 시연에서의 표현 학습, 샘플 복잡도, 학습 불안정성 문제를 해결하기 위해.
  • 행동 클로닝과 모델 프리(adversarial) 모방학습의 한계, 즉 분포 이탈과 열악한 점진적 성능을 극복하기 위해.
  • 추가적인 환경 상호작용 없이도 소수의 시각적 시연만으로 새로운 작업으로의 제로샷 전이를 가능하게 하기 위해.
  • 온정책 롤아웃과 자기지도 표현 학습을 위한 변동형 동역학 모델을 활용하여 학습 안정성과 샘플 효율성을 향상시키기 위해.
  • 고차원 시각적 관측 공간에서 모델 기반 강화학습과 적대적 모방학습을 통합하는 통합 프레임워크를 개발하기 위해.

제안 방법

  • 변동형 잠재공간 동역학 모델을 학습하여 시각적 관측을 재구성하고 향후 상태를 예측함으로써 표현 학습과 환경 모델링을 동시에 가능하게 한다.
  • 모델이 합성 온정책 롤아웃을 생성함으로써 실제 환경 상호작용에 대한 의존도를 낮추고 적대적 학습의 안정성을 높인다.
  • 판별기는 전문가의 시연에서 유래한 잠재 상태와 에이전트의 롤아웃에서 유래한 상태를 구분하도록 학습되며, 정책 최적화를 위한 보상 신호를 제공한다.
  • 정책은 판별기의 출력을 보상으로 사용하여 학습되며, 이는 에이전트가 전문가의 상태 방문 분포를 따라가도록 유도한다.
  • 변동형 모델의 이미지 인코더를 정책 네트워크와 통합하여 종단 간 시각운동 정책를 엔드 투 엔드로 형성한다.
  • 새로운 작업의 시연를 사용하여 사전 학습된 동역학 모델을 재사용함으로써, 추가적인 환경 상호작용 없이도 제로샷 전이를 가능하게 한다.

실험 결과

연구 질문

  • RQ1모델 프리 방법과 비교할 때, 변동형 모델 기반 접근이 시각적 모방학습에서 샘플 효율성과 학습 안정성 향상에 기여하는가?
  • RQ2학습된 동역학 모델이 실제 환경 상호작용 없이 효과적인 온정책 롤아웃을 가능하게 하는가? 이를 통해 샘플 복잡도가 감소하는가?
  • RQ3사전 학습된 모델이 시각적 시연만으로도 새로운 작업으로의 제로샷 전이를 어느 정도 지원하는가?
  • RQ4변동형 프레임워크에서의 표현 학습과 동역학 모델링이 고차원 시각적 제어 작업에서 점진적 성능에 어떤 영향을 미치는가?
  • RQ5잠재 상태 분포에서 유도된 판별기 기반 보상 신호가 고차원 시각적 환경에서 행동 클로닝과 이전의 적대적 모방학습을 능가하는가?

주요 결과

  • V-MAIL은 이전 방법들보다 높은 점진적 성능을 달성하며, 시각 기반 이동 및 조작 작업에서 전문가 수준의 성능을 종종 재현한다.
  • 이전의 적대적 모방학습 접근법에서 관찰된 불안정하고 기복적인 학습 곡선과는 달리, V-MAIL은 안정적이고 거의 단조로운 학습 곡선을 보인다.
  • V-MAIL은 기존 기준선 방법들보다 훨씬 적은 환경 상호작용으로도 성공적인 정책을 학습함으로써 뛰어난 샘플 효율성을 보여준다.
  • 제로샷 모방학습에서 V-MAIL은 추가적인 환경 상호작용 없이도 소수의 시각적 시연만으로 새로운 작업을 성공적으로 학습하며, 사전 학습된 동역학 모델을 활용한다.
  • 대부분의 작업에서 V-MAIL은 이전 방법에서 관찰된 20% 기준을 크게 초월하는 성능을 달성하여 점진적 성공률에서의 중대한 향상을 보여준다.
  • 모델 기반 접근은 시각 입력에서 효과적인 표현 학습을 가능하게 하며, 이는 판별기의 정규화를 도와 성능 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.