Skip to main content
QUICK REVIEW

[논문 리뷰] Sample-efficient Adversarial Imitation Learning from Observation

Faraz Torabi, Sean Geiger|arXiv (Cornell University)|2019. 06. 18.
Adversarial Robustness in Machine Learning참고 문헌 25인용 수 5
한 줄 요약

이 논문은 궤적 중심 강화학습(LQR)과 관측에서의 생성적 적대적 복제(GAIfO)를 결합한 샘플 효율적인 이터레이션 학습 알고리즘인 LQR+GAIfO를 제안한다. LQR를 사용해 고품질의 저수준 궤적을 생성하고 이를 적대적 정책 학습을 안내함으로써, GAIfO에 비해 더 빠른 수렴 속도와 뛰어난 샘플 효율성을 달성하여, 더 적은 시연 및 학습 반복 횟수로도 물리적 로봇 시스템에서 성공적인 복제를 가능하게 한다.

ABSTRACT

Imitation from observation is the framework of learning tasks by observing demonstrated state-only trajectories. Recently, adversarial approaches have achieved significant performance improvements over other methods for imitating complex behaviors. However, these adversarial imitation algorithms often require many demonstration examples and learning iterations to produce a policy that is successful at imitating a demonstrator's behavior. This high sample complexity often prohibits these algorithms from being deployed on physical robots. In this paper, we propose an algorithm that addresses the sample inefficiency problem by utilizing ideas from trajectory centric reinforcement learning algorithms. We test our algorithm and conduct experiments using an imitation task on a physical robot arm and its simulated version in Gazebo and will show the improvement in learning rate and efficiency.

연구 동기 및 목표

  • 실세계 로봇 응용 분야에서 적대적 복제 학습(GAIfO)의 높은 샘플 복잡도 문제를 해결하기 위해.
  • 행동 정보 없이 상태 궤적만 제공되는 관측에서의 복제(IfO)에서 샘플 효율성을 향상시키기 위해.
  • 더 적은 시연 및 학습 반복 횟수로 물리적 로봇에서 효과적인 복제 학습을 가능하게 하기 위해.
  • 궤적 중심 LQR의 샘플 효율성과 GAIfO의 딥 네URAL 네트워크 정책 용량을 통합하기 위해.
  • 모의 환경과 실제 6-DOF 로봇 암에서의 방법 검증을 통해 시뮬레이션에서 현실로의 전이 가능성 입증하기 위해.

제안 방법

  • 궤적 중심 제어를 위한 선형 제곱 조절기(LQR)를 통합하여 고품질의 저수준 궤적 제어기를 생성함으로써 정책 탐색을 안내한다.
  • LQR가 생성한 궤적을 GAIfO 프레임워크의 생성기 네트워크 초기화 및 안내에 사전 지식으로 활용한다.
  • 판별기(디스criminator)가 전문가 궤적과 모의 궤적을 구분하도록 생성적 적대망(GAN) 구조를 적용한다.
  • 판별기의 피드백을 기반으로 생성기(모의 정책)를 적대적으로 학습시키며, 동시에 LQR를 활용해 샘플 효율적인 탐색을 수행한다.
  • LQR 궤적에서 중요도 가중 샘플링을 적용하여 정책 업데이트의 효율성과 일반화 능력을 향상시킨다.
  • 판별기에 컨볼루션 레이어를 추가하여 시각적 관측을 수용할 수 있도록 프레임워크를 확장함으로써, 액션 레이블이 없는 영상 데이터로부터의 복제를 가능하게 한다.

실험 결과

연구 질문

  • RQ1LQR와 GAIfO를 조합함으로써 관측에서의 복제를 위한 필수 샘플 수를 현저히 줄일 수 있는가?
  • RQ2샘플 효율성과 최종 복제 정확도 측면에서 LQR+GAIfO는 GAIfO에 비해 어떻게 성능을 냈는가?
  • RQ3모의 환경에서 학습된 정책이 물리적 로봇 암으로 성공적으로 전이될 수 있는가?
  • RQ4LQR 통합으로 학습 중에 보지 못한 새로운 목표 지점으로의 일반화 능력이 향상되는가?
  • RQ5영상 시연만으로도 작동할 수 있도록 확장할 수 있는가? 즉, 액션 레이블이 없는 영상 데이터로부터의 복제가 가능한가?

주요 결과

  • LQR+GAIfO는 GAIfO에 비해 훨씬 적은 학습 반복 횟수와 시범 샘플로 성공적인 복제를 달성하여 샘플 효율성이 향상됨을 입증하였다.
  • 빠른 수렴 속도를 보이며, 특히 첫 60회 반복 이내에서 GAIfO를 능가하는 성능을 보였다.
  • LQR+GAIfO는 약 60회 반복 이후 성능 저하가 발생할 수 있으나, 이는 판별기와 제어기 간의 학습률 불일치로 인한 것으로 보이며, 여전히 초기 샘플 제한 환경에서 GAIfO를 능가한다.
  • 모의 환경에서 학습된 정책가 물리적 로봇 암으로 성공적으로 일반화되었으며, 실제 환경에서의 성능이 시뮬레이터 결과를 초월했다. 이는 물리적 노이즈로 인한 탐색 증가 때문일 수 있다.
  • LQR 통합으로 학습 중에 보지 못한 목표 지점으로의 일반화 능력이 향상되었으며, 특히 더 많은 시범 궤적을 제공할수록 두드러졌다. 이는 판별기가 일반화된 비용 함수를 학습했기 때문이다.
  • 컨볼루션 판별기를 통한 시각적 관측 확장은 유망한 방향으로, 액션 레이블이 필요 없이 영상 데이터로부터의 복제를 가능하게 할 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.