Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Feasibility to Imitate Demonstrators with Different Dynamics

Zhangjie Cao, Yilun Hao|arXiv (Cornell University)|2021. 10. 28.
Reinforcement Learning in Robotics참고 문헌 28인용 수 5
한 줄 요약

이 논문은 이행 학습에서 다양한 역학을 가진 시연자로부터의 시연를 가능하게 하기 위해 타당성 MDP(f-MDP)를 정의하고, 이 내부에서 최적의 정책을 학습하여 시연에 대한 타당성 점수를 부여하는 타당성 지표를 제안한다. 이 방법은 타당성에 따라 시연를 재가중하여 이ml리터가 유용하고 거의 타당한 궤적에 집중할 수 있도록 하며, 시뮬레이션 및 실제 로봇 환경 모두에서 이전 방법보다 유의미하게 높은 기대 수익과 성공률을 달성한다.

ABSTRACT

The goal of learning from demonstrations is to learn a policy for an agent (imitator) by mimicking the behavior in the demonstrations. Prior works on learning from demonstrations assume that the demonstrations are collected by a demonstrator that has the same dynamics as the imitator. However, in many real-world applications, this assumption is limiting -- to improve the problem of lack of data in robotics, we would like to be able to leverage demonstrations collected from agents with different dynamics. This can be challenging as the demonstrations might not even be feasible for the imitator. Our insight is that we can learn a feasibility metric that captures the likelihood of a demonstration being feasible by the imitator. We develop a feasibility MDP (f-MDP) and derive the feasibility score by learning an optimal policy in the f-MDP. Our proposed feasibility measure encourages the imitator to learn from more informative demonstrations, and disregard the far from feasible demonstrations. Our experiments on four simulated environments and on a real robot show that the policy learned with our approach achieves a higher expected return than prior works. We show the videos of the real robot arm experiments on our website (https://sites.google.com/view/learning-feasibility).

연구 동기 및 목표

  • 이행 학습에서 시뮬레이터와 동일한 역학을 가진 에이전트에서만 시연가 가능하다는 한계를 해결하기 위해.
  • 다른 자유도 또는 신체 구조를 가진 에이전트에서 수집된 시범을 재사용할 수 있도록 하기 위해.
  • 이행 학습 중에 잘못된 방향으로 이끄는 불가능하거나 해로운 시범을 걸러내기 위해.
  • 이행 학습자가 실행 가능할 가능성이 얼마나 높은지 수치화하는 타당성 지표를 개발하기 위해.
  • 시범의 타당성 점수에 따라 재가중하여 이행 학습 성능을 향상시키기 위해.

제안 방법

  • 이행자의 MDP와 시범자의 궤적을 기반으로 타당성 MDP(f-MDP)를 정의하여 타당성 제약 조건을 모델링한다.
  • 이행자의 역학과 제약 조건을 존중하면서 동시에 시범 행동을 최대한 따르는 최적의 정책을 학습한다.
  • 최적의 f-MDP 정책의 가치 함수를 각 시범에 대한 타당성 점수로 사용한다.
  • 학습 중에 타당성 점수에 따라 시범을 재가중하여 거의 타당한 궤적을 우선시한다.
  • 재가중된 시범을 기반으로 행동 복제 또는 역강화 학습을 사용하여 최종 이행 정책을 학습한다.
  • 시뮬레이션 환경과 3-DoF 및 7-DoF 제어기를 갖춘 실제 Franka Panda 로봇 암에서 접근 방식을 검증한다.

실험 결과

연구 질문

  • RQ1다른 역학을 가진 에이전트에서 얻은 시범들 중에서 이행자가 실행 가능한 것을 식별할 수 있는 타당성 지표를 학습할 수 있는가?
  • RQ2시범이 이행자와 역학이 맞지 않을 경우, 제안된 타당성 지표는 이행 학습 성능을 어떻게 향상시키는가?
  • RQ3공유된 역학을 가진다고 가정하거나 모든 시범을 동일하게 취급하는 기존 방법에 비해 이 방법은 성능에서 뛰어나게 되는가?
  • RQ4불가능하거나 관련 없는 궤적의 비율이 높은 다양한 구성의 시범에 대해 이 방법은 얼마나 강인한가?
  • RQ5실제 로봇 조작 작업에서 유용한 시범은 유지하면서 유해한 시범을 효과적으로 걸러낼 수 있는가?

주요 결과

  • 실제 로봇 암 작업에서 기준 방법 대비 기대 수익(p-value = 2.432×10⁻⁷)과 성공률(p-value = 3.534×10⁻⁸)에서 통계적으로 유의미한 향상을 달성했다.
  • 불가능한 시범의 수가 증가하는 환경에서도 제안된 방법은 우수한 성능을 유지하였고, 기준 방법은 심각하게 성능 저하를 보였다.
  • 타당성 지표는 장애물에 충돌하는 등의 불가능한 궤적을 성공적으로 식별하고 낮은 가중치를 적용하면서도, 선반 위를 넘는 유용한 궤적은 유지하였다.
  • 시범 세트에 관련 없는 동역학의 비율이 높아도 SAIL 및 기타 기준 방법보다 성능이 뛰어나, 노이즈가 많거나 관련 없는 데이터에 대해 강인함을 입증하였다.
  • 타당성에 따라 재가중된 시범를 사용해 학습한 정책은 타당성 차이를 고려하지 않는 방법보다 더 높은 기대 수익과 성공률을 달성하였다.
  • 제거 실험을 통해 타당성 점수가 성능에 핵심적임을 확인하였으며, 특히 높은 불가능성 상황에서 점수가 제거되면 성능이 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.