Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Robot-Centric Learning from Demonstration via Personalized Embeddings

Mariah Schrum, Erin Hedlund|arXiv (Cornell University)|2021. 10. 07.
Robot Manipulation and Learning참고 문헌 20인용 수 4
한 줄 요약

이 논문은 변동형 추론을 통해 인간 시연자 스타일의 개인화된 임베딩을 학습하여 열악한 피드백을 보정함으로써 로봇 중심의 시연로부터 학습(LfD)을 향상시키는 메타학습 프레임워크인 MIND MELD를 제안한다. 정정 레이블과 진정한 값 사이의 상호정보량을 최대화함으로써 MIND MELD는 원시 인간 피드백 대비 63% 레이블 품질을 향상시켜 DAgger 기반 학습에서 더 나은 정책 학습을 가능하게 한다.

ABSTRACT

Learning from demonstration (LfD) techniques seek to enable novice users to teach robots novel tasks in the real world. However, prior work has shown that robot-centric LfD approaches, such as Dataset Aggregation (DAgger), do not perform well with human teachers. DAgger requires a human demonstrator to provide corrective feedback to the learner either in real-time, which can result in degraded performance due to suboptimal human labels, or in a post hoc manner which is time intensive and often not feasible. To address this problem, we present Mutual Information-driven Meta-learning from Demonstration (MIND MELD), which meta-learns a mapping from poor quality human labels to predicted ground truth labels, thereby improving upon the performance of prior LfD approaches for DAgger-based training. The key to our approach for improving upon suboptimal feedback is mutual information maximization via variational inference. Our approach learns a meaningful, personalized embedding via variational inference which informs the mapping from human provided labels to predicted ground truth labels. We demonstrate our framework in a synthetic domain and in a human-subjects experiment, illustrating that our approach improves upon the corrective labels provided by a human demonstrator by 63%.

연구 동기 및 목표

  • 부적절한 인간 제공 정정 피드백을 기반으로 학습할 경우 실세계 환경에서 DAgger의 성능이 열 劣화되는 문제를 해결하기 위해.
  • 과잉 정정이나 일관성 없는 등의 인간 피드백 스타일의 개인적 차이를 모델링하여, 로봇 중심의 LfD에서 정책 학습을 악화시키는 원인를 분석하기 위해.
  • 정정 피드백 시퀀스에서 개인화된 임베딩을 추론하는 메타학습 프레임워크를 개발하여 열 劣한 레이블을 더 정확한 진정한 값 근사치로 매핑하기 위해.
  • 학습된 임베딩이 인간 시연자 간의 의미 있는 스타일적, 인구통계학적, 성격 관련 차이를 실제로 포착하는지 검증하기 위해.

제안 방법

  • MIND MELD는 시간에 따라 변화하는 시연자로부터의 정정 피드백 시퀀스를 캐릭터라이징하기 위해 양방향 LSTM을 사용하여 정상적인 피드백의 시간적 의존성을 포착한다.
  • 각 시연자 $p$당 개인화된 임베딩 벡터 $\vec{w}^{(p)}$를 학습하기 위해 변동형 추론을 적용하며, 이는 개인의 피드백 성향과 스타일을 나타낸다.
  • 대조적 목적함수를 사용하여 학습된 임베딩 $\vec{w}^{(p)}$, 예측된 정정 차이 $d_{t'}^{(p)}$, 및 인코딩된 표현 $\vec{z}$ 간의 상호정보량을 최대화한다.
  • 신경망 헤드 $g_{\phi}$는 임베딩과 인코딩된 피드백을 입력으로 받아 예측된 정정 행동을 출력하며, 진짜 차이 $a_{t'}^{(p)} - o_{t'}$와의 평균제곱오차(MSE)를 최소화한다.
  • 모델은 지식이 있는 진정한 값이 있는 校정 작업에서 학습되어 노이즈가 많은 인간 피드백에서 향상된 레이블로의 매핑을 학습할 수 있도록 한다.
  • 추론 단계에서는 새로운 시연자가 훈련 세트의 평균 임베딩으로 초기화되며, 자신의 피드백 데이터를 사용하여 개인화된 임베딩를 미세조정한다.

실험 결과

연구 질문

  • RQ1메타학습 프레임워크는 로봇 중심의 LfD에서 열악한 인간 제공 정정 피드백의 품질을 향상시킬 수 있는가?
  • RQ2변동형 추론를 통해 학습된 개인화된 임베딩은 인간 시연자 간의 의미 있는 스타일적 차이를 포착하는가?
  • RQ3학습된 임베딩은 시연자 인구통계학적 특성, 성격 특성, 경험 수준과 어느 정도 상관이 있는가?
  • RQ4MIND MELD는 인간 교사와 올바른 피드백 간의 성능 격차를 줄일 수 있는가?
  • RQ5프레임워크는 이전 참가자의 평균을 사용해 새로운 시연자의 임베딩를 초기화함으로써 일반화 가능한가?

주요 결과

  • MIND MELD는 원시 피드백 대비 인간 제공 정정 레이블의 품질을 63% 향상시켰다.
  • 학습된 개인화된 임베딩은 시연자 스타일 성향과 유의미한 상관관계를 보이며, p값이 .001 이하였다.
  • 임베딩는 시연자 성별과 유의미한 상관관계를 보였으며(p = .0015), 이는 인구통계학적 차이에 민감함을 시사한다.
  • 가상 또는 물리적 자동차 경험 수준과 신경질성 수준은 유의미한 경향을 보였으며(p = .18, .15, .16), 이는 행동 특성에 민감할 수 있음을 시사한다.
  • 이 프레임워크는 다양한 피드백 스타일을 효과적으로 포착하였으며, 보정 행동의 개인적 차이를 모델링하고 보정하는 데 성공하였다.
  • 결과는 개인화된 임베딩가 인간-로봇 상호작용의 실세계 환경에서 LfD 성능을 향상시키는 데 있어 강력한 표현으로 기능할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.