Skip to main content
QUICK REVIEW

[논문 리뷰] Co-active Learning to Adapt Humanoid Movement for Manipulation

Ren Mao, John S. Baras|arXiv (Cornell University)|2016. 09. 12.
Robot Manipulation and Learning참고 문헌 12인용 수 5
한 줄 요약

이 논문은 반복적인 인간 피드백을 통해 인간형 로봇의 이동 방식을 조정하기 위한 공동 학습 프레임워크를 제안한다. 작업 맥락 인식, 이동 방식 모방, 정책 최적화, 온라인 가중치 업데이트를 통합하여 세 부분으로 구성된 가중치 벡터(예시, 맥락, 환경)를 사용함으로써, 사영 기반 경사 업데이트를 통해 수렴하는 방식으로 개선된 적응성을 달성한다.

ABSTRACT

In this paper we address the problem of robot movement adaptation under various environmental constraints interactively. Motion primitives are generally adopted to generate target motion from demonstrations. However, their generalization capability is weak while facing novel environments. Additionally, traditional motion generation methods do not consider the versatile constraints from various users, tasks, and environments. In this work, we propose a co-active learning framework for learning to adapt robot end-effector's movement for manipulation tasks. It is designed to adapt the original imitation trajectories, which are learned from demonstrations, to novel situations with various constraints. The framework also considers user's feedback towards the adapted trajectories, and it learns to adapt movement through human-in-the-loop interactions. The implemented system generalizes trained motion primitives to various situations with different constraints considering user preferences. Experiments on a humanoid platform validate the effectiveness of our approach.

연구 동기 및 목표

  • 인간이 제공한 피드백을 활용하여 인간형 로봇이 실시간으로 조작 이동 방식을 적응시킬 수 있도록 하는 것.
  • 복잡한 조작 작업에서의 동적 작업 맥락과 불완전한 예시들에 도전하는 것.
  • 인식, 모방, 피드백 기반 정책 적응을 통합하는 통합된 학습 프레임워크를 개발하는 것.
  • 다중 가중치 구성 요소의 사영 기반 온라인 업데이트를 통해 안정적이고 수렴 가능한 정책 학습을 보장하는 것.

제안 방법

  • 방법은 예시, 맥락, 환경 특징를 조합한 복합 가중치 벡터를 초기화한다: $\bm{w}^{(0)} = [\bm{w}_{D}^{(0)T}, \bm{w}_{C}^{(0)T}, \bm{w}_{E}^{(0)T}]^{T}$.
  • 각 반복 $i$ 에서, 시스템은 현재 작업 맥락 $\bm{x}_{c}^{(i)}$ 를 인식하고, $\bm{y}_{D}^{(i)}$ 와 $\bm{\Sigma}_{D}^{(i)}$ 를 추출하기 위해 $p(\bm{\mathcal{T}}|\bm{x}_{c}^{(i)})$ 를 생성하는 예시 분포를 생성한다.
  • 실행을 위해 정책 $\bm{\pi}^{*(i)}$ 는 보상 함수 $f(\bm{y}, \bm{x}_{c}^{(i)}, \bm{y}_{D}^{(i)}; \bm{w}^{(i)})$ 를 최대화하도록 최적화되어 행동 $\bm{y}^{(i)}$ 를 생성한다.
  • 실행 후, 인간 피드백 $\bm{\bar{y}}^{(i)}$ 를 사용하여 감소하는 단계 크기 $\alpha^{(i)} = 1/\sqrt{i}$ 를 사용해 가중치를 업데이트한다.
  • 예시($\bm{w}_{D}$), 맥락($\bm{w}_{C}$), 환경($\bm{w}_{E}$)에 대해 세 개의 별도 가중치 업데이트를 수행하며, 특징 차이를 사용한다.
  • 사영 단계를 통해 업데이트된 가중치 $\bm{w}^{(i+1)}$ 가 타당 집합 $\bm{C}$ 내에 유지되어 안정성과 수렴성을 확보한다.

실험 결과

연구 질문

  • RQ1인간형 로봇은 실시간 인간 피드백에 어떻게 효과적으로 조작 정책을 적응시킬 수 있는가?
  • RQ2인식, 모방, 피드백을 하나의 학습 프레임워크에 통합하는 최적의 방법은 무엇인가?
  • RQ3예시, 맥락, 환경에 대한 별도의 가중치 구성 요소가 정책 적응에 어떻게 기여하는가?
  • RQ4비정적 환경에서 온라인 피드백 기반 가중치 업데이트로 어떤 수렴 보장을 확보할 수 있는가?

주요 결과

  • 공동 학습 프레임워크는 인간 피드백을 활용하여 인간형 조작 정책의 안정적이고 반복적인 적응을 가능하게 한다.
  • 감소하는 단계 크기 $\alpha^{(i)} = 1/\sqrt{i}$ 의 사용은 시간이 지남에 따라 가중치 업데이트의 수렴을 보장한다.
  • 사영 업데이트 메커니즘은 타당성을 유지하고 가중치 공간에서의 발산을 방지한다.
  • 예시, 맥락, 환경에 대한 가중치 구성 요소의 분리로 모듈러하고 해석 가능한 정책 학습이 가능해진다.
  • 알고리즘은 인식, 모방, 정책 최적화, 피드백을 하나의 통합 루프로 성공적으로 통합한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.