Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Manipulation Trajectories Using Recurrent Neural Networks

Rouhollah Rahmatizadeh, Pooya Abolghasemi|arXiv (Cornell University)|2016. 03. 12.
Robot Manipulation and Learning참고 문헌 35인용 수 15
한 줄 요약

이 논문은 보조 로봇에서 복잡한 조작 궤적을 학습하기 위한 엔드 투 엔드 순환 신경망(RNN) 기반 방법을 제안하며, 현재의 종단 기구 상태, 환경적 물체, 사용자 선호도로부터 실시간 궤적 생성을 가능하게 한다. 이 방법은 시뮬레이션 환경에서 인간의 시연를 통해 학습하며, 두 가지 다른 조작 작업에서 작업 계획 수립 및 장애 복구를 성공적으로 수행한다.

ABSTRACT

Robots assisting disabled or elderly people in the performance of activities of daily living need to perform complex manipulation tasks which are highly dependent on the environment and preferences of the user. In addition, these environments and users are not suitable for the collection of massive amounts of training data, as the manipulated objects can be fragile, and the wheelchair-bound users might have difficulty recovering from a failed manipulation task. In this paper, we propose an end-to-end learning mechanism for the type of complex robot arm trajectories used in manipulation tasks for assistive robots. The trajectory is learned using a recurrent neural network that can generate the trajectory in real-time based on the current situation of the end-effector, the objects in the environment and the preferences of the user. The learning data is acquired from a simulation environment where the human can demonstrate the task in a simulation closely modeling his or her own environment. Experiments using two different manipulation tasks show that the robot can learn the manipulation planning as well the ability to recover from failure.

연구 동기 및 목표

  • 장애를 가진 또는 노약자 사용자를 위한 보조 로봇이 환경에 따라 달라지는 복잡한 조작 작업을 학습하는 데 도전하는 것.
  • 유해한 물체와 사용자가 실패에 취약하기 때문에 대규모 실세계 훈련 데이터를 수집하는 데 한계가 있다는 것을 극복하는 것.
  • 종단 기구 상태, 물체 위치, 사용자 선호도와 같은 동적 입력을 기반으로 실시간 궤적을 생성하는 엔드 투 엔드 학습 메커니즘을 개발하는 것.
  • 로봇이 성공적인 작업 수행뿐만 아니라 실패 복구도 시범을 통해 학습할 수 있도록 하는 것.

제안 방법

  • 조작 궤적의 시간적 의존성을 모델링하기 위해 순환 신경망(RNN)을 사용하여 현재 상태 입력 기반으로 실시간 궤적 생성을 가능하게 한다.
  • 실세계 설정을 유사하게 모델링한 시뮬레이션 환경에서 인간 사용자가 작업을 수행하는 동안 수집한 시범 데이터를 사용해 RNN을 훈련한다.
  • 종단 기구 위치, 물체 위치, 사용자 고유의 선호도와 같은 상태 입력을 RNN에 입력으로 제공하여 궤적 예측을 수행한다.
  • 학습된 정책의 이행성을 보장하기 위해 실세계 제약 조건과 사용자 고유의 조건을 반영한 시뮬레이션 환경을 설계한다.
  • 현재 환경 및 사용자 상태를 향후 관절 또는 종단 기구 궤적의 시퀀스로 매핑하는 데 RNN을 엔드 투 엔드로 훈련한다.
  • 훈련 데이터에 장애 상황과 복구 시범을 포함시켜 장애 복구 행동을 통합한다.

실험 결과

연구 질문

  • RQ1RNN 기반 모델은 시뮬레이션 환경에서 인간의 시범을 통해 복잡한 조작 궤적을 엔드 투 엔드로 학습할 수 있는가?
  • RQ2변동적인 환경적 및 사용자 상태 입력 하에서 학습된 정책이 실시간 궤적 생성에 일반화될 수 있는가?
  • RQ3모델은 성공적인 작업 수행 외에도 효과적인 장애 복구 전략을 학습할 수 있는가?
  • RQ4제한된 실세계 데이터를 가진 보조 조작 작업에서 시뮬레이션에서 실세계로의 이행 성능은 얼마나 우수한가?

주요 결과

  • RNN 기반 접근법은 시뮬레이션 기반 시범만을 사용하여 두 가지 다른 작업의 조작 궤적을 성공적으로 학습했다.
  • 로봇은 현재의 환경적 및 사용자 상태 입력 기반으로 실시간 궤적을 생성하여 작업 수행 중 적응형 행동을 가능하게 했다.
  • 모델는 훈련 데이터에서 복구 행동을 학습함으로써 장애 발생 후 복구 능력을 보였다.
  • 시뮬레이션 환경는 사용자나 취약한 물체에 위험을 줄 수 없어 안전한 정책 학습을 지원하는 효과적인 데이터 수집을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.