Skip to main content
QUICK REVIEW

[논문 리뷰] Grasping in the Wild:Learning 6DoF Closed-Loop Grasping from Low-Cost Demonstrations

Shuran Song, Andy Zeng|arXiv (Cornell University)|2019. 12. 09.
Robot Manipulation and Learning참고 문헌 41인용 수 9
한 줄 요약

이 논문은 실세계 환경에서 다양한 6DoF 그립 동작을 촬영할 수 있는 저비용 휴대형 장치를 제안하며, 이는 6DoF 폐쇄 루프 그립을 위한 딥 강화학습 정책의 엔드 투 엔드 학습을 가능하게 한다. 행동-시각 기반 렌더링을 사용해 미래 상태를 시뮬레이션하고, 학습된 가치 함수를 통해 최적의 동작을 선택함으로써, 정적 환경에서는 92%의 성공률을, 동적 환경에서는 움직이는 물체가 있는 상황에서도 88%의 성공률을 달성한다.

ABSTRACT

Intelligent manipulation benefits from the capacity to flexibly control an end-effector with high degrees of freedom (DoF) and dynamically react to the environment. However, due to the challenges of collecting effective training data and learning efficiently, most grasping algorithms today are limited to top-down movements and open-loop execution. In this work, we propose a new low-cost hardware interface for collecting grasping demonstrations by people in diverse environments. Leveraging this data, we show that it is possible to train a robust end-to-end 6DoF closed-loop grasping model with reinforcement learning that transfers to real robots. A key aspect of our grasping model is that it uses "action-view" based rendering to simulate future states with respect to different possible actions. By evaluating these states using a learned value function (Q-function), our method is able to better select corresponding actions that maximize total rewards (i.e., grasping success). Our final grasping system is able to achieve reliable 6DoF closed-loop grasping of novel objects across various scene configurations, as well as dynamic scenes with moving objects.

연구 동기 및 목표

  • 다양하고 실제 세계에서의 6DoF 그립 동작 데이터를 수집하여 강건한 조작 정책 학습에 도전하는 데 목적을 두며.
  • 저비용 실세계 인간 동작 데이터를 사용해 6DoF 폐쇄 루프 그립 정책의 엔드 투 엔드 학습을 가능하게 하는 데 목적을 두며.
  • 로봇 내에서의 시도-오류 학습에만 의존하는 대신, 다양한 인간 동작 데이터를 사전 학습함으로써 학습 효율성과 일반화 능력을 향상시키는 데 목적을 두며.
  • 행동-시각 기반 렌더링을 사용해 미래 상태를 시뮬레이션하는 시각적 전진 모델을 개발하여 폐쇄 루프 제어에서 더 나은 동작 선택을 가능하게 하는 데 목적을 두며.

제안 방법

  • 비용이 저렴한 휴대용 RGB-D 그립 장치를 사용해 주방이나 사무실과 같은 비정형 실세계 환경에서 6DoF 그립 동작 데이터를 촬영한다.
  • 전통적인 시각 추적 알고리즘을 통해 인간이 사용하는 동안 촬영한 RGB-D 영상에서 6DoF 그립 경로를 복원한다.
  • 그립 장치 중심의 시각 관측치를 미래 수상 보상의 기대치로 매핑하는 가치 함수를 모델링하기 위해 딥 신경망을 사용한다.
  • 행동-시각 기반 렌더링을 통해 각 후보 동작에 대해 그립 카메라가 볼 수 있는 시각적 결과를 시뮬레이션함으로써 미래 상태의 전망 예측을 가능하게 한다.
  • 정책은 학습된 가치 함수를 사용해 이러한 시뮬레이션된 상태를 평가하고, 폐쇄 루프 방식으로 누적 보상의 기대치를 최대화하는 동작을 선택한다.
  • 모델은 인간 동작 데이터로 사전 학습하고, 실제 로봇 데이터로 미세 조정하여 성능 향상과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1저비용 장치를 통해 수집한 다양한 실세계 6DoF 그립 동작 데이터가 엔드 투 엔드 6DoF 그립 정책의 샘플 효율성과 성능을 향상시키는가?
  • RQ2행동-시각 기반 렌더링이 폐쇄 루프 6DoF 그립 제어를 위한 미래 상태 시뮬레이션에 얼마나 효과적인가?
  • RQ3인간 동작 데이터로 사전 학습하는 것이 실제 로봇에서의 자기지도 학습 기반 시도-오류 학습보다 빠른 수렴과 더 나은 일반화를 이끌어내는가?
  • RQ4학습된 가치 함수와 행동-시각 기반 렌더링을 조합하면 움직이는 물체가 있는 동적 환경에서도 강건한 6DoF 그립을 가능하게 하는가?
  • RQ5실세계에서 수집한 인간 동작의 다양성이 새로운 물체와 다양한 시나리오 구성에 대한 정책의 일반화 능력을 얼마나 향상시키는가?

주요 결과

  • 시스템은 정적 환경에서는 92%의 그립 성공률을, 움직이는 물체가 있는 동적 환경에서는 88%의 성공률을 기록하며 이전 최고 수준의 방법들을 능가한다.
  • 인간 동작 데이터로 사전 학습하면, 로봇 내에서의 시도-오류 학습에서부터 시작하는 것보다 더 빠른 학습과 더 높은 최종 성능을 달성한다.
  • 모델은 새로운 물체와 복잡한 구성, 예를 들어 벽에서 옆으로 그립을 쥐는 것과 기울어진 용기에서의 그립 등에도 잘 일반화된다.
  • 실제 로봇 데이터로의 미세 조정은 다양한 시나리오 구성에서 평균적으로 약 18%의 성능 향상을 이끌어낸다.
  • 행동-시각 기반 렌더링의 사용은 미래 시각 상태를 시뮬레이션하고 기대 수상 보상을 최대화하는 동작을 선택함으로써 효과적인 폐쇄 루프 제어를 가능하게 한다.
  • 실세계에서 수집한 인간 동작의 다양성은 제한된 로봇이 수집한 데이터에 비해 정책의 일반화 능력과 강건성을 크게 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.