Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Foresight Tree for Object Retrieval from Clutter with Nonprehensile Rearrangement

Baichuan Huang, Shuai D. Han|arXiv (Cornell University)|2021. 05. 06.
Robotics and Sensor-Based Localization참고 문헌 52인용 수 4
한 줄 요약

이 논문은 시각 예측을 통한 트리 탐색을 활용해 혼잡한 환경에서 물체 수거를 위한 비포획성 밀기 동작 시퀀스를 계획하는 모델 기반 방법인 Visual Foresight Tree(VFT)를 제안한다. 깊이 신경망을 사용해 로봇의 밀기 동작 이후 물체 재배치를 예측함으로써, 시각 예측을 통한 효율적인 트리 탐색을 가능하게 하여, 시뮬레이션 및 실제 환경 실험에서 모델 자유형 및 국소적 모델 기반 방법보다 높은 성공률과 더 적은 동작 수를 달성한다.

ABSTRACT

This paper considers the problem of retrieving an object from a set of tightly packed objects by using a combination of robotic pushing and grasping actions. Object retrieval from confined spaces that contain clutter is an important skill for robots in order to effectively operate in households and everyday environments. The proposed solution, Visual Foresight Tree (VFT), cleverly rearranges the clutter surrounding the target object so that it can be grasped easily. Rearrangement with nested non-prehensile actions is challenging as it requires predicting complex object interactions in a combinatorially large configuration space of multiple objects. We first show that a deep neural network can be trained to accurately predict the poses of the packed objects when the robot pushes one of them. The predictive network provides visual foresight and is used in a tree search as a state transition function in the space of scene images. The tree search returns a sequence of consecutive push actions that result in the best arrangement of the clutter for grasping the target object. Experiments in simulation and using a real robot and objects show that the proposed approach outperforms model-free techniques as well as model-based myopic methods both in terms of success rates and the number of executed actions, on several challenging tasks. A video introducing VFT, with robot experiments, is accessible at this https URL. Full source code will also be made available upon publication of this manuscript.

연구 동기 및 목표

  • 가정 환경에서 고밀도로 정리된 혼잡한 환경에서 목표 물체를 수거하는 문제를 해결하기 위해.
  • 고차원적이고 조합적으로 복잡한 구성 공간에서 비포획성 재배치 계획 수립의 어려움을 극복하기 위해.
  • 장기 예측 계획을 위한 시각 예측을 활용해 물체 수거의 성공률를 높이고 동작 횟수를 줄이기 위해.
  • 학습된 시각 예측과 탐색 기반 계획을 통합하여 다양한 혼잡한 환경에 일반화 가능한 방법을 개발하기 위해.

제안 방법

  • 혼잡한 환경에서 단일 밀기 동작 이후 물체의 새로운 자세를 예측하기 위해 깊이 신경망을 훈련한다.
  • 훈련된 네트워크는 시각 예측 모델로 기능하며, 장면 이미지에서 미래 장면 이미지로의 상태 전이 예측을 제공한다.
  • 트리 탐색 알고리즘이 시각 예측 모델을 사용해 밀기 동작 시퀀스를 시뮬레이션하고 그 결과를 평가한다.
  • 이 탐색은 이미지 기반 장면 상태의 공간을 탐색하여 목표 물체를 잡을 수 있도록 최적의 위치로 재배치하는 밀기 시퀀스를 찾는다.
  • 학습된 동역학과 기호적 트리 탐색을 통합하여 명시적인 세계 모델이 필요 없이 장기 예측 계획을 가능하게 한다.
  • 이 방법은 시뮬레이션과 실제 로봇에서 평가되었으며, 실제 동역학과 시각 노이즈에 대해 뛰어난 강인성을 보였다.

실험 결과

연구 질문

  • RQ1깊이 신경망이 혼잡한 물체 배열에서 단일 밀기 동작의 결과를 정확하게 예측할 수 있는가?
  • RQ2시각 예측 기반 트리 탐색은 모델 자유형 강화 학습에 비해 혼잡한 물체 수거에서 성공률와 샘플 효율성 측면에서 어떻게 비교되는가?
  • RQ3시각 예측을 사용하는 모델 기반 계획자가 복잡한 고차원 재배치 작업에서 국소적 모델 기반 방법보다 뛰어난 성능을 내는가?
  • RQ4이 방법은 다양한 혼잡한 장면과 물체 구성에 얼마나 잘 일반화되는가?

주요 결과

  • 시각 예측 네트워크는 혼잡한 장면에서 밀기 동작 이후 물체 재배치를 높은 정확도로 예측한다.
  • VFT 방법은 성공률와 필요 동작 수 모두에서 모델 자유형 강화 학습 기준선보다 뚜렷이 뛰어나다.
  • 특히 복잡하고 고밀도로 정리된 구성에서 국소적 모델 기반 방법보다 높은 성공률를 달성한다.
  • 실제 환경에 대해 잘 일반화되어 있으며, 도메인 랜덤라이제이션을 최소화한 실제 로봇에서도 강인한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.