Skip to main content
QUICK REVIEW

[논문 리뷰] Pixel-Attentive Policy Gradient for Multi-Fingered Grasping in Cluttered Scenes

Bohan Wu, Iretiayo Akinola|arXiv (Cornell University)|2019. 03. 08.
Robot Manipulation and Learning참고 문헌 29인용 수 4
한 줄 요약

이 논문은 혼잡한 환경에서 단일 깊이 영상으로부터 전체 6-도르기 다손지 손으로 잡는 작업을 위한 픽셀 주의 메커니즘을 통한 정책 기반 강화 학습 방법을 제안한다. 픽셀 공간에서 직접 작동하고 반복적으로 유망한 영역에 집중할 수 있는 학습 가능한 주의 메커니즘을 사용함으로써, 실제 환경에서 실시간 보정 없이도 혼잡한 새로운 물체에 대해 91.9%의 성공률을 달성하였으며, 이는 우수한 시뮬레이션에서 실제 환경으로의 전이 성능와 차폐에 대한 강건성을 입증한다.

ABSTRACT

Recent advances in on-policy reinforcement learning (RL) methods enabled learning agents in virtual environments to master complex tasks with high-dimensional and continuous observation and action spaces. However, leveraging this family of algorithms in multi-fingered robotic grasping remains a challenge due to large sim-to-real fidelity gaps and the high sample complexity of on-policy RL algorithms. This work aims to bridge these gaps by first reinforcement-learning a multi-fingered robotic grasping policy in simulation that operates in the pixel space of the input: a single depth image. Using a mapping from pixel space to Cartesian space according to the depth map, this method transfers to the real world with high fidelity and introduces a novel attention mechanism that substantially improves grasp success rate in cluttered environments. Finally, the direct-generative nature of this method allows learning of multi-fingered grasps that have flexible end-effector positions, orientations and rotations, as well as all degrees of freedom of the hand.

연구 동기 및 목표

  • 다손지 로봇 손잡이에 대한 온정책 강화 학습에서의 높은 샘플 복잡도와 시뮬레이션-실제 환경 간 격차를 해결하기 위해.
  • 단일 깊이 영상에서 직접 6-도르기 손잡이 정책(위치, 자세, 모든 손가락 관절 각도) 학습을 가능하게 하기 위해.
  • 학습 가능한 주의 메커니즘을 도입하여 이미지의 관련 영역을 점진적으로 집중함으로써 혼잡한 환경에서의 손잡이 성공률을 향상시키기 위해.
  • 깊이 영상 관측만을 사용하여 실제 환경에서의 성능을 강건하게 유지하고, 깊이 기반 관측을 통해 시뮬레이션-실제 환경 간 도메인 이탈을 최소화함으로써 실제 환경 보정 없이도 높은 성능을 달성하기 위해.

제안 방법

  • 모델은 단일 깊이 영상을 입력으로 사용하여 완전히 시뮬레이션 환경에서 학습된 정책 기반 강화 학습 알고리즘을 사용한다.
  • 손잡이 자세와 손가락 관절 각도는 영상 공간 내 각 픽셀에서 예측되며, 깊이 맵 기반의 포인트 클라우드 재구성 방법을 통해 3차원 카르테시안 좌표계로 변환된다.
  • 새로운 픽셀 주의 메커니즘이 도입되어 깊이 영상을 반복적으로 지역에 맞게 자르며, 혼잡한 환경에서의 손잡이 품질 향상을 위해 영역을 확대하는 것과 유사한 동작을 수행한다.
  • 주의 메커니즘은 높은 품질의 손잡이가 예측될 때 자르기 작업을 중단하도록 학습하여, 상향식 접근 방식이 아닌 유연한 종단 기구 자세를 가진 비상향식 손잡이를 가능하게 한다.
  • 학습 중에 도메인 랜덤라이제이션을 적용하여 시나리오 내 물체의 수와 배열을 다양화함으로써 혼잡한 환경에 대한 강건성을 향상시킨다.
  • 정책은 인간의 레이블링된 손잡이 데이터나 사전 정의된 손잡이 후보 없이 종단에서 종단까지 엔드 투 엔드로 학습된다.
Figure 1 : Pixel-Attentive Policy Gradient Multi-Fingered Grasping. Given a scene of cluttered objects (a) , our method takes in a single depth image and gradually zooms into a local region of the image to generate a good grasp. (b) , (c) and (d) show the zooming process, in which the green bounding
Figure 1 : Pixel-Attentive Policy Gradient Multi-Fingered Grasping. Given a scene of cluttered objects (a) , our method takes in a single depth image and gradually zooms into a local region of the image to generate a good grasp. (b) , (c) and (d) show the zooming process, in which the green bounding

실험 결과

연구 질문

  • RQ1심층 영상만을 사용하여 학습된 강화 학습 정책이 실제 환경에서 실시간 보정 없이 혼잡한 환경에서 높은 손잡이 성공률을 달성할 수 있는가?
  • RQ2이미지 영역을 점진적으로 집중하는 학습 가능한 주의 메커니즘이 전역 관측과 비교해 혼잡한 환경에서의 손잡이 성능에 어떤 영향을 미치는가?
  • RQ3복잡한 환경에서 전체 6-도르기 손잡이 자세와 다손지 구성을 학습하는 것이 상향식 또는 이중 손가락 손잡이보다 얼마나 더 우수한 성능을 내는가?
  • RQ4비상향 각도(예: 카메라의 비수직 시점) 변화에 대해 이 방법은 얼마나 강건한가?
  • RQ5다손지 손잡이가 단순화된 손잡이 유형(예: 평행 또는 상향식)에 비해 전체 성능에 기여하는 정도는 어느 정도인가?

주요 결과

  • 실제 환경에서 단일로 알려진 물체에 대해 96.7%의 성공률, 새로운 물체에 대해 93.3%의 성공률을 기록하여 뛰어난 일반화 능력을 입증하였다.
  • 혼잡한 환경에서 알려진 물체에 대해 92.9%의 성공률, 새로운 물체에 대해 91.9%의 성공률을 기록하여 차폐 및 혼잡함에 대한 뛰어난 강건성을 보였다.
  • 제거 실험 결과, 주의 메커니즘을 제거하면 혼잡한 알려진 물체에서 성공률이 21.6% 감소하여, 이 메커니즘이 차폐를 다루는 데 핵심적인 역할을 한다는 것을 입증하였다.
  • 상향식 손잡이를 강제로 적용할 경우 혼잡한 알려진 물체에서 성능이 17.7% 감소하여, 복잡한 환경에서 비상향식 손잡이의 우수성을 확인하였다.
  • 다손지 손을 사용하지 않고 이중 손가락 손잡이만을 사용할 경우 단일 알려진 물체에서 성능이 43.4% 감소하여, 전체 다손지 제어의 뚜렷한 이점이 있음을 입증하였다.
  • 비상향 각도(60°)에 대해서도 성능이 상향식 시점과 통계적으로 유사하여, 시뮬레이션에서 비상향 각도에 대한 강건성을 입증하였다.
(a) PyBullet (Train)
(a) PyBullet (Train)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.