[논문 리뷰] AnyGrasp: Robust and Efficient Grasp Perception in Spatial and Temporal Domains
AnyGrasp는 병렬 집게를 사용하여 실시간으로 작동하는 통합적인 그립 인식 시스템을 제안하며, 실제 세계 데이터와 질량중심 인식을 활용한 고밀도 공간-시간 감독을 통해 7-자유도, 시간적으로 부드럽고 내구성이 뛰어난 그립 자세를 생성한다. 이 시스템은 300개 이상의 미리 보지 않은 물체에 대해 93.3%의 성공률을 기록하며, 수영하는 로봇 물고기를 동적으로 잡는 데에도 성공하여 시뮬레이션에서 실세계로의 전이 방법을 능가한다.
As the basis for prehensile manipulation, it is vital to enable robots to grasp as robustly as humans. Our innate grasping system is prompt, accurate, flexible, and continuous across spatial and temporal domains. Few existing methods cover all these properties for robot grasping. In this paper, we propose AnyGrasp for grasp perception to enable robots these abilities using a parallel gripper. Specifically, we develop a dense supervision strategy with real perception and analytic labels in the spatial-temporal domain. Additional awareness of objects' center-of-mass is incorporated into the learning process to help improve grasping stability. Utilization of grasp correspondence across observations enables dynamic grasp tracking. Our model can efficiently generate accurate, 7-DoF, dense, and temporally-smooth grasp poses and works robustly against large depth-sensing noise. Using AnyGrasp, we achieve a 93.3% success rate when clearing bins with over 300 unseen objects, which is on par with human subjects under controlled conditions. Over 900 mean-picks-per-hour is reported on a single-arm system. For dynamic grasping, we demonstrate catching swimming robot fish in the water. Our project page is at https://graspnet.net/anygrasp.html
연구 동기 및 목표
- 비구조적이고 실제 환경에서 인간과 로봇의 그립 인식 성능 간 격차를 해소하기 위해.
- 단일 순방향 전파를 통해 공간과 시간에 걸쳐 고밀도의 7-자유도, 시간적으로 일관된 그립 예측을 가능하게 하기 위해.
- 실제 세계 데이터 학습과 장애물/질량중심 인식을 통해 깊이 센서 노이즈와 물체의 불안정성에 대한 내구성을 향상시키기 위해.
- 정적 환경 가정을 초월해 미리 보지 않은 물체와 동적 그립에 대한 일반화 능력을 입증하기 위해.
- 특히 저비용 센서 환경에서 실세계 데이터가 시뮬레이션 데이터보다 그립 인식에서 뛰어난 성능을 보임을 검증하기 위해.
제안 방법
- 기하학적 처리 모듈이 단일 순방향 전파를 통해 단일 심도 관측에서 고밀도의 7-자유도 그립 구성(configuration)을 예측한다.
- 시간적 연관 모듈이 학습된 임베딩 유사도를 사용하여 연속적인 관측 간의 그립 대응 관계를 추적한다.
- 공간-시간 영역에서 실제 인식 데이터와 분석적 레이블을 사용하여 고밀도 감독을 적용함으로써 데이터 효율성을 향상시킨다.
- 학습 중에 충돌 가능성이 있는 그립 후보를 필터링함으로써 모델이 암묵적인 장애물 인식 능력을 갖추도록 한다.
- 그립 안정성을 향상시키기 위해 감독 신호에 질량중심(COG) 인식을 통합한다.
- 시뮬레이션에서 실세계로의 도메인 이탈을 방지하기 위해 144개의 물리적 물체를 활용한 실세계 데이터 수집을 수행한다.
실험 결과
연구 질문
- RQ1병렬 집게를 사용하는 그립 인식 시스템이 비구조적이고 실제 환경에서 인간 수준의 내구성과 효율성을 달성할 수 있는가?
- RQ2깊이 노이즈와 물체 다양성 하에서 실세계 데이터 학습이 시뮬레이션에서 실세계로의 전이 학습보다 현저히 뛰어나게 성능을 높이는가?
- RQ3고밀도 공간-시간 감독이 시간에 걸쳐 연속적이고 부드러운 그립 추적을 얼마나 효과적으로 가능하게 하는가?
- RQ4질량중심 및 장애물 인식을 통합할 경우 그립 안정성과 성공률이 얼마나 향상되는가?
- RQ5시스템은 300개 이상의 미리 보지 않은 물체와 물고기를 움직이는 동안 잡는 동적 시나리오에 일반화될 수 있는가?
주요 결과
- AnyGrasp는 300개 이상의 미리 보지 않은 물체가 담긴 상자 정리 작업에서 93.3%의 성공률을 기록하며, 동일한 조건에서 인간의 성능을 따라잡는다.
- 단일 암 로봇에서 시간당 평균 900회 이상의 그립을 수행하여 높은 효율성을 입증한다.
- 물속에서 작은 빠른 움직임을 보이는 로봇 물고기를 성공적으로 잡아내어, 낮은 마찰 조건에서의 뛰어난 동적 그립 성능을 입증한다.
- 심한 심도 센서 노이즈 하에서도 높은 성능을 유지하여 센서의 완벽하지 못함에 대한 내구성을 입증한다.
- 144개의 물체로 구성된 실세계 데이터로 학습한 결과가 수천 개의 시뮬레이션 물체로 학습한 결과보다 뛰어나며, 실세계 데이터의 가치를 입증한다.
- 제거 분석(ablation study)을 통해 실세계 데이터, 그립 레이블의 밀도, 시나리오의 다양성이 일반화 능력과 성능에 크게 기여한다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.