[논문 리뷰] Learning Generalizable Vision-Tactile Robotic Grasping Strategy for Deformable Objects via Transformer
이 논문은 RGB 및 GelSight 촉각 데이터에서 탐색적 동작(핀치 및 슬라이딩)을 통해 시공간적 특징을 추출함으로써, 변형 가능한 물체에 대한 일반화 가능한 로봇 집게 전략을 학습하기 위한 시각-촉각 Transformer 기반 프레임워크를 제안한다. 이 방법은 바나나와 같은 비정형 과일의 온라인 집게에서 84%의 성공률를 기록하며, CNN+LSTM 기반 모델을 능가하고 대규모 과일 데이터셋에서의 사전 훈련을 통해 강력한 제로샷 일반화 성능을 보여준다.
Reliable robotic grasping, especially with deformable objects such as fruits, remains a challenging task due to underactuated contact interactions with a gripper, unknown object dynamics and geometries. In this study, we propose a Transformer-based robotic grasping framework for rigid grippers that leverage tactile and visual information for safe object grasping. Specifically, the Transformer models learn physical feature embeddings with sensor feedback through performing two pre-defined explorative actions (pinching and sliding) and predict a grasping outcome through a multilayer perceptron (MLP) with a given grasping strength. Using these predictions, the gripper predicts a safe grasping strength via inference. Compared with convolutional recurrent networks, the Transformer models can capture the long-term dependencies across the image sequences and process spatial-temporal features simultaneously. We first benchmark the Transformer models on a public dataset for slip detection. Following that, we show that the Transformer models outperform a CNN+LSTM model in terms of grasping accuracy and computational efficiency. We also collect a new fruit grasping dataset and conduct online grasping experiments using the proposed framework for both seen and unseen fruits. {In addition, we extend our model to objects with different shapes and demonstrate the effectiveness of our pre-trained model trained on our large-scale fruit dataset. Our codes and dataset are public on GitHub.
연구 동기 및 목표
- 변형 가능하고 비정형인 물체(예: 과일)를 안전하고 효과적으로 집는 데 있어, 미끄러짐이나 손상 방지를 위해 접촉력이 정밀하게 제어되어야 하는 과제를 해결하기 위해.
- 실시간 집게 결과 예측 및 힘 최적화를 위해 시각 및 촉각 감지 모odalities를 효과적으로 통합하기 위해.
- 다양한 과일 유형, 특히 알려지지 않은 비정형 형태의 물체를 포함한 전이가 가능한 집게 정책을 개발하기 위해.
- Transformer의 자기주의 메커니즘을 활용하여 이미지 시퀀스의 장거리 의존성을 모델링하고, 순환 또는 합성곱 모델 대비 강건성을 향상시키기 위해.
- 새로운 과일 집게 데이터셋을 사용하여 실제 로봇 하드웨어에서의 온라인 집게 실험을 통해 프레임워크를 검증하기 위해.
제안 방법
- 프레임워크는 탐색적 동작(핀치 및 슬라이딩) 동안 수집된 시각(_RGB_) 및 촉각(GelSight) 이미지 시퀀스를 공동으로 인코딩하기 위해 TimeSformer 및 ViViT이라는 두 가지 최첨단 Transformer 아키텍처를 활용한다.
- 두 모odalities에서 추출된 시공간적 특징이 학습된 주의 메커니즘을 통해 공유된 물리적 특징 임베딩으로 융합된다.
- 다층 퍼셉트론(Multilayer Perceptron, MLP)은 융합된 임베딩과 주어진 집게 힘 임계값을 기반으로 집게 결과(안전, 미끄러짐, 손상)를 예측한다.
- 학습된 예측기와 함께 온라인 추론을 통해 이산적인 힘 임계값(3–12) 범위에서 탐색함으로써 최적의 집게 힘을 결정한다.
- 자신들만의 MLP 헤드는 집게된 과일 유형을 분류하여 자동 분류를 가능하게 하며, 작업 수준 제어를 가능하게 한다.
- 모델은 대규모 과일 데이터셋에서 사전 훈련되고, 더 작은, 알려지지 않은 과일 유형에서 미세조정되어 제로샷 일반화를 가능하게 한다.
실험 결과
연구 질문
- RQ1시각-촉각 Transformer 프레임워크는 변형 가능한 물체의 안전한 집게 힘 예측에서 CNN+LSTM 모델을 능가할 수 있는가?
- RQ2사전 훈련된 Transformer 모델은 바나나와 같은 알려지지 않은 비정형 과일에 얼마나 잘 일반화되는가?
- RQ3시공간 주의 메커니즘이 집게 중 관련 접촉 영역에 집중하는 데 얼마나 효과적인가?
- RQ4다양한 과일 데이터셋에서의 사전 훈련이 작은 새로운 데이터셋에서의 미세조정 성능을 향상시키는가?
- RQ5프레임워크는 실제 로봇 하드웨어를 사용한 실세계 온라인 집게 실험에서 높은 성공률를 달성할 수 있는가?
주요 결과
- 제안된 프레임워크는 바나나의 온라인 집게에서 84%의 성공률를 기록하였으며, 베이스라인 모델(52%)과 사전 훈련 없이 미세조정한 모델(76%)을 크게 능가하였다.
- TimeSformer와 ViViT은 공개 데이터셋에서 미끄러짐 탐지 성능에서 각각 CNN+LSTM 베이스라인보다 3.1%와 2.0% 높아져, 뛰어난 정확도와 계산 효율성을 입증하였다.
- 사전 훈련된 모델은 작은 바나나 데이터셋에서 미세조정 정확도를 10% 향상시켰으며, 훈련의 진동을 감소시키고 수렴 안정성을 향상시켰다.
- 주의 시각화 결과, 바나나와 같이 매우 비정형적인 과일의 경우에도 모델이 시각 및 촉각 모달리티 모두에서 일관되게 국소적 접촉 영역에 집중하는 것으로 나타났다.
- 프레임워크는 강력한 제로샷 일반화 성능를 보였으며, 새로운 과일 유형에서 미세조정했을 때 사전 훈련된 모델을 사용하면 75%의 훈련 정확도를 달성했고, 사전 훈련 없이 사용할 경우 정확도가 10% 감소하였다.
- 모델은 시각 이미지 품질에 비해 촉각 이미지 품질에 더 민감한 것으로 나타났으며, 이는 촉각 데이터 증강 또는 노이즈 내성 향상의 필요성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.