Skip to main content
QUICK REVIEW

[論文レビュー] Visuo-Tactile-Based Slip Detection Using A Multi-Scale Temporal Convolution Network

Junli Gao, Zhaoji Huang|arXiv (Cornell University)|Feb 27, 2023
Tactile and Sensory InteractionsNeuroscience被引用数 3
ひとこと要約

本論文では、ロボットの把持中にリアルタイムでのスリップ検出を可能にする、視覚的・触覚的融合深層学習モデルであるCNN-MSTCNを提案する。このモデルは、視覚的および触覚的情報からの時間的特徴を抽出するために、マルチスケール時系列畳み込みネットワーク(MS-TCN)を用いる。50種類の日常的物体から構成される独自のデータセット上で96.96%の精度を達成し、LSTMベースのベースラインを上回り、さまざまな触覚センサー間で優れた一般化性能を示している。

ABSTRACT

Humans can accurately determine whether the object in hand has slipped or not by visual and tactile perception. However, it is still a challenge for robots to detect in-hand object slip through visuo-tactile fusion. To address this issue, a novel visuo-tactile fusion deep neural network is proposed to detect slip, which is a time-dependent continuous action. By using the multi-scale temporal convolution network (MS-TCN) to extract the temporal features of visual and tactile data, the slip can be detected effectively. In this paper, a 7-dregree-of-freedom (7-DoF) robot manipulator equipped with a camera and a tactile sensor is used for data collection on 50 daily objects with different shapes, materials, sizes, and weights. Therefore, a dataset is built, where the grasping data of 40 objects and 10 objects are used for network training and testing, respectively. The detection accuracy is 96.96% based on the proposed model. Also, the proposed model is compared with a visuo-tactile fusion deep neural network (DNN) based on long short-term memory network (LSTM) on the collected dataset and a public dataset using the GelSight tactile sensor. The results demonstrate that the proposed model performs better on both dataset. The proposed model can help robots grasp daily objects reliably. In addition, it can be used in grasping force control, grasping policy generation and dexterous manipulation.

研究の動機と目的

  • マルチモーダルセンサー統合を用いて、ロボットの把持における信頼性の高いイン・ハンドスリップ検出を実現すること。
  • LSTMなどのRNNと比較して優位性を示すTCNの利点を活かし、連続的なスリップ検出のための時間的特徴抽出を改善すること。
  • 多様な物体タイプおよび触覚センサー形式に対し、良好に動作する堅牢で一般化可能なモデルを開発すること。
  • 現実世界のロボット操作におけるスリップ検出のベンチマーク化を目的とした包括的な視覚的・触覚的情報データセットを構築すること。
  • 特に柔ららかく大きく変形する物体に対して、触覚のみのセンシングの限界を調査すること。

提案手法

  • 7自由度のロボットアームに、RealSense D455 RGBカメラとXELA触覚センサーを搭載し、50種類の日常的物体の把持および持ち上げの過程で視覚的・触覚的情報を収集する。
  • 視覚的および触覚的情報は、分離されたストリームエンコーダーを経て処理され、空間的・時間的特徴が抽出された後、統合される。
  • 統合された特徴量における長距離の時間的依存関係をモデル化するために、マルチスケール時系列畳み込みネットワーク(MS-TCN)が採用される。
  • MS-TCNは、複数の受容野を持つ拡張畳み込みを用い、異なる時間スケールでの時間的ダイナミクスを捉える。
  • 最終分類の前に、視覚的および触覚的情報特徴を後段融合戦略で統合し、全結合層を用いて分類する。
  • モデルは40個の訓練用物体上でエンドツーエンドに学習され、残りの10個の物体をテスト用にホールドアウトして評価される。

実験結果

リサーチクエスチョン

  • RQ1マルチスケール時系列畳み込みネットワークは、連続的なスリップ検出のための視覚的・触覚的情報から時間的特徴を効果的に抽出できるか?
  • RQ2視覚的・触覚的統合は、単一モodal入力と比較して、スリップ検出の精度をどのように向上させるか?
  • RQ3提案されたモデルは、アレイ型センサーや光学センサーを含む、さまざまな触覚センサー形式間で一般化できるか?
  • RQ4なぜ触覚のみのセンシングは柔ららかく変形性の高い物体では性能が著しく低下するのか?また、統合によってその問題はどのように緩和されるか?
  • RQ5物体の剛性が、触覚のみのモデルと視覚的・触覚的統合モデルの性能に与える影響は何か?

主な発見

  • 提案されたCNN-MSTCNモデルは、50種類の日常的物体から構成される独自のデータセット上で96.96%のスリップ検出精度を達成した。
  • 視覚的・触覚的統合は、視覚のみや触覚のみのモダリティを大幅に上回り、特にマッサージボールのような柔ららかな物体では、触覚のみの性能が50%まで低下した。
  • モデルは一般化性能が高く、公的GelSightベースのデータセットでも優れた性能を示し、センサー間の耐障害性を実証した。
  • 触覚のみの予測は、柔ららかな物体では安定状態とスリップ状態の画像パターンが類似しているため失敗するが、統合モデルはこれを効果的に是正した。
  • MS-TCNアーキテクチャは、独自データセットおよび公的データセットの両方でLSTMベースのベースラインを上回り、時間的モデリングにおいて優位性を確認した。
  • マルチモーダル統合により、柔ららかく大きく変形する物体において、安定した把持をスリップと誤検出する問題が効果的に緩和された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。