Skip to main content
QUICK REVIEW

[論文レビュー] Stereo Vision Based Single-Shot 6D Object Pose Estimation for Bin-Picking by a Robot Manipulator

Yoshihiro Nakano|arXiv (Cornell University)|May 28, 2020
Robot Manipulation and Learning参考文献 28被引用数 4
ひとこと要約

本論文は、検出された物体にのみ視差計算を集中させる新しい Stereo Grid Attention モジュールを用いて、ロボット用バインピッキングのためのステレオビジョンベースの1ショット6次元物体ポーズ推定手法を提案する。この手法により、高速かつ高精度なポーズ推定が可能となる。本手法は、Jetson AGX Xavier 上で1024×1024の画像を75msで処理し、合成データと実世界のテストを組み合わせた電磁アームを用いたDCモーター部品の実験で89.1%の成功率を達成した。

ABSTRACT

We propose a fast and accurate method of 6D object pose estimation for bin-picking of mechanical parts by a robot manipulator. We extend the single-shot approach to stereo vision by application of attention architecture. Our convolutional neural network model regresses to object locations and rotations from either a left image or a right image without depth information. Then, a stereo feature matching module, designated as Stereo Grid Attention, generates stereo grid matching maps. The important point of our method is only to calculate disparity of the objects found by the attention from stereo images, instead of calculating a point cloud over the entire image. The disparity value is then used to calculate the depth to the objects by the principle of triangulation. Our method also achieves a rapid processing speed of pose estimation by the single-shot architecture and it is possible to process a 1024 x 1024 pixels image in 75 milliseconds on the Jetson AGX Xavier implemented with half-float model. Weakly textured mechanical parts are used to exemplify the method. First, we create original synthetic datasets for training and evaluating of the proposed model. This dataset is created by capturing and rendering numerous 3D models of several types of mechanical parts in virtual space. Finally, we use a robotic manipulator with an electromagnetic gripper to pick up the mechanical parts in a cluttered state to verify the validity of our method in an actual scene. When a raw stereo image is used by the proposed method from our stereo camera to detect black steel screws, stainless screws, and DC motor parts, i.e., cases, rotor cores and commutator caps, the bin-picking tasks are successful with 76.3%, 64.0%, 50.5%, 89.1% and 64.2% probability, respectively.

研究の動機と目的

  • クリッターダムなバインピッキング環境において、ステレオビジョンを用いて高速かつ高精度な6次元物体ポーズ推定を実現すること。
  • 全画像ではなく検出された物体にのみ視差計算を集中させることで、計算コストを低減すること。
  • 深度入力が不要な1ショットのディープラーニングフレームワークを構築し、左または右のステレオ画像からポーズを回帰すること。
  • 合成データセットを用いて、弱いテクスチャを持つ機械部品の実世界でのロボット操作を検証すること。
  • Jetson AGX Xavier などのエッジデバイスに適したリアルタイム性能を達成すること。

提案手法

  • 畳み込みニューラルネットワークが、深度マップを必要とせず、1枚の左または右ステレオ画像から6次元物体ポーズ(位置と姿勢)を回帰する。
  • アテンションメカニズムが顕著な物体領域を特定し、視差計算をこれらの領域に限定することで効率を向上させる。
  • Stereo Grid Attention モジュールがステレオグリッドマッチングマップを生成し、検出された物体に対してのみ視差を計算する。
  • 視差値は三角測量の原理を用いて深度に変換され、3次元ポーズ推定が可能になる。
  • 訓練および評価用に、仮想環境でレンダリングされた3次元機械部品モデルの合成データセットを構築する。
  • 本手法は、電磁アームを装備したロボットアームにデプロイされ、実世界のバインピッキングタスクを実行する。

実験結果

リサーチクエスチョン

  • RQ11ショットのステレオビジョンアプローチは、クリッターダムなバインピッキング環境で正確な6次元物体ポーズ推定を達成できるか?
  • RQ2アテンションベースの視差計算により、検出された物体にのみ集中させることで処理効率が向上するか?
  • RQ3合成データは、弱いテクスチャを持つ機械部品の実世界でのバインピッキングに有効にモデルを訓練できるか?
  • RQ4本手法は、Jetson AGX Xavier などのエッジハードウェアでリアルタイム性能を達成できるか?
  • RQ5本手法は、テクスチャや形状が異なる多様な機械部品を、実世界のシナリオでどれほど効果的に処理できるか?

主な発見

  • 本手法は、半精度モデルを用いて、Jetson AGX Xavier 上で1024×1024ピクセルのステレオ画像を75ミリ秒で処理する。
  • クリッターダムなバインから黒いスチールボルトをピッキングする実験で、76.3%の成功率を達成した。
  • ステンレススチールボルトは64.0%の成功率でピッキングに成功した。
  • DCモーターのケース部品は50.5%、ローター・コアは89.1%、コンmutatorキャップは64.2%の成功率を示した。
  • 合成データの使用により、弱いテクスチャを持つ機械部品の実世界への展開に有効な訓練が可能になった。
  • アテンションベースの視差計算により、全画像の視差推定を回避することで、処理負荷が顕著に低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。