Skip to main content
QUICK REVIEW

[論文レビュー] Siamese Convolutional Neural Network for Sub-millimeter-accurate Camera Pose Estimation and Visual Servoing

Cunjun Yu, Zhongang Cai|arXiv (Cornell University)|Mar 12, 2019
Advanced Vision and Imaging参考文献 16被引用数 8
ひとこと要約

本稿では、工業的ロボットアセンブリタスクにおける高精度なビジュアルサーボイングを可能にする、サブミリメートル精度のカメラポーズ推定のためのシアンプル畳み込みニューラルネットワークを提案する。2枚の画像間の相対ポーズをシアンプルアーキテクチャを用いて推定することで、初期誤差10 mm/5°を1回の推論で0.6 mm/0.4°未満にまで低減し、力センサを用いない状態でVGAコネクタ挿入に97.5%の成功率を達成した。

ABSTRACT

Visual Servoing (VS), where images taken from a camera typically attached to the robot end-effector are used to guide the robot motions, is an important technique to tackle robotic tasks that require a high level of accuracy. We propose a new neural network, based on a Siamese architecture, for highly accurate camera pose estimation. This, in turn, can be used as a final refinement step following a coarse VS or, if applied in an iterative manner, as a standalone VS on its own. The key feature of our neural network is that it outputs the relative pose between any pair of images, and does so with sub-millimeter accuracy. We show that our network can reduce pose estimation errors to 0.6 mm in translation and 0.4 degrees in rotation, from initial errors of 10 mm / 5 degrees if applied once, or of several cm / tens of degrees if applied iteratively. The network can generalize to similar objects, is robust against changing lighting conditions, and to partial occlusions (when used iteratively). The high accuracy achieved enables tackling low-tolerance assembly tasks downstream: using our network, an industrial robot can achieve 97.5% success rate on a VGA-connector insertion task without any force sensing mechanism.

研究の動機と目的

  • 産業的ロボットアセンブリタスクにおける、極めて高精度で汎用的かつ耐障害性のあるビジュアルサーボイング手法の不足を解消すること。
  • 従来のディープラーニングベースのビジュアルサーボイングの限界、すなわち一般化性能の低さ、明るさへの感受性、実世界データにおける高い誤差率を克服すること。
  • 大規模な初期ポーズ誤差に対してもサブミリメートル精度を維持できるポーズ推定ネットワークの開発。
  • 力センサを用いずに、視覚フィードバックのみで高精度なロボット挿入を実現すること。
  • 類似したトレーニング例からの一般化を通じて、新しいコネクタ、部分的遮蔽、照明条件の変化に対しても耐障害性を確保すること。

提案手法

  • 同じ重みを持つ2つの特徴抽出器を備えた、シアンプル畳み込みニューラルネットワークアーキテクチャを採用し、2枚の入力画像を独立して処理する。
  • 各画像からの特徴量は、以降の層で相関ベースの類似度モジュールを用いて比較され、相対ポーズ差が推定される。
  • 微細なポーズ回帰を学習するために、小さなポーズ差(≤10 mmの並進、≤5°の回転)を持つ合成画像ペアでネットワークをトレーニングする。
  • ポーズ推定はワンショットの方法で実行され、現在の画像を基準画像に一致させるために必要な変換が予測される。
  • 初期誤差が大きい場合には、繰り返し適用することで、各予測がロボットのポーズを改善し、収束するまで反復して利用される。
  • トレーニングデータセットは、制御された正確なラベル付きポーズで画像ペアをキャプチャするロボットセットアップを自動的に用いて収集された。

実験結果

リサーチクエスチョン

  • RQ1シアンプルCNNは、ロボットビジュアルサーボイングのための相対カメラポーズ推定において、サブミリメートル精度を達成できるか?
  • RQ2トレーニング中に見られなかった新しいコネクタに対しても、ネットワークは高い精度を維持できるか?
  • RQ3繰り返し適用された場合、照明の変化、部分的遮蔽、大きな初期ポーズ誤差に対して、ネットワークはどれほど耐障害性を示すか?
  • RQ4力センサを用いずに、視覚フィードバックのみで高精度なロボット挿入タスクを実現できるか?
  • RQ5トレーニング分布をはるかに超えるポーズ差に対しても、繰り返し適用された場合にネットワークの性能が維持されるか?

主な発見

  • ネットワークは、並進方向に10 mm、回転方向に5°の初期誤差を、1回の推論でそれぞれ0.6 mm未満、0.4°未満にまで低減した。
  • 繰り返し適用された場合、数cmの並進誤差と数十度の回転誤差を有する初期ポーズからも、サブミリメートル精度でターゲットポーズにロボットを誘導できた。
  • 実世界のVGAコネクタ挿入タスクにおいて、力センサ機構を一切使用せずに97.5%の成功率を達成した。
  • トレーニングデータセットに含まれない新しいコネクタ(A2)に対しても、試行全体で96%の成功率を達成した。
  • 明るさの変化、部分的遮蔽、画像ノイズに対しても耐障害性を示した。30%のコネクタ可視率での繰り返し挿入試行でもその有効性が実証された。
  • 小さなポーズ差でのみトレーニングされたにもかかわらず、極端な初期誤差や遮蔽が存在するすべてのテストケースで、正しくポーズに収束した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。