Skip to main content
QUICK REVIEW

[論文レビュー] Quickly Inserting Pegs into Uncertain Holes using Multi-view Images and Deep Network Trained on Synthetic Data

Joshua C. Triyonoputro, Weiwei Wan|arXiv (Cornell University)|Feb 25, 2019
Robot Manipulation and Learning参考文献 45被引用数 14
ひとこと要約

本論文では、合成データを用いて訓練された深層ニューラルネットワークを活用した学習ベースのビジョループ制御手法を提案する。この手法は、複数視点画像における不確実な穴位置を迅速にガイドする。穴の四分位を予測し、スパイラルサーチとインピーダンス制御を組み合わせることで、従来のスパイラルサーチのみに比べ、多様なテクスチャーや色の表面においてより高速かつより高い耐障害性でピッグインホールアセンブリを実現する。

ABSTRACT

This paper uses robots to assemble pegs into holes on surfaces with different colors and textures. It especially targets at the problem of peg-in-hole assembly with initial position uncertainty. Two in-hand cameras and a force-torque sensor are used to account for the position uncertainty. A program sequence comprising learning-based visual servoing, spiral search, and impedance control is implemented to perform the peg-in-hole task with feedback from the above sensors. Contributions are mainly made in the learning-based visual servoing of the sequence, where a deep neural network is trained with various sets of synthetic data generated using the concept of domain randomization to predict where a hole is. In the experiments and analysis section, the network is analyzed and compared, and a real-world robotic system to insert pegs to holes using the proposed method is implemented. The results show that the implemented peg-in-hole assembly system can perform successful peg-in-hole insertions on surfaces with various colors and textures. It can generally speed up the entire peg-in-hole process.

研究の動機と目的

  • 多様な表面テクスチャーや色にさらされる大規模な初期位置不確実性下でのピッグインホールアセンブリの課題に対処すること。
  • 学習ベースのビジョループ制御を統合することで、従来のスパイラルサーチ手法の所要時間と失敗率を低減すること。
  • ドメインランダマイゼーションを用いた合成データを活用し、一般化可能で耐障害性の高いビジョループ制御システムを開発すること。
  • 多様な表面背景において実世界実験を通じて手法の有効性を検証すること。
  • 異なる合成データのトレーニング環境における性能比較を行い、効率的向上の程度を評価すること。

提案手法

  • ドメインランダマイゼーションを用いて生成された合成データを活用し、深層ニューラルネットワークを訓練し、複数視点RGB画像における穴の四分位を予測する。
  • 合成データは、多様な背景画像にグリッパーのマスクをランダムに貼り付けることで作成され、さまざまなテクスチャーや色のシナリオをシミュレートする。
  • 反復的ビジョループ制御は、ネットワークの出力をリアルタイムで活用し、ロボットのピッグを予測された穴の四分位に向け導く。
  • ビジョループ制御とスパイラルサーチを組み合わせて微調整を行い、インピーダンス制御を用いて最終挿入を実現する。
  • ハンドインカメラとフォーストルクセンサーが、探索段階および挿入段階でリアルタイムフィードバックを提供する。
  • 本手法は、色やテクスチャが異なる表面を対象としたシミュレーションおよび実世界のロボット実験を通じて評価された。

実験結果

リサーチクエスチョン

  • RQ1合成データで訓練された深層ニューラルネットワークは、多様な表面条件下における複数視点画像において、穴の四分位を正確に予測できるか?
  • RQ2学習ベースのビジョループ制御は、従来のスパイラルサーチに比べ、速度および成功確率において優れているか?
  • RQ3合成データの分布の選択(例:画像ベース対単色)が、実世界環境におけるネットワークの一般化性および耐障害性に与える影響は何か?
  • RQ4高い初期位置不確実性下で、本手法は挿入までの所要時間をどの程度短縮できるか?
  • RQ5システムの失敗モードは、表面の外観およびネットワークのトレーニングデータとどのように相関しているか?

主な発見

  • 'Image'トレーニングデータを用いた場合、'White'および'Brown'表面では100%の成功確率を達成し、'Pink'では90%、'Sky'では30%の成功率を示した。
  • 'Plain'トレーニングデータでは、'White'および'Brown'表面で100%の成功確率を達成したが、'Pink'では40%、'Sky'では0%にとどまった。
  • 初期位置誤差が10 mmを超える場合、本手法により、従来のスパイラルサーチのみの場合の90秒を超える平均挿入時間を70秒未満に短縮した。
  • 初期誤差が小さい場合(4.0 mm)、スパイラルサーチのみがより速かったため、本手法の利点が特に高い不確実性下で顕著であることが確認された。
  • 多様な合成データ(例:'Image')で訓練されたネットワークは、単純なデータ(例:'Plain')よりも、未観測のテクスチャーや色に一般化しやすかった。
  • 失敗事例は主に'Sky'表面および'Pink'表面で'Plain'ネットワークを用いた場合に発生し、低コントラストまたは高反射性の背景に敏感であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。