Skip to main content
QUICK REVIEW

[論文レビュー] Learning Based Industrial Bin-picking Trained with Approximate Physics Simulator

Ryo Matsumura, Kensuke Harada|arXiv (Cornell University)|May 23, 2018
Robot Manipulation and Learning参考文献 7被引用数 3
ひとこと要約

本論文では、近似物理シミュレータを用いて生成された合成データでトレーニングされた畳み込みニューラルネットワーク(CNN)を用いた学習ベースの産業用ビンピッキングシステムを提案する。衝突検出の効率化のため形状の近似を用いても、CNNの入力に正確な3次元モデルを用いて深度画像を生成することで、近似の影響を効果的に緩和し、高い予測精度を維持する。

ABSTRACT

In this research, we tackle the problem of picking an object from randomly stacked pile. Since complex physical phenomena of contact among objects and fingers makes it difficult to perform the bin-picking with high success rate, we consider introducing a learning based approach. For the purpose of collecting enough number of training data within a reasonable period of time, we introduce a physics simulator where approximation is used for collision checking. In this paper, we first formulate the learning based robotic bin-picking by using CNN (Convolutional Neural Network). We also obtain the optimum grasping posture of parallel jaw gripper by using CNN. Finally, we show that the effect of approximation introduced in collision checking is relaxed if we use exact 3D model to generate the depth image of the pile as an input to CNN.

研究の動機と目的

  • 学習ベースのロボットビンピッキングのための十分なトレーニングデータを、現実的な時間枠内で収集する課題に対処すること。
  • 不規則な形状の物体がランダムに積まれたピラミッドのような複雑な物理的相互作用をシミュレートする際の計算ボトルネックを克服すること。
  • 物理シミュレーションにおける形状近似が、CNNベースの把持成功予測の精度に与える悪影響を最小限に抑えること。
  • 衝突チェックに簡略化された物体形状を用いても、高精度な把持ポリシー学習が可能な手法を開発すること。
  • 正確な3次元モデルを用いて深度画像を生成することで、シミュレーションにおける形状近似が引き起こす性能低下を緩和できることを実証すること。

提案手法

  • 衝突検査に形状近似を用いる物理シミュレータを採用し、データ生成時のシミュレーション時間を短縮する。
  • 元の高精度な3次元モデルを用いて、物体のピルの合成深度画像を生成し、ネットワーク入力における幾何的忠実度を保持する。
  • 深度画像と候補となる把持ポーズを入力として、物体の把持成功確率を予測するCNNをトレーニングする。
  • CNNの出力から予測成功確率が最も高いポーズを選択することで、把持ポーズを最適化する。
  • 衝突検査には凸分解された物体部品の長方形近似を用いるが、深度画像のレンダリングには元の幾何形状を保持する。
  • 形状近似がシミュレーションで誤検出(偽陽性)を引き起こすケースにおいて、予測誤差を分析することで、トレーニング済みCNNの耐障害性を評価する。

実験結果

リサーチクエスチョン

  • RQ1物理シミュレーションにおける形状近似が、CNNベースのビンピッキングポリシーの性能にどの程度悪影響を及えるか?
  • RQ2形状近似による誤差を相殺するために、正確な3次元モデルを用いて深度画像を生成することは有効か?
  • RQ3トレーニングデータにおける形状近似の許容可能な最大率は何か? それでも実世界のピッキングタスクへの一般化が信頼できる範囲内に保てるか?
  • RQ4CNNは、シミュレーションの近似によって生じる現実的でない把持と現実的な把持をどのように区別しているか?
  • RQ5近似物理シミュレーションをトレーニングに用いても、学習ベースのアプローチが実世界のビンピッキングで高い成功率を維持できるか?

主な発見

  • 20件の検証テストケースにおいて、CNNモデルは最適な把持ポーズを高い成功率で特定した。
  • 物理シミュレーションで形状の近似を用いても、正確な3次元モデルを深度画像入力に使用することで、CNNは信頼性の高い予測精度を維持した。
  • 200件のシミュレーションケースのうち15件では、形状近似による偽陽性によりロボットが物体を正常にピッキングしたが、その多くでCNNは低成功率(0.5未満)を予測した。
  • トレーニングで近似物体の使用率を30%未満に抑えた場合、CNNはピッキング成功/失敗を高い精度で正しく予測した。
  • 高速な近似シミュレーションによる効果的なデータ収集が可能であり、正確な深度画像入力により一般化能力が保持された。
  • 本手法は、シミュレーション速度と予測信頼性のバランスを取っており、産業用ビンピッキング応用における大規模トレーニングを現実可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。