Skip to main content
QUICK REVIEW

[論文レビュー] Pose Estimation for Texture-less Shiny Objects in a Single RGB Image Using Synthetic Training Data

Chen Chen, Xin Jiang|arXiv (Cornell University)|Sep 23, 2019
Industrial Vision Systems and Defect Detection参考文献 25被引用数 6
ひとこと要約

本論文では、合成RGBデータと密なエッジキーポoinを用いて、テクスチャのない光沢のある金属部品の6次元姿勢推定のための新規手法を提案する。マスクR-CNNによる検出、スタックドアワーゲラスネットワークによるキーポイント回帰、および反射を考慮した姿勢最適化パイプラインを組み合わせることで、実世界のデータに依存せずに、反射や部分的遮蔽が生じる困難な産業的状況においても高い精度を達成する。

ABSTRACT

In the industrial domain, the pose estimation of multiple texture-less shiny parts is a valuable but challenging task. In this particular scenario, it is impractical to utilize keypoints or other texture information because most of them are not actual features of the target but the reflections of surroundings. Moreover, the similarity of color also poses a challenge in segmentation. In this article, we propose to divide the pose estimation process into three stages: object detection, features detection and pose optimization. A convolutional neural network was utilized to perform object detection. Concerning the reliability of surface texture, we leveraged the contour information for estimating pose. Since conventional contour-based methods are inapplicable to clustered metal parts due to the difficulties in segmentation, we use the dense discrete points along the metal part edges as semantic keypoints for contour detection. Afterward, we exploit both keypoint information and CAD model to calculate the 6D pose of each object in view. A typical implementation of deep learning methods not only requires a large amount of training data, but also relies on intensive human labor for labeling the datasets. Therefore, we propose an approach to generate datasets and label them automatically. Despite not using any real-world photos for training, a series of experiments showed that the algorithm built on synthetic data perform well in the real environment.

研究の動機と目的

  • テクスチャがなく光沢のある金属部品の6次元姿勢推定の課題に取り組む。伝統的なテクスチャベースの手法は、反射や低コントラストのため失敗するが、産業現場でその課題を克服する。
  • 高スケールで完全にアノテートされた合成データセットを自動で生成するパイプラインを開発し、高価な実世界データ収集と手作業ラベリングの必要性を排除する。
  • 反射干渉アーチファクトを軽減するための反射を考慮したレンダリングとキーポイント再推定戦略を用いて、密な金属部品のクラスタリング状況における姿勢推定精度を向上させる。
  • 合成データのみで学習したモデルが、特に困難な照明条件や遮蔽状況下でも、実世界の産業環境に効果的に一般化できることを検証する。

提案手法

  • Blenderを用いて、ランダムに設定された背景、照明、物体の姿勢を用いて、クラスタリングされた金属部品の合成RGB画像を生成した。
  • 合成データ上で訓練されたマスクR-CNNベースのネットワークを用い、個々の金属部品を検出することで、バウンディングボックスとインスタンスマスクを出力した。
  • CADモデルのエッジに沿って密な3次元キーポイントを投影し、その2次元位置を推定するため、スタックドアワーゲラスネットワークを訓練した。
  • 反射を考慮した姿勢最適化戦略を導入した:信頼度の高い部品の検出と姿勢推定後、OpenDRを用いてその2次元投影を再レンダリングし、反射領域をマスクすることで、重なっているか、反射性の高い部品上の正確なキーポイント検出を可能にした。
  • PnPを用いて、検出されたキーポイントとCADモデルからの重み付き2次元-3次元対応を用いて姿勢最適化を実行し、再投影誤差を用いて最良の姿勢候補を選択した。
  • パイプライン全体は順番に実行された:物体検出 → キーポイント検出 → 反射を考慮した最適化 → 姿勢最適化。信頼度スコアが処理順序を制御した。

実験結果

リサーチクエスチョン

  • RQ1合成RGBデータのみで学習したディープラーニングモデルは、実世界の産業環境において、テクスチャのない光沢のある金属部品の6次元姿勢推定を安定して達成できるか?
  • RQ2密な金属部品のクラスタリング状況において、キーポイント検出と姿勢推定の段階で、部品間の反射干渉をどのように軽減できるか?
  • RQ3重なっている反射や部分的遮蔽によって生じる姿勢推定誤差を最小限に抑えるために、クラスタ内の金属部品を最適に選別・処理する戦略は何か?
  • RQ4高反射性・テクスチャのない物体において、密度の高いエッジベースキーポイントが、テクスチャベース特徴量に代わって姿勢推定に有効に機能するか?
  • RQ5自動合成データ生成とラベリングによって、6次元オブジェクト姿勢推定における高コストな人工作業によるアノテーション済み実世界データセットの必要性を排除できるか?

主な発見

  • 合成データでのみ学習したモデルは、実世界のシーンにおいて、テクスチャのない光沢のある金属部品の6次元姿勢推定を正確に実行でき、優れた一般化能力を示した。
  • 反射を考慮した最適化プロセスにより、相互反射によって生じる誤ったキーポイント検出が顕著に減少し、重なっている部品の姿勢精度が向上した。
  • スタックドアワーゲラスネットワークは、高反射性や低テクスチャ領域であっても、金属部品の密なエッジポイントから2次元キーポイントを正確に回帰できた。
  • 合成データ上で訓練したマスクR-CNNによる物体検出は、バウンディングボックスとマスクを用いて信頼性の高いインスタンスレベル検出を達成し、下流タスクの基盤を形成した。
  • 1枚の画像あたりの処理時間は、検出で約1.2秒、キーポイント予測で0.5秒、姿勢最適化で0.3秒未満であり、リアルタイム産業応用に適したパイプラインを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。