[論文レビュー] Segmenting Unknown 3D Objects from Real Depth Images using Mask R-CNN Trained on Synthetic Data
本論文では、ドメインランダマイゼーションを用いて合成深度画像のみでトレーニングされたカテゴリに依存しないインスタンスセグメンテーションモデル、Synthetic Depth Mask R-CNN (SD Mask R-CNN) を提案する。実世界の深度画像において最先端の性能を達成しており、ポイントクラウドクラスタリングベースラインより平均精度(AP)で15%、平均リcall(AR)で20%向上し、実データでファインチューニングされたモデルと同等の性能を発揮する。これにより、人間によるラベル付けが不要な実世界のロボットハンドリングが可能になる。
The ability to segment unknown objects in depth images has potential to enhance robot skills in grasping and object tracking. Recent computer vision research has demonstrated that Mask R-CNN can be trained to segment specific categories of objects in RGB images when massive hand-labeled datasets are available. As generating these datasets is time consuming, we instead train with synthetic depth images. Many robots now use depth sensors, and recent results suggest training on synthetic depth data can transfer successfully to the real world. We present a method for automated dataset generation and rapidly generate a synthetic training dataset of 50,000 depth images and 320,000 object masks using simulated heaps of 3D CAD models. We train a variant of Mask R-CNN with domain randomization on the generated dataset to perform category-agnostic instance segmentation without any hand-labeled data and we evaluate the trained network, which we refer to as Synthetic Depth (SD) Mask R-CNN, on a set of real, high-resolution depth images of challenging, densely-cluttered bins containing objects with highly-varied geometry. SD Mask R-CNN outperforms point cloud clustering baselines by an absolute 15% in Average Precision and 20% in Average Recall on COCO benchmarks, and achieves performance levels similar to a Mask R-CNN trained on a massive, hand-labeled RGB dataset and fine-tuned on real images from the experimental setup. We deploy the model in an instance-specific grasping pipeline to demonstrate its usefulness in a robotics application. Code, the synthetic training dataset, and supplementary material are available at https://bit.ly/2letCuE.
研究の動機と目的
- 人間によるラベル付けが不要な実世界の深度画像におけるカテゴリに依存しないインスタンスセグメンテーションを可能にすること。
- ロボットビジョンのための手作業ラベルの付いたデータセットの高コストとスケーラビリティの限界という課題に対処すること。
- 遮蔽や複雑な幾何構造を含む実世界の複雑なシーンへのシミュレーションから実世界への一般化を良好に実現する手法を開発すること。
- ドメインランダマイゼーションを用いた合成データが、インスタンス固有のハンドリングなどの実世界のロボットアプリケーションにおいて有効であることを実証すること。
提案手法
- 著者らは、3次元CADモデルをシミュレートした山の構成を用いて、50,000枚の合成深度画像と320,000枚のオブジェクトマスクからなる合成データセットを生成した。
- トレーニング中にドメインランダマイゼーションを適用し、カメラのポーズ、内部パラメータ、オブジェクトの位置を変化させることで、シミュレーションから実世界への一般化を向上させた。
- マスクR-CNNの変種を合成データセット(WISDOM-Sim)上でトレーニングし、実データやカテゴリ固有の監視なしにインスタンスセグメンテーションを実行した。
- モデルは、多様なオブジェクト幾何構造を有する高解像度の実世界データセット(WISDOM-Real)上で評価された。
- 分類器として事前トレーニング済みのVGG-16を用いて、セグメンテーションマスクからターゲットオブジェクトを選択するインスタンス固有のハンドリングパイプラインに統合した。
- COCO指標とロボットハンドリングの成功率を用いて、ポイントクラウドクラスタリングと実データでファインチューニングされたマスクR-CNNとのベンチマークが実施された。
実験結果
リサーチクエスチョン
- RQ1合成深度画像のみでトレーニングされたマスクR-CNNモデルが、実世界の深度画像において高い性能のインスタンスセグメンテーションを達成できるか?
- RQ2ドメインランダマイゼーションは、深度ベースのインスタンスセグメンテーションにおけるシミュレーションから実世界への一般化をどのように向上させるか?
- RQ3合成データでのトレーニングが、実データでのファインチューニングを上回るセグメンテーション精度とロボットタスクの成功確率を達成できるか?
- RQ4モデルは低解像度のセンサーや重度に遮蔽されたシーンに対してもどの程度一般化できるか?
- RQ5人間によるラベル付けが不要な状況でも、モデルが効果的なインスタンス固有のハンドリングを可能にするか?
主な発見
- SD Mask R-CNN は、WISDOM-Sim テストセットで平均精度(AP)66.4%、平均リcall(AR)74.8%を達成し、ユークリッドクラスタリング(16.1% AP)とリージョングローニング(17.2% AP)を大きく上回った。
- 実世界の WISDOM-Real データセットでは、ポイントクラウドクラスタリングベースラインよりAPが15ポイント、ARが20ポイント向上した。
- 低解像度の深度センサに対しても一般化でき、解像度が低下しても強力な性能を維持した。
- インスタンス固有のハンドリング実験では、SD Mask R-CNN は74%の成功率を達成し、ユークリッドクラスタリング(56%)を上回り、実データでファインチューニングされたマスクR-CNN(78%)と同等の性能を発揮した。
- 100枚の初期キャプチャから生成された1,000枚の拡張画像を用いた分類器は、2分未満でファインチューニングされた。これは、低コストのデータとトレーニングのオーバーヘッドを示している。
- 人間による高コストなラベル付けへの依存を低減し、新しいロボットタスクのセグメンテーションの迅速な展開を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。