Skip to main content
QUICK REVIEW

[論文レビュー] LabelFusion: A Pipeline for Generating Ground Truth Labels for Real RGBD Data of Cluttered Scenes

Pat Marion, Pete Florence|arXiv (Cornell University)|Jul 15, 2017
Advanced Neural Network Applications参考文献 18被引用数 8
ひとこと要約

LabelFusion は、3D 再構築と ICP アシストメッシュフィッティングを活用することで、ごみだらけのシーンにおけるリアルな RGBD データの迅速かつ高品質なラベリングを可能にするオープンソースパイプラインです。これにより、1シーンあたりの人的ラベリング時間は数時間から数分にまで短縮されました。数日間で100万件を超えるラベル付きオブジェクトインスタンスを生成し、実証的な結果から、マルチオブジェクト・マルチ環境のトレーニングデータは、ロボット操作を目的としたディープラーニングベースのセグメンテーションにおける一般化性能を顕著に向上させることを示しています。

ABSTRACT

Deep neural network (DNN) architectures have been shown to outperform traditional pipelines for object segmentation and pose estimation using RGBD data, but the performance of these DNN pipelines is directly tied to how representative the training data is of the true data. Hence a key requirement for employing these methods in practice is to have a large set of labeled data for your specific robotic manipulation task, a requirement that is not generally satisfied by existing datasets. In this paper we develop a pipeline to rapidly generate high quality RGBD data with pixelwise labels and object poses. We use an RGBD camera to collect video of a scene from multiple viewpoints and leverage existing reconstruction techniques to produce a 3D dense reconstruction. We label the 3D reconstruction using a human assisted ICP-fitting of object meshes. By reprojecting the results of labeling the 3D scene we can produce labels for each RGBD image of the scene. This pipeline enabled us to collect over 1,000,000 labeled object instances in just a few days. We use this dataset to answer questions related to how much training data is required, and of what quality the data must be, to achieve high performance from a DNN architecture.

研究の動機と目的

  • ロボット操作を目的とした、6DOF オブジェクトポーズを伴う大規模で現実世界のピクセル単位ラベル付き RGBD データセットの不足に対処すること。
  • 再利用可能なシーンレベルのラベリングパイプラインを用いて、RGBD データの人的ラベリング時間を桁違いに短縮すること。
  • データ量、シーンの複雑さ、環境の多様性が、ロボットビジョンにおけるディープラーニングの一般化性能に与える影響を実証的に調査すること。
  • 研究者が自らのロボットタスクに特化したカスタムで高品質なトレーニングデータセットを生成できる、スケーラブルでオープンソースのソリューションを提供すること。

提案手法

  • RGBD センサーを用いて、さまざまな視点からシーンのマルチビュー RGBD 動画をキャプチャすること。
  • 既存のマルチビュー ステレオ法および ICP を用いた統合技術を活用して、シーンの高密度 3D 再構築を構築すること。
  • 人的支援を伴う ICP を用いて、事前に用意された 3D オブジェクトメッシュを 3D 再構築に適合させ、正確なポーズ推定を実現すること。
  • ラベル付き 3D メッシュを個々の RGBD イメージに再投影することで、ピクセル単位のセマンティックセグメンテーションおよび 6DOF オブジェクトポーズラベルを生成すること。
  • ネットワークの一般化性能を向上させるために、視点の多様性とシーンの多様性を最適化してデータ収集すること。
  • 得られたデータセットを用いて、制御されたデータ変動条件の下で最先端のセマンティックセグメンテーションネットワークのトレーニングと評価を実施すること。

実験結果

リサーチクエスチョン

  • RQ1オクルージョンを伴うマルチオブジェクトシーンを含めることで、ディープラーニングベースのセマンティックセグメンテーションネットワークの一般化性能にどのような影響を与えるか?
  • RQ2背景環境のトレーニングデータの多様性が、未観測の新規シーンへの一般化性能に与える影響は何か?
  • RQ3最適なセグメンテーション性能を達成するために、1シーンあたり必要なビュー数はどの程度か?また、30 Hz の高フレームレートデータは、限界効果を示すか?
  • RQ4新規の未観測環境でテストした場合、単一オブジェクトシーンとマルチオブジェクトシーンでトレーニングされたネットワークの性能はどのように異なるか?

主な発見

  • オクルージョンを伴うマルチオブジェクトシーンでトレーニングされたネットワークは、単一オブジェクトシーンでトレーニングされたものよりも、新規シーンへの一般化性能が顕著に優れており、単一オブジェクト構成でのテストでも同様の傾向を示した。
  • 新規背景環境でのパフォーマンスは、トレーニング用背景の種別数に従って対数的に向上し、約50の背景が未観測シーンで50%以上の IoU を達成する水準に到達した。
  • 有効なセンサーサンプリングレートが上昇するにつれてセグメンテーションパフォーマンスは単調に向上したが、ゆっくり動くロボットアーム搭載データでは 0.3 Hz を超えると利得が減少した。これは、ほとんどの用途において 3 Hz が十分であることを示唆している。
  • より高いカメラ移動速度(約 0.05–0.17 m/s)を示す手動キャリブレーションデータ収集設定では、高フレームレートデータが、遅いロボット搭載データよりも顕著なパフォーマンス向上をもたらした。
  • このパイプラインにより、1画像あたりの人的ラベリング時間は数時間から、1シーン全体で数分にまで短縮され、数日間で 100万件を超えるラベル付きオブジェクトインスタンスを収集可能となった。
  • 352,000枚のラベル付き画像および 1,000,000個以上のオブジェクトインスタンスを含むこのデータセットは、ピクセル単位のラベルと 6DOF オブジェクトポーズの両方を備えた、公開済みの RGBD データセットの中で最大である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。