[論文レビュー] Learning Rich Features from RGB-D Images for Object Detection and Segmentation
本稿では、水平方向の視差、地面からの高さ、重力方向との角度を符号化する新しい地心座標埋め込みを提案する。この埋め込みにより、RGB-Dオブジェクト検出およびインスタンスセグメンテーションにおける特徴学習が向上する。CNNベースのR-CNNフレームワークにこの表現を統合することで、先行手法に比べて平均精度(AP)が56%相対的に向上(37.3%)し、オブジェクト検出器の出力をスーパピクセル特徴に活用することで、セマンティックセグメンテーションにおいて24%の相対的改善が達成された。
In this paper we study the problem of object detection for RGB-D images using semantically rich image and depth features. We propose a new geocentric embedding for depth images that encodes height above ground and angle with gravity for each pixel in addition to the horizontal disparity. We demonstrate that this geocentric embedding works better than using raw depth images for learning feature representations with convolutional neural networks. Our final object detection system achieves an average precision of 37.3%, which is a 56% relative improvement over existing methods. We then focus on the task of instance segmentation where we label pixels belonging to object instances found by our detector. For this task, we propose a decision forest approach that classifies pixels in the detection window as foreground or background using a family of unary and binary tests that query shape and geocentric pose features. Finally, we use the output from our object detectors in an existing superpixel classification framework for semantic scene segmentation and achieve a 24% relative improvement over current state-of-the-art for the object categories that we study. We believe advances such as those represented in this paper will facilitate the use of perception in fields like robotics.
研究の動機と目的
- 生の視差を超えるより豊かな深度表現を活用することで、RGB-D画像におけるオブジェクト検出およびインスタンスセグメンテーションの性能を向上させること。
- ボクシングボックス検出およびセマンティックセグメンテーションの限界を克服するため、ピクセルレベルのインスタンスセグメンテーションを導入すること。
- 深度画像からの地心座標ポーズおよび幾何的ヒントを符号化することで、畳み込みニューラルネットワークにおける特徴学習を向上させること。
- オブジェクト検出器の出力をスーパピクセルの追加特徴として統合することで、セマンティックシーンセグメンテーションの性能を向上させること。
- 豊富なRGB-D特徴の実用的有用性を、ロボット工学およびシーン理解の応用分野において示すこと。
提案手法
- 水平視差、地面からの高さ、重力方向との角度の3チャネルからなる地心座標埋め込みを、深度画像に導入し、各ピクセルの3次元幾何的文脈を符号化する。
- 事前学習済みのRGB-CNNを、地心座標深度埋め込みからの特徴を学習できるように変更し、生の深度または視差のみを用いる場合よりも表現学習を向上させる。
- RGB-Dの輪郭を用いたマルチスケールコンビナトリアルグループ化(MCG)を採用し、ごみくずの多いシーンでも品質の高い2.5次元領域候補を生成する。
- 意思決定ツリーを用いてインスタンスセグメンテーションを実行し、形状および地心座標ポーズ特徴に基づく単一および二項テストを用いてピクセルを前景または背景に分類する。
- オブジェクト検出器の出力(存在、位置、信頼度)をスーパピクセル特徴に追加することで、セマンティックセグメンテーションの性能を向上させる。
- オブジェクト検出とセグメンテーションを統合したパイプラインを構築し、インスタンスレベルおよびセマンティックレベルのラベル付けを両方サポートする。
実験結果
リサーチクエスチョン
- RQ1高さと重力方向への整合性を符号化する地心座標深度埋め込みは、RGB-Dオブジェクト検出におけるCNNの特徴学習を向上させることができるか?
- RQ2RGBと深度特徴を地心座標表現で統合することで、生の深度または視差を用いる場合よりも検出およびセグメンテーション性能が向上するか?
- RQ3形状および地心座標ポーズ特徴をRGB-Dデータから抽出した意思決定ツリーは、インスタンスセグメンテーションを効果的に実行できるか?
- RQ4オブジェクト検出器の出力をスーパピクセルの補助特徴として用いることで、セマンティックセグメンテーション性能はどの程度向上するか?
- RQ5多様なオブジェクトカテゴリにおいて、平均精度およびセグメンテーション精度の観点から、提案手法は最先端の手法と比較してどのように差をつけるか?
主な発見
- 地心座標深度埋め込みは、CNNベースの特徴学習を顕著に向上させ、既存手法に比べて平均精度(AP)が56%相対的に向上(37.3%)した。
- 意思決定ツリーを用いた提案されたインスタンスセグメンテーション手法は、形状および地心座標ポーズ特徴を活用することで、ベースライン手法を上回る性能を達成した。
- オブジェクト検出器の出力をスーパピクセルの追加特徴として用いることで、セマンティックセグメンテーション性能が24%相対的に向上(平均Jaccardインデックス28.4%から35.1%へ)。
- 本手法は、対象としているオブジェクトカテゴリにおいて、セマンティックセグメンテーションで最先端の性能を達成し、頻度加重平均Jaccardインデックス(fwavacc)は60.3%を記録した。
- RGB-Dの輪郭とMCGによる2.5次元領域候補の統合により、最先端の候補生成が実現され、検出およびセグメンテーション精度が向上した。
- 本手法は、NYU Depthデータセットのような制御のきかないごみくずの多い環境でも強く一般化し、制御されたラボ環境を想定した先行手法を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。