Skip to main content
QUICK REVIEW

[論文レビュー] Estimated Depth Map Helps Image Classification

Yihui He|arXiv (Cornell University)|Sep 20, 2017
Advanced Vision and Imaging参考文献 18被引用数 11
ひとこと要約

本論文では、事前学習済みの深度推定ネットワークを用いて生成された推定深度マップを、RGB画像の画像分類性能を向上させる追加の入力特徴として使用することを提案する。CIFAR-10からRGBDデータセットを構築し、RGBおよびRGBD入力の両方で学習することで、著者らは深度マップが優れた特徴表現を提供することを示した。ResNet-20では0.55%、ResNet-56では0.53%の精度向上が得られ、浅いネットワークおよび深いネットワークの両方で一貫した向上が確認された。

ABSTRACT

We consider image classification with estimated depth. This problem falls into the domain of transfer learning, since we are using a model trained on a set of depth images to generate depth maps (additional features) for use in another classification problem using another disjoint set of images. It's challenging as no direct depth information is provided. Though depth estimation has been well studied, none have attempted to aid image classification with estimated depth. Therefore, we present a way of transferring domain knowledge on depth estimation to a separate image classification task over a disjoint set of train, and test data. We build a RGBD dataset based on RGB dataset and do image classification on it. Then evaluation the performance of neural networks on the RGBD dataset compared to the RGB dataset. From our experiments, the benefit is significant with shallow and deep networks. It improves ResNet-20 by 0.55% and ResNet-56 by 0.53%. Our code and dataset are available publicly.

研究の動機と目的

  • 推定深度マップを追加の入力特徴として用いることで、画像分類性能が向上するかどうかを調査すること。
  • 深度推定と画像分類の間のギャップを埋めること。深度マップがこれまで画像分類分野で応用されていなかった分野である。
  • 浅いネットワークおよび深いニューラルネットワークの両方における深度特徴の有効性を評価すること。
  • 事前学習済みの深度推定モデルから得た推定深度マップを用いて、CIFAR-10用の公開可能なRGBDデータセットを構築すること。
  • 下流の画像分類性能に基づく、トランスファーラーニングに基づく新しい深度推定品質評価指標を定義すること。

提案手法

  • CIFAR-10の画像を400×400にリサイズし、事前学習済みのディープコンvolutionニューラルフィールドモデルを用いて深度を推定し、深度マップを32×32にダウンサンプリングすることでRGBDデータセットを構築した。
  • 元のRGBチャネルと推定深度マップを組み合わせ、RGBD学習用の4チャンネルテンソル(32×32×4)を作成した。
  • 個々のR、G、B、Dチャネルを用いて2層のフィードフォワードニューラルネットワークを学習し、特徴表現の品質を比較した。
  • 標準のResNet-20およびResNet-56モデルを、RGBおよびRGBDデータセットの両方で学習・比較することで、深層ネットワークにおける性能向上を評価した。
  • 下流の画像分類精度の向上に基づく、新しい深度推定品質評価指標を提案した。
  • 深度推定にはTensorFlow、画像分類ネットワークの学習にはCaffeを用いた。

実験結果

リサーチクエスチョン

  • RQ1単一画像深度推定モデルから得た推定深度マップを追加の入力特徴として用いることで、画像分類性能が向上するか?
  • RQ2画像分類タスクにおいて、深度チャネルはRGBチャネルよりも優れた特徴表現を提供するか?
  • RQ3浅いネットワークおよび深いニューラルネットワークの両方において、深度マップを追加することで得られる性能向上が持続するか?
  • RQ4真値が存在しない状況で、分類精度に基づくトランスファーラーニングベースの指標を、深度推定品質の評価に用いることができるか?
  • RQ5深度マップによる性能向上は、RGB特徴のみでは捉えきれない、新たな補完的特徴情報に起因するのか?

主な発見

  • 2層のフィードフォワードネットワークに入力として使用した深度チャネルは、R、G、Bチャネルよりも高い検証精度を達成した。これは、優れた特徴表現能力を示している。
  • 2層ネットワークを用いた場合、RGBDデータセットで学習した場合の分類性能は、RGBのみで学習した場合に比べて4%向上した。これは、深度を補助入力として用いる価値を示している。
  • ResNet-20は、RGBDデータセットで学習した場合、RGBデータセットで学習した場合に比べてトップ1エラー率が0.55%改善した。
  • ResNet-56は、RGBDデータセットで6.44%のエラー率を記録し、RGBデータセットの6.97%よりも優れた性能を示した。これは0.53%の絶対的向上である。
  • RGBDモデルはRGBモデルよりも早く収束した。これは、深度マップが最適化を支援するより判別力が高く、構造的な特徴を提供している可能性を示唆している。
  • 深層ネットワークにおける性能向上は、エンドツーエンド学習によるRGBのみの学習では完全に捉えきれない情報が、深度特徴に含まれていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。