Skip to main content
QUICK REVIEW

[論文レビュー] Location Augmentation for CNN

Zhenyi Wang, Olga Veksler|arXiv (Cornell University)|Jul 18, 2018
Indoor and Outdoor Localization Technologies参考文献 18被引用数 8
ひとこと要約

本論文では、コンピュータビジョンタスクにおけるCNNの性能向上を図るために、入力RGB画像に位置に敏感なチャネルを追加する手法を提案している。具体的には、ピクセルの行と列の座標(直接座標)または画像中心からの間接的な距離変換を用いる。この手法は、顕著オブジェクトセグメンテーション、セマンティックセグメンテーション、シーンパースィングのタスクで顕著な性能向上を達成し、距離変換による拡張が、パラメータ負荷の低減と効果的な空間不変性のおかげで最も優れた結果をもたらした。

ABSTRACT

CNNs have made a tremendous impact on the field of computer vision in the last several years. The main component of any CNN architecture is the convolution operation, which is translation invariant by design. However, location in itself can be an important cue. For example, a salient object is more likely to be closer to the center of the image, the sky in the top part of an image, etc. To include the location cue for feature learning, we propose to augment the color image, the usual input to CNNs, with one or more channels that carry location information. We test two approaches for adding location information. In the first approach, we incorporate location directly, by including the row and column indexes as two additional channels to the input image. In the second approach, we add location less directly by adding distance transform from the center pixel as an additional channel to the input image. We perform experiments with both direct and indirect ways to encode location. We show the advantage of augmenting the standard color input with location related channels on the tasks of salient object segmentation, semantic segmentation, and scene parsing.

研究の動機と目的

  • 畳み込み層の並進不変性に起因する空間的位置情報の喪失というCNNの限界を解消すること。
  • 入力チャネルに空間的事前知識を組み込むことで、視覚タスクにおける特徴学習が向上するかを調査すること。
  • 位置情報の符号化に直接的な(座標)と間接的な(距離変換)の両手法を評価すること。
  • 複数のセグメンテーションベンチマークにおいて、位置情報拡張が深層ネットワークの性能に与える影響を特定すること。
  • 位置チャネルを追加した際のモデルの複雑さと性能向上のトレードオフを評価すること。

提案手法

  • 標準的なRGB入力に、ピクセルの行インデックスと列インデックスを符号化する2つの追加チャネルを追加(直接的な位置符号化)。
  • 直接的な座標を、画像中心からのユークリッド距離を表す1つの距離変換チャネルに置き換える(間接的符号化)。
  • 拡張された入力を用いて完全畳み込みネットワーク(FCN)を訓練し、標準アーキテクチャを維持したが、入力層のみを変更した。
  • ベースネットワークとしてFCN-32sを用い、CityscapesおよびPASCAL-SデータセットでSGDと高いモーメンタムを用いて学習した。
  • RGBのみ、RGB+座標、RGB+距離、RGB+座標+距離の入力の各条件で性能を比較した。
  • 位置チャネルに事前学習済み重みが与えるバイアスを避けるために、最初の畳み込み層の重みをランダム初期化することで、公平な比較を確保した。

実験結果

リサーチクエスチョン

  • RQ1CNNの入力に位置情報(座標)を追加することで、セマンティックおよびインスタンスレベルのセグメンテーションタスクの性能が向上するか?
  • RQ2直接座標と間接的距離変換のどちらの位置符号化方法がより優れた性能をもたらし、その理由は何か?
  • RQ3ネットワークの深さが、位置情報拡張の相対的な利点に与える影響は何か?
  • RQ4特定のオブジェクトクラスやシーンカテゴリでは、位置情報拡張が顕著に大きな向上をもたらすことがあるか?
  • RQ5位置チャネルを追加する計算コストは何か?また、より深いネットワークでもそのコストは無視できる程度に保たれるか?

主な発見

  • Cityscapesのシーンパースィングベンチマークにおいて、距離変換による拡張(RGB+dist)は、RGBのみの入力と比較してmIoUを3.3%向上させた。
  • 距離変換手法は、多くの場合、直接座標符号化(RGB+coord)を上回った。これは、パラメータ数が少なく、十分な空間不変性を有しているためと推定される。
  • PASCAL-Sでは、最良の設定(RGB+dist+coord)が、RGBのみの入力と比較してF-measureで5.2%の向上を達成した。
  • 航空機と鳥のクラスでは、それぞれ8.5%およびほぼ5%の大きな向上が見られた。これは、これらのオブジェクトが通常画像の上半分に位置するためと推定される。
  • バスのクラスでは、位置情報拡張による向上が観察されなかった。これは、データセット内での配置が車と比べてよりランダムであるためと推定される。
  • より深いネットワークでは位置情報拡張の効果が相対的に弱まるものの、依然として顕著な性能向上が得られ、計算オーバーヘッドは最小限に抑えられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。