Skip to main content
QUICK REVIEW

[論文レビュー] Cross-convolutional-layer Pooling for Image Recognition

Lingqiao Liu, Chunhua Shen|arXiv (Cornell University)|Oct 4, 2015
Advanced Image and Video Retrieval Techniques参考文献 21被引用数 3
ひとこと要約

本稿では、2つの連続する畳み込み層からの活性化を活用して画像表現を抽出する新規手法、クロス畳み込み層プーリング(CCLP)を提案する。1つの層は局所的特徴抽出に、次の層はプーリングのガイド信号として機能する。特徴マップを用いた動的重み付けにより、一般化されたパーツベースプーリング機構の一部として局所的特徴を動的に重み付けすることで、画像分類およびリtrievalタスクにおける性能が向上し、標準的なプーリング法や既存のDCNNベースの記述子を上回る。

ABSTRACT

Recent studies have shown that a Deep Convolutional Neural Network (DCNN) pretrained on a large image dataset can be used as a universal image descriptor, and that doing so leads to impressive performance for a variety of image classification tasks. Most of these studies adopt activations from a single DCNN layer, usually the fully-connected layer, as the image representation. In this paper, we proposed a novel way to extract image representations from two consecutive convolutional layers: one layer is utilized for local feature extraction and the other serves as guidance to pool the extracted features. By taking different viewpoints of convolutional layers, we further develop two schemes to realize this idea. The first one directly uses convolutional layers from a DCNN. The second one applies the pretrained CNN on densely sampled image regions and treats the fully-connected activations of each image region as convolutional feature activations. We then train another convolutional layer on top of that as the pooling-guidance convolutional layer. By applying our method to three popular visual classification tasks, we find our first scheme tends to perform better on the applications which need strong discrimination on subtle object patterns within small regions while the latter excels in the cases that require discrimination on category-level patterns. Overall, the proposed method achieves superior performance over existing ways of extracting image representations from a DCNN.

研究の動機と目的

  • 事前学習済みDCNNにおいて、画像表現に単一の層(例えば、全結合層)しか使用しないという制限を解消すること。
  • 連続する畳み込み層における空間的および階層的パターンを活用することで、特徴の区別能を向上させること。
  • 特徴のバイナリゼーションと適応的チャネル選択を用いたクロス層プーリングにより、計算効率の良い画像リtrieval手法を開発すること。
  • 特徴の符号量子化によりメモリおよび計算コストを削減しながら、識別能を損なわずに済ませること。
  • 標準ベンチマーク上でのCCLPの優位性を、標準的なプーリング法および既存のDCNN記述子手法と比較して示すこと。

提案手法

  • 本手法は、より前の畳み込み層から局所的特徴を抽出し、その後続する畳み込み層の特徴マップをプーリングのガイド信号として用いる。
  • ガイド層の各フィルタの特徴マップは、空間的活性化に基づいて、前の層の局所的特徴に重みを割り当てるパーツ検出器として機能する。
  • 最終的な画像表現は、ガイド層の全フィルタ(チャネル)におけるプールド特徴を連結することで形成される。
  • 2つのバリエーションを提案する:1つは元の畳み込み層を用いるもの、もう1つは領域別全結合活性化を拡張された畳み込み層として扱うもの。
  • 画像リtrievalの応用では、特徴のバイナリゼーションを適用し、平均活性化に基づいて上位-kのプールングチャネルを選択することで計算コストを低減する。
  • 粗い特徴の符号量子化スキームを用いて、識別能を保持したまま表現を圧縮する。

実験結果

リサーチクエスチョン

  • RQ12つの連続する畳み込み層からの活性化を組み合わせることで、単一層記述子と比較して画像表現学習が向上するか?
  • RQ2後続層の特徴マップを動的プーリングのガイドとして用いることで、細分化認識およびカテゴリレベル認識における特徴の区別能が向上するか?
  • RQ3空間ピラミッドプーリングを用いた標準的なプーリング手法(例:max-pooling や sum-pooling)と比較して、クロス層プーリングはどのように性能を発揮するか?
  • RQ4バイナリゼーションと適応的チャネル選択を用いることで、性能を劣化させずに画像リtrievalにおける計算コストを低減できるか?
  • RQ5特徴の符号量子化は、圧縮表現においてどれほど性能を保持できるか?

主な発見

  • クロス層プーリングは、MIT67、Birds200、PASCAL07でそれぞれ74.4%、77.0%、84.1%の精度を達成し、テストされたすべての代替プーリング手法を上回った。
  • 画像リtrievalにおいて、k=50のプールングチャネルとバイナリゼーションを適用した手法は、[5]のベースライン手法を顕著に上回ったが、特に特徴が圧縮された状況で顕著であった。
  • 活性化が弱い低活性化プールングチャネルを多すぎると性能が低下したため、弱い検出器に起因するノイズが影響していた。
  • 特徴の符号量子化により、ほとんどすべての識別能が保持され、わずかな精度低下(例:MIT-67では77.9% vs. 78.2%)にとどまった。
  • 領域別全結合活性化を拡張された畳み込み層として扱う手法は、カテゴリレベル認識タスクにおいて優れた性能を示した。
  • 適応的チャネル選択とバイナリゼーションを組み合わせた本手法のリtrievalスキームは、妥当な計算コストで高い性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。