Skip to main content
QUICK REVIEW

[論文レビュー] A Fast and Compact Saliency Score Regression Network Based on Fully Convolutional Network

Xuanyang Xi, Yongkang Luo|arXiv (Cornell University)|Feb 2, 2017
Visual Attention and Saliency Detection参考文献 4被引用数 6
ひとこと要約

この論文は、事前処理や後処理を一切行わずに、リアルタイムで高解像度の凝集的サリエンシーマップを直接予測できる、高速でコン act な完全畳み込みネットワーク(FCN)ベースのサリエンシースコア回帰モデルを提案する。VGG-16の全結合層を完全畳み込み層に置き換え、独自の損失関数を用いることで、35 FPS の高速な処理速度を達成し、従来の深層学習手法に比べて顕著に高速でありながら高い精度を維持する。

ABSTRACT

Visual saliency detection aims at identifying the most visually distinctive parts in an image, and serves as a pre-processing step for a variety of computer vision and image processing tasks. To this end, the saliency detection procedure must be as fast and compact as possible and optimally processes input images in a real time manner. It is an essential application requirement for the saliency detection task. However, contemporary detection methods often utilize some complicated procedures to pursue feeble improvements on the detection precession, which always take hundreds of milliseconds and make them not easy to be applied practically. In this paper, we tackle this problem by proposing a fast and compact saliency score regression network which employs fully convolutional network, a special deep convolutional neural network, to estimate the saliency of objects in images. It is an extremely simplified end-to-end deep neural network without any pre-processings and post-processings. When given an image, the network can directly predict a dense full-resolution saliency map (image-to-image prediction). It works like a compact pipeline which effectively simplifies the detection procedure. Our method is evaluated on six public datasets, and experimental results show that it can achieve comparable or better precision performance than the state-of-the-art methods while get a significant improvement in detection speed (35 FPS, processing in real time).

研究の動機と目的

  • 複雑なシーンにおけるリアルタイムで効率的なサリエンシー検出手法の不足を解消すること。
  • 深層学習ベースのサリエンシー モデルで一般的な時間のかかる事前処理および後処理ステップを排除すること。
  • フル解像度入力を直接処理し、凝集的サリエンシーマップを直接回帰するエンドツーエンドの単一段階ネットワークを開発すること。
  • 実用的展開を考慮し、高精度と最小限のモデルサイズ、高速な推論速度のバランスを取ること。
  • FCNフレームワークにおけるサリエンシースコア回帰に特化した新しい損失関数の有効性を検証すること。

提案手法

  • 全結合層を完全畳み込み層に置き換えた変更版 VGG-16 ネットワークを用い、エンドツーエンドでフル解像度出力を可能にする。
  • 自然な視覚的情報を保持するために、ダウンスケーリングを避けるために単一のフル解像度入力を使用する。
  • 特徴マップを元の画像サイズにアップサンプリングするためにバイキュービック補間層を用い、空間解像度を維持する。
  • ピクセル単位の正確なサリエンシースコア回帰を促進するために、独自の損失関数を設計する。
  • スーパーピクセルや領域レベル、CRFベースの後処理を一切行わず、エンドツーエンドで学習する。
  • 速度とコンパクト性を向上させるために、マルチスケール入力や局所的・グローバル特徴の統合を削除することでアーキテクチャを簡素化する。

実験結果

リサーチクエスチョン

  • RQ1完全畳み込みネットワークは、事前・事後処理を一切行わず、高精度なサリエンシー検出を達成できるか?
  • RQ2提案された損失関数は、標準的な損失関数(ユークリッド距離や交差エントロピー)と比較して、サリエンシー回帰においてどのように性能を発揮するか?
  • RQ3アーキテクチャの簡素化(例:マルチスケール入力の削除)が、速度と精度に与える影響は何か?
  • RQ4コンパクトでリアルタイムなサリエンシー検出モデルは、ベンチマークデータセットで競争力のある性能を維持できるか?
  • RQ5実用的展開環境において、モデルの推論速度は、最先端の手法と比較してどの程度優れているか?

主な発見

  • 提案手法は 35 FPS の推論速度を達成し、1 イメージあたり 100 ms を超えることが一般的な従来の深層学習ベースの手法に比べ顕著に高速である。
  • 6つの公開データセットにおいて、AUC、F-measure、MAE の指標で、最先端の手法と同等またはそれ以上の性能を達成した。
  • モデルサイズはたったの 81.9 MB であり、リソース制限のあるデバイスへの展開に非常に適している。
  • 制御実験の結果、提案された損失関数が、すべての評価指標でユークリッド距離損失および交差エントロピー損失を上回ることが示された。
  • CRF などの複雑な後処理を用いなくても、高い精度を維持でき、これは先行研究で一般的に性能向上に用いられる手法である。
  • アブレーションスタディにより、マルチスケール入力の削除や局所的・グローバル特徴の統合の削除といったアーキテクチャの簡素化が、精度の最小限の損失で著しい速度向上をもたらすことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。