Skip to main content
QUICK REVIEW

[論文レビュー] DSAL-GAN: Denoising based Saliency Prediction with Generative Adversarial Networks

Prerana Mukherjee, Manoj Sharma|arXiv (Cornell University)|Apr 2, 2019
Visual Attention and Saliency Detection参考文献 10被引用数 7
ひとこと要約

DSAL-GAN は、2つの結合された GAN を用いて、画像のノイズ除去とサリエンシー予測を同時に実行するエンドツーエンドの生成的対抗ネットワークフレームワークを提案する。ノイズが強い画像において、SOTA の性能を達成し、ノイズ分散 σ=50 の条件下で Sal-GAN や Deep Saliency と比較して平均 F-スコアを最大16%向上させ、MAE を 47% 減少させた。

ABSTRACT

Synthesizing high quality saliency maps from noisy images is a challenging problem in computer vision and has many practical applications. Samples generated by existing techniques for saliency detection cannot handle the noise perturbations smoothly and fail to delineate the salient objects present in the given scene. In this paper, we present a novel end-to-end coupled Denoising based Saliency Prediction with Generative Adversarial Network (DSAL-GAN) framework to address the problem of salient object detection in noisy images. DSAL-GAN consists of two generative adversarial-networks (GAN) trained end-to-end to perform denoising and saliency prediction altogether in a holistic manner. The first GAN consists of a generator which denoises the noisy input image, and in the discriminator counterpart we check whether the output is a denoised image or ground truth original image. The second GAN predicts the saliency maps from raw pixels of the input denoised image using a data-driven metric based on saliency prediction method with adversarial loss. Cycle consistency loss is also incorporated to further improve salient region prediction. We demonstrate with comprehensive evaluation that the proposed framework outperforms several baseline saliency models on various performance benchmarks.

研究の動機と目的

  • 既存の手法がノイズの誤分類により失敗するノイズのある画像における顕著オブジェクト検出の課題に対処すること。
  • ノイズ除去とサリエンシー予測を統合的に最適化するための包括的なディープラーニングフレームワークの開発。
  • 敵対的学習とサイクル整合性損失を用いて、ノイズ環境下でのサリエンシー地図の品質を向上させること。
  • 合成ノイズを含むベンチマークデータセットにおいて、SOTA のサリエンシー検出モデルを上回る優れた性能を示すこと。

提案手法

  • フレームワークは2つの結合された GAN を採用する。1つ目の GAN は、スキップ接続を備えた生成器を用いて入力画像のノイズ除去を行い、ノイズ除去済み画像と正解画像を区別する識別器を備える。
  • 2つ目の GAN は、U-Net を模したエンコーダ・デコーダ型の生成器を用いて、ノイズ除去済み画像からサリエンシー地図を予測し、予測された地図と正解地図を区別する識別器を備える。
  • 両 GAN の学習には、コンテンツ損失(L2)と敵対的損失が用いられ、ピクセル単位の忠実性と現実的な出力分布を確保する。
  • サリエンシー予測ブランチにサイクル整合性損失が導入され、構造的整合性の向上とサリエンシー地図の境界の洗練が図られる。
  • ノイズ除去ネットワークおよびサリエンシーネットワークの事前学習重みを用いて、両ネットワークをエンドツーエンドで統合的に最適化する。
  • モデルは、ガウスノイズ(σ ∈ [10, 30, 50, 80])を含む MSRA-10k、ECSSD、SOD データセットの合成ノイズ版で評価される。

実験結果

リサーチクエスチョン

  • RQ1統合された GAN フレームワークは、ノイズのある入力に対して、画像のノイズ除去とサリエンシー予測を同時に最適化し、耐性を高めることができるか?
  • RQ2サイクル整合性損失の統合は、ノイズのある画像環境下でのサリエンシー地図品質にどのように影響を与えるか?
  • RQ3二重識別器を用いた敵対的学習は、標準的なサリエンシー検出モデルと比較して、ノイズのあるデータに対して性能をどの程度向上させるか?
  • RQ4ノイズ分散が増加するに従って性能はどのように低下するか?また、DSAL-GAN は高ノイズレベル下でも高い精度を維持できるか?
  • RQ5エンドツーエンドでの統合学習は、ノイズ除去とサリエンシーネットワークを逐次的または独立して学習するのと比較して優れているか?

主な発見

  • MSRA-10k データセットにおいて、ノイズ分散 σ=50 の条件下で、DSAL-GAN は Deep Saliency と比較して最大 F-スコア(maxF)を 16% 向上させ、平均平均誤差(MAE)を 47% 減少させた。
  • 同じデータセットにおいて、DSAL-GAN は平均 F-スコア(aveF)を 16%、AUC を 21% それぞれ向上させ、ピクセル単位の分類精度が優れていることを示した。
  • σ=50 の条件下で、DSAL-GAN は MSRA-10k で AUC 0.9012 を達成し、Sal-GAN(0.8221)や Deep Saliency(0.6523)を大きく上回った。σ=80 でも AUC が 0.4512 に低下するにとどまり、安定性が保たれた。
  • サイクル整合性損失の導入により、特にオブジェクトの境界を保全し、誤検出を低減する点で、サリエンシー地図の品質に顕著な向上が見られた。
  • ノイズ分散の増加に伴う性能低下は観察されたが、DSAL-GAN はベースラインと比較して相対的に高い AUC(ECSSD では σ=50 時に 0.8503)を維持しており、耐性があることが示された。
  • DSAL-GAN は、MSRA-10k、ECSSD、SOD というすべてのベンチマークデータセットで一貫した向上を示し、多様な画像分布への汎用性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。