Skip to main content
QUICK REVIEW

[論文レビュー] Video Saliency Detection with Domain Adaptation using Hierarchical Gradient Reversal Layers.

Giovanni Bellitto, Federica Proietto Salanitri|arXiv (Cornell University)|Oct 2, 2020
Visual Attention and Saliency Detection参考文献 21被引用数 4
ひとこと要約

本論文は、階層的特徴とドメイン適応を用いた階層的勾配反転層によるマルチヘッド監視を施した3次元完全畳み込み型動画サリエンシー予測モデルを提案する。マルチスケール特徴と敵対的適応を活用することで、DHF1K、Hollywood2、UCF Sportsベンチマークにおいて教師あり設定で最先端の性能を達成し、教師なし設定でも競争力のある結果を示した。

ABSTRACT

In this work, we propose a 3D fully convolutional architecture for video saliency detection that employs multi-head supervision on intermediate maps (referred to as conspicuity maps) generated using features extracted at different abstraction level. More specifically, the model employs a single encoder and features extracted at different levels are then passed to multiple decoders aiming at predicting multiple saliency instances that are finally combined to obtain final output saliency maps. We also combine the hierarchical features extracted from the model's encoder with a domain adaptation approach based on gradient reversal at multiple scales in order to improve the generalization capabilities on datasets for which no annotations are provided during training. The results of our experiments on standard benchmarks, namely DHF1K, Hollywood2 and UCF Sports, show that the proposed model outperforms state-of-the-art methods on most metrics for supervised saliency prediction. Moreover, when tested in an unsupervised settings, it is able to obtain performance comparable to those achieved by supervised state-of-the-art methods.

研究の動機と目的

  • 異なる抽象レベルにおけるマルチレベル特徴の監視を用いて、動画サリエンシー検出性能を向上させること。
  • 階層的勾配反転を用いたドメイン適応により、アノテーションのないデータセットにおけるモデルの汎化性能を向上させること。
  • ターゲットドメインのアノテーションが入手不可であっても、教師ありおよび教師なしの両設定で優れた性能を達成すること。
  • マルチデコーダー監視と敵対的適応を統合した一貫性のあるアーキテクチャを設計し、サリエンシー予測の精度を向上させること。

提案手法

  • モデルは、複数の抽象レベルでの階層的特徴を抽出するための単一の3次元エンコーダを用いる。
  • 中間の顕著マップは、エンコーダの異なるレベルからの特徴を処理する複数のデコーダによって生成される。
  • これらの中間マップに対してマルチヘッド監視を適用し、特徴学習とサリエンシー予測の精度を向上させる。
  • 複数スケールにわたり階層的勾配反転層を適用し、ソースドメインとターゲットドメイン間の特徴分布を一致させる。
  • バックプロパゲーション中に勾配を反転させることでドメイン適応を実現し、ドメインシフトを最小化しながらタスク固有の特徴を保持する。
  • 全デコーダの予測を統合することで最終的なサリエンシー マップを取得し、空間的および時間的精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1単一出力モデルと比較して、階層的特徴におけるマルチヘッド監視は動画サリエンシー検出性能を向上させ得るか?
  • RQ2ゼロショット適応において、階層的勾配反転は動画サリエンシーのドメインシフトをどれほど効果的に低減できるか?
  • RQ3提案手法は、ターゲットドメインのアノテーションが入手不可な状況でも、競争力ある性能を達成できるか?
  • RQ4マルチスケール監視とドメイン適応の統合は、多様な動画データセット間での汎化性能をどの程度向上させるか?

主な発見

  • 提案手法は、DHF1K、Hollywood2、UCF Sportsを含む標準ベンチマークにおいて、教師あり学習設定で最先端の手法を上回った。
  • 教師なし設定でも、教師ありSOTA手法と同等の性能を達成し、強力なゼロショット汎化能力を示した。
  • 中間顕著マップに対するマルチヘッド監視の適用により、多様な動画コンテンツにおいてより正確で頑健なサリエンシー予測が可能になった。
  • 階層的勾配反転はドメイン適応を顕著に改善し、アノテーションのないデータセットでのテスト時における性能低下を著しく低減した。
  • マルチスケール特徴と敵対的適応の組み合わせにより、予測されたサリエンシー マップの空間的および時間的整合性が向上した。
  • スポーツやダイナミックなシーンを含む多様な動画カテゴリにおいても、強力な性能を維持したため、広範な適用可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。