Skip to main content
QUICK REVIEW

[論文レビュー] Deep Hashing with Category Mask for Fast Video Retrieval

Xu Liu, Lili Zhao|arXiv (Cornell University)|Dec 22, 2017
Advanced Image and Video Retrieval Techniques参考文献 38被引用数 10
ひとこと要約

本稿では、分類損失によるクラス間多様性とクラス内ペア損失によるクラス内同一性を最適化することで、ビデオ表現とバイナリコードを同時に学習する、カテゴリーマスクを備えたエンドツーエンドのディープビデアハッシュフレームワーク(DVHCM)を提案する。主な革新点は、各カテゴリごとに効果のないハッシュビットをフィルタリングするカテゴリーマスク機構であり、UCF101およびHMDB51データセットにおいて、最先端の手法を上回る顕著な検索精度の向上を実現している。

ABSTRACT

This paper proposes an end-to-end deep hashing framework with category mask for fast video retrieval. We train our network in a supervised way by fully exploiting inter-class diversity and intra-class identity. Classification loss is optimized to maximize inter-class diversity, while intra-pair is introduced to learn representative intra-class identity. We investigate the binary bits distribution related to categories and find out that the effectiveness of binary bits is highly correlated with data categories, and some bits may degrade classification performance of some categories. We then design hash code generation scheme with category mask to filter out bits with negative contribution. Experimental results demonstrate the proposed method outperforms several state-of-the-arts under various evaluation metrics on public datasets.

研究の動機と目的

  • 大規模なビデオデータベースにおける効率的かつ正確なビデオ検索の課題に対処すること。
  • クラス間多様性とクラス内同一性を同時に最適化することで、ディープビデアハッシュの性能を向上させること。
  • ハッシュビットの有効性とデータカテゴリとの相関関係を調査すること。
  • 低寄与度のビットをフィルタリングするカテゴリーマスク機構を設計し、検索性能を向上させること。

提案手法

  • フレームワークは、エンドツーエンドのディープニューラルネットワークを用いて、同時にビデオ特徴量とバイナリコードを学習する。
  • 分類損失を用いてクラス間の分離を最大化し、クラス内ペア損失を用いてクラス内類似性を保持する。
  • ハッシュビットのカテゴリごとの分布を分析し、特定のクラスにおいて性能を低下させるビットを同定する。
  • カテゴリマスクを導入し、コード生成時に各カテゴリごとに負の寄与を持つビットを動的に抑制する。
  • 分類損失とクラス内ペア損失の両方の監督信号を用いて、教師あり学習でモデルを訓練する。
  • 最終的なハッシュコードは、学習済みのカテゴリーマスクを生のバイナリコードに適用することで生成される。

実験結果

リサーチクエスチョン

  • RQ1個々のハッシュビットの有効性は、異なるビデオカテゴリによってどのように変化するか?
  • RQ2各カテゴリごとに低寄与度のビットを除外することで、ビデオ検索精度が向上するか?
  • RQ3クラス内同一性とクラス間多様性が、ディープビデアハッシュ性能に与える影響をどのように連携して作用するか?
  • RQ4カテゴリに適応したビット選択機構は、標準的なハッシュ手法を上回る性能を発揮できるか?

主な発見

  • 提案手法のDVHCMは、UCF101で512ビットにおいて95.3%のmAPを達成し、最良のベースライン(DNNH)を16.1%上回った。
  • HMDB51では、512ビットで67.2%のmAPを達成し、最良のベースラインを19.2%上回った。
  • カテゴリーマスクを除去すると顕著な性能低下が発生し、その有効性が確認された。
  • 両データセットの全ビット長(64〜512ビット)において、DVHCMはディープおよび非ディープのベースラインをすべて上回った。
  • 精度-再現率曲線および精度曲線から、特に低ビット長においてDVHCMが一貫して優れた性能を示した。
  • アブレーションスタディにより、クラス内ペア損失が性能向上に寄与することが確認され、特に特徴類似度が高い短時間動画において顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。