Skip to main content
QUICK REVIEW

[論文レビュー] Deep Cross-Modal Hashing with Hashing Functions and Unified Hash Codes Jointly Learning

Rong-Cheng Tu, Xian-Ling Mao|arXiv (Cornell University)|Jul 29, 2019
Advanced Image and Video Retrieval Techniques参考文献 39被引用数 5
ひとこと要約

本稿では、データベースの画像-テキストペアのための統一ハッシュコードと未学習クエリのためのモダリティ固有ハッシュ関数を同時に学習する、エンドツーエンドの深層クロスマodalハッシング手法DCHUCを提案する。両者を相互にフィードバックしながら反復的に最適化することで、3つの公開データセットにおいて、トレーニングが高速でハイパーパramータの選択に強く、最先端の検索性能を達成する。

ABSTRACT

Due to their high retrieval efficiency and low storage cost, cross-modal hashing methods have attracted considerable attention. Generally, compared with shallow cross-modal hashing methods, deep cross-modal hashing methods can achieve a more satisfactory performance by integrating feature learning and hash codes optimizing into a same framework. However, most existing deep cross-modal hashing methods either cannot learn a unified hash code for the two correlated data-points of different modalities in a database instance or cannot guide the learning of unified hash codes by the feedback of hashing function learning procedure, to enhance the retrieval accuracy. To address the issues above, in this paper, we propose a novel end-to-end Deep Cross-Modal Hashing with Hashing Functions and Unified Hash Codes Jointly Learning (DCHUC). Specifically, by an iterative optimization algorithm, DCHUC jointly learns unified hash codes for image-text pairs in a database and a pair of hash functions for unseen query image-text pairs. With the iterative optimization algorithm, the learned unified hash codes can be used to guide the hashing function learning procedure; Meanwhile, the learned hashing functions can feedback to guide the unified hash codes optimizing procedure. Extensive experiments on three public datasets demonstrate that the proposed method outperforms the state-of-the-art cross-modal hashing methods.

研究の動機と目的

  • データベース内の関連する画像-テキストペアに対して、統一ハッシュコードを学習できないという、従来の深層クロスマodalハッシング手法の限界を解消する。
  • 従来手法が統一ハッシュコード学習とハッシュ関数最適化の間で双方向フィードバックを欠いているという点を克服する。
  • 統一ハッシュコードとモダリティ固有ハッシュ関数を同時に最適化するエンドツーエンドフレームワークを構築し、検索精度を向上させる。
  • ADSHにインspiredされた非対称サンプリングスキームを用いて、大規模データベースにおけるトレーニングの時間計算量を低減する。
  • 主要パラメータに関する広範な感度分析を通じて、ハイパーパramータの変動に強く、安定した性能を発揮することを保証する。

提案手法

  • データベースインスタンスのための統一ハッシュコードと未学習クエリのためのハッシュ関数を、交互に改善する反復的最適化アルゴリズムを提案する。
  • ハッシュ損失(相互および内部モダリティの類似性を保持)と分類損失(意味的識別性を向上)を組み合わせた共同目的関数を導入する。
  • 非対称サンプリング戦略を採用:n個のデータベースインスタンスからm個のアンカーインスタンスを抽出(m ≪ n)することで、トレーニングの計算量をO(mn)に低減する。
  • 非対称アフィニティ行列を構築し、ハッシュ関数学習と統一ハッシュコード最適化の両方を同時に監視する。
  • 統一ハッシュコードがハッシュ関数学習をガイドし、ハッシュ関数が逆に統一コードの最適化にフィードバックするエンドツーエンドのトレーニングパイプラインを実装する。
  • ネットワーク全体にバックプロパゲーションを適用し、1つのフレームワーク内ですべてのパラメータを同時に最適化する。

実験結果

リサーチクエスチョン

  • RQ1データベース内の画像-テキストペアに対して、エンドツーエンドの深層ハッシングフレームワークで統一ハッシュコードを効果的に学習できるか?
  • RQ2学習済みハッシュ関数からのフィードバックが、統一ハッシュコード最適化の品質を向上させるか?
  • RQ3提案手法は、最先端のクロスマodalハッシングベースラインを上回る高い検索精度を達成できるか?
  • RQ4非対称サンプリングスキームは、検索性能を損なわせることなく、トレーニング効率をどのように向上させるか?
  • RQ5実際の応用において、提案手法はハイパーパramータの設定にどれほど感度を示すか?

主な発見

  • DCHUCは3つの公開データセット(MIRFLICKR-25K, IAPR TC-12, NUS-WIDE)で最先端の性能を達成し、I2TおよびT2Iの両検索タスクにおいて、既存手法を上回った。
  • NUS-WIDEデータセットでは、SOTA手法であるSSAHを上回る検索性能を示し、特に平均平均精度(MAP)の観点で顕著な優位性を示した。
  • 目的関数は10イテレーション以内に収束し、I→TおよびT→Iの両検索タスクにおけるMAP値が、目的関数値の減少に伴い安定的に向上した。
  • SSAHやDCMHと比較して、DCHUCは著しく高速にトレーニングが完了し、IAPR TC-12, MIRFLICKR-25K, NUS-WIDE(32ビットコード)では、それぞれ11.8秒、12.9秒、28.2秒のトレーニング時間を記録した(CMDVHは16.3秒、21.2秒、39.2秒)。
  • ハイパーパramータの変動に強く、α, γ, η(1–600)、β(10⁻³–10)、μ(1–600)の広い範囲で安定したMAP値を維持し、高い性能を発揮した。
  • 精度-再現率解析において、DCHUCは高い再現率(例:0.9)でも高い精度を維持し、MIRFLICKR-25KおよびNUS-WIDEでベースラインを上回った。これは、ハミング空間内での類似ペアのコンパクト性が優れていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。