[論文レビュー] Unsupervised Generative Adversarial Cross-modal Hashing
本稿では、教師なしの生成的対抗的クロスマodalハッシング(UGACH)を提案する。これは、教師データを必要とせず、対抗的学習と相関グラフを用いてクロスマodalデータの多様体構造をモデル化する、GANベースの新規なアプローチである。UGACHは、NUS-WIDEおよびMIRFlickrデータセットにおいて、教師ありおよび教師なしの手法を凌駕する最先端のリtrieval精度を達成しており、MAPスコアはそれぞれ0.624および0.625を記録した。
Cross-modal hashing aims to map heterogeneous multimedia data into a common Hamming space, which can realize fast and flexible retrieval across different modalities. Unsupervised cross-modal hashing is more flexible and applicable than supervised methods, since no intensive labeling work is involved. However, existing unsupervised methods learn hashing functions by preserving inter and intra correlations, while ignoring the underlying manifold structure across different modalities, which is extremely helpful to capture meaningful nearest neighbors of different modalities for cross-modal retrieval. To address the above problem, in this paper we propose an Unsupervised Generative Adversarial Cross-modal Hashing approach (UGACH), which makes full use of GAN's ability for unsupervised representation learning to exploit the underlying manifold structure of cross-modal data. The main contributions can be summarized as follows: (1) We propose a generative adversarial network to model cross-modal hashing in an unsupervised fashion. In the proposed UGACH, given a data of one modality, the generative model tries to fit the distribution over the manifold structure, and select informative data of another modality to challenge the discriminative model. The discriminative model learns to distinguish the generated data and the true positive data sampled from correlation graph to achieve better retrieval accuracy. These two models are trained in an adversarial way to improve each other and promote hashing function learning. (2) We propose a correlation graph based approach to capture the underlying manifold structure across different modalities, so that data of different modalities but within the same manifold can have smaller Hamming distance and promote retrieval accuracy. Extensive experiments compared with 6 state-of-the-art methods verify the effectiveness of our proposed approach.
研究の動機と目的
- 既存の教師なしクロスマodalハッシング手法がモダリティ間の潜在的多様体構造を無視するという限界を是正すること。
- 生成的対抗的ネットワーク(GAN)を活用して教師なし表現学習を実現し、クロスマodalデータの関係性をより良く捉えること。
- 共通のハミング距離空間において、モダリティ間相関と多様体内近接性の両方をモデル化することで、リtrieval精度を向上させること。
- 高価な人手による意味的ラベルの必要性を排除しつつ、教師あり手法と同等の性能を達成すること。
提案手法
- 生成器は一方のモダリティの多様体分布に適合し、もう一方のモダリティから情報を豊富に含むサンプルを生成することで、識別器を挑戦させるように設計された生成的対抗的ネットワークを構築する。
- 識別器は、相関グラフから得た実データと生成データを区別するように学習され、意味的なモダリティ間および多様体内相関を保持する能力が向上する。
- 異なるモダリティ間の潜在的多様体構造を符号化するために、相関グラフが構築され、意味的に類似したクロスマodalデータ同士がより小さいハミング距離を持つように保証される。
- 生成器と識別器が対抗的学習により共同で最適化され、ハッシング関数の学習とリtrieval性能の向上が図られる。
- 両モダリティ固有の特徴量が共通のバイナリコード空間に投影される共有埋め込み空間が使用され、効率的なハミング距離計算が可能になる。
- 学習率の徐々な減少戦略を用い、確率的勾配降下法で最適化されるエンドツーエンドの学習が実施される。
実験結果
リサーチクエスチョン
- RQ1対抗的学習は、教師なし設定下でクロスマodalデータの多様体構造を効果的にモデル化できるか?
- RQ2相関グラフを用いて多様体構造を統合することで、クロスマodalリtrieval精度はどのように向上するか?
- RQ3GANベースの教師なし手法は、ラベル付きデータを一切必要とせず、教師あり手法と同等またはそれ以上の性能を達成できるか?
- RQ4提案手法は、ベンチマークデータセットにおいて、既存の教師なしクロスマodalハッシング技術をどの程度上回るか?
主な発見
- NUS-WIDEデータセットにおいて、UGACHは画像からテキストへのタスクで最高の平均平均精度(MAP)0.624を達成し、テキストから画像へのタスクでは0.625を記録した。
- MIRFlickrデータセットでは、UGACHはすべての評価指標において、比較された教師なしおよび教師あり手法を上回る最先端の性能を達成した。
- NUS-WIDEの画像からテキストタスクにおいて、UGACHは最良の教師なし手法であるCCQを0.119上回り、テキストから画像タスクでは0.131上回った。
- 教師あり手法であるSCM_seqと比較すると、画像からテキストタスクで平均MAPが0.107向上し、テキストから画像タスクでも0.109向上した。
- アブレーションスタディの結果、GANコンポonentと相関グラフの両方が顕著な寄与を示しており、NUS-WIDEにおいてベースラインGANからそれぞれ0.037および0.034の向上が得られた。
- トップ-K精度および精度-再現率曲線から、UGACHは両データセットのすべてのK値および再現率レベルにおいて、すべてのベースラインを一貫して上回ることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。