Skip to main content
QUICK REVIEW

[論文レビュー] CIMON: Towards High-quality Hash Codes

Xiao Luo, Daqing Wu|arXiv (Cornell University)|Oct 15, 2020
Advanced Image and Video Retrieval Techniques参考文献 29被引用数 7
ひとこと要約

CIMONは、信頼性の高い意味的ガイダンスを提供するため、グローバルなリファインメントと信頼度に応じた類似度重み付けを組み合わせた、画期的な非教師ありハッシング手法を提案する。さらに、意味的および対照的(contrastive)な二重一貫性学習フレームワークを採用することで、モデルの頑健性と識別能を向上させる。CIFAR-10、NUS-WIDE、MS-COCOのベンチマークデータセットにおいて、優れたリtrieval精度とノイズ耐性を達成し、最先端の性能を実現した。

ABSTRACT

Recently, hashing is widely used in approximate nearest neighbor search for its storage and computational efficiency. Most of the unsupervised hashing methods learn to map images into semantic similarity-preserving hash codes by constructing local semantic similarity structure from the pre-trained model as the guiding information, i.e., treating each point pair similar if their distance is small in feature space. However, due to the inefficient representation ability of the pre-trained model, many false positives and negatives in local semantic similarity will be introduced and lead to error propagation during the hash code learning. Moreover, few of the methods consider the robustness of models, which will cause instability of hash codes to disturbance. In this paper, we propose a new method named { extbf{C}}omprehensive s{ extbf{I}}milarity { extbf{M}}ining and c{ extbf{O}}nsistency lear{ extbf{N}}ing (CIMON). First, we use global refinement and similarity statistical distribution to obtain reliable and smooth guidance. Second, both semantic and contrastive consistency learning are introduced to derive both disturb-invariant and discriminative hash codes. Extensive experiments on several benchmark datasets show that the proposed method outperforms a wide range of state-of-the-art methods in both retrieval performance and robustness.

研究の動機と目的

  • 事前学習済みモデルの表現能力が限られている場合に生じる、非教師ありハッシングにおけるノイズが多く信頼性の低い局所的類似度構造の問題を解決すること。
  • 類似度行列内の誤った正例および負例を精緻化することで、ハッシュコード学習中の誤差伝搬を低減すること。
  • 画像変換やノイズに対して安定したハッシュコードを学習することで、モデルの頑健性を向上させること。
  • 意味的および対照的一致性学習を統合することで、ハッシュコードの識別力を向上させること。
  • ビット容量を十分に活用し、均一に分布し、情報量の多い高品質な2値コードを生成すること。

提案手法

  • CIMONは、異なるクラスに属する境界領域の点同士の誤った類似度信号を補正するため、グローバルリファインメントを適用し、初期類似度グラフの信頼性を向上させる。
  • 類似度の統計的分布を用いた信頼度ベースの重み付けを導入することで、不確実なペairの影響を低減し、類似度行列を滑らかにする。
  • データオーグメンテーションを用いて各画像から2つのビューを生成し、ビュー間で並列的かつ相互に意味的一致性学習を実現する。
  • 深層特徴の間の意味的一致性(augmented views間)とハッシュコード間の対照的一致性(augmented views間)を強制する、新規の一貫性損失を設計する。
  • 類似度保持と対照的学習を統合した損失関数により、識別力と頑健性に優れたハッシュコードを生成する。
  • 精緻化された類似度ガイダンスと一貫性学習目的関数を組み合わせたハイブリッド損失を用いて、エンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1表現能力が限られた事前学習済みモデルを用いた非教師ありハッシングにおいて、初期類似度構造の信頼性をどのように向上させられるか?
  • RQ2類似度ペアに対する信頼度に応じた重み付けは、ハッシュコード学習中の誤差伝搬をどの程度低減できるか?
  • RQ3意味的および対照的一致性学習を併用することで、画像の摂動や変換に対してハッシュコードの頑健性が向上するか?
  • RQ4ノイズ下での安定性とリtrieval精度の面で、提案手法は最先端の非教師ありハッシング手法と比較してどのように差をつけるか?
  • RQ5提案手法は、ハッシュコードの分布におけるビット利用効率と均一性を向上させているか?

主な発見

  • CIFAR-10において128ビットでmAPが0.4981に達し、最良のベースライン(0.4506)を顕著に上回り、新たなSOTAを樹立した。
  • NUS-WIDEおよびMS-COCOにおいて、全ビット長においてSOTAのmAPを達成し、一貫した優位性を示した。
  • クエリ画像にノイズを追加した後、CIMONのmAPは僅か0.012の低下にとどまる一方、ベースラインのMLS 3 RUDHは0.048の低下を示し、より優れた頑健性を示した。
  • ノイズ下でのハッシュコードのビット変更数は、CIMONが平均約1.5と著しく少なく、MLS 3 RUDHの平均約3.5より顕著に低いことから、高い摂動不変性を示した。
  • CIMONのハッシュビット分布は均一分布に近づき、ビット容量の効果的活用と冗長性の低減を裏付けた。
  • アブレーションスタディの結果、グローバルリファインメント、信頼度重み付け、意味的一致性、対照的一致性の各モジュールが性能向上に段階的に寄与しており、完全なモデルが最良の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。