Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Hashing with Contrastive Information Bottleneck

Zexuan Qiu, Qinliang Su|arXiv (Cornell University)|May 13, 2021
Advanced Image and Video Retrieval Techniques参考文献 31被引用数 7
ひとこと要約

本稿では、エンドツーエンド学習を可能にする確率的ベルヌーイ表現層を導入することで、対照的学習をバイナリコード学習に適応する新規な非教師ありハッシング手法CIBHashを提案する。情報ボトルネック原理の枠組みでこの手法を定式化することにより、意味的表現学習が向上し、3つのベンチマークデータセットで最先端性能を達成し、従来手法比で最大7.8%の向上を達成した。

ABSTRACT

Many unsupervised hashing methods are implicitly established on the idea of reconstructing the input data, which basically encourages the hashing codes to retain as much information of original data as possible. However, this requirement may force the models spending lots of their effort on reconstructing the unuseful background information, while ignoring to preserve the discriminative semantic information that is more important for the hashing task. To tackle this problem, inspired by the recent success of contrastive learning in learning continuous representations, we propose to adapt this framework to learn binary hashing codes. Specifically, we first propose to modify the objective function to meet the specific requirement of hashing and then introduce a probabilistic binary representation layer into the model to facilitate end-to-end training of the entire model. We further prove the strong connection between the proposed contrastive-learning-based hashing method and the mutual information, and show that the proposed model can be considered under the broader framework of the information bottleneck (IB). Under this perspective, a more general hashing model is naturally obtained. Extensive experimental results on three benchmark image datasets demonstrate that the proposed hashing method significantly outperforms existing baselines.

研究の動機と目的

  • 再構成に基づく非教師ありハッシング手法の限界、すなわち非特徴的背景特徴に過剰適合する問題に対処すること。
  • 連続的表現学習で成功を収めた対照的学習を、離散的バイナリハッシングタスクに適応すること。
  • 微分可能な確率的バイナリ表現層の導入により、バイナリハッシングモデルのエンドツーエンド学習を可能にすること。
  • ハッシングの文脈において、対照的学習と情報ボトルネック原理との間の理論的関係を確立すること。
  • 入力データの再構成ではなく、特徴的意味的情報を保持することに焦点を当てることで、検索性能を向上させること。

提案手法

  • ハッシングコードの離散的性質に適合させるために、対照的学習の目的関数を修正し、目的関数の不一致を低減するため、プロジェクションヘッドを削除する。
  • バイナリコードを確率的変数としてモデル化するための確率的ベルヌーイ層を導入し、勾配推定器を介して離散出力の逆伝播を可能にする。
  • 情報ボトルネックフレームワークの下で対照的学習目的関数を再定式化し、コードと入力データ間の相互情報量と対照的損失を同時に最小化する。
  • 表現品質と圧縮のトレードオフをバランスさせるためにラグランジュ緩和を用い、ハイパーパrameter β がこのトレードオフを制御する。
  • データオーグメンテーションを用いて対照的学習のポジティブペアを生成し、モデルが不変な意味的特徴を学習できるようにする。
  • 最近の離散潜在変数の勾配推定の進展を活用して、確率的最適化を用いてモデル全体をエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1再構成に依存せずに、対照的学習を高品質なバイナリハッシングコードの学習に効果的に適応できるか?
  • RQ2対照的学習フレームワークにおいて、離散的バイナリコードのエンドツーエンド学習をどのように達成できるか?
  • RQ3ハッシングの文脈において、対照的学習と情報ボトルネック原理との間の理論的関係は何か?
  • RQ4再構成に基づく目的関数を対照的目的関数に置き換えることで、非教師ありハッシングにおける意味的表現学習が向上するか?
  • RQ5β やバッチサイズといった主要なハイパーパrameter が、提案手法の性能にどのように影響するか?

主な発見

  • CIFAR-10において、16ビットから64ビットのコード長の範囲で、最良のベースライン(TBH)比で平均5.7%の向上を達成した。
  • NUS-WIDEでは、最先端手法比で平均7.8%の向上を達成し、特に短いコード長でより大きな向上を示した。
  • MSCOCOでは、現在の最先端手法比で平均3.6%の向上を達成した。
  • エンドツーエンド学習と確率的バイナリ層を用いた変種であるCLHashは、対照的特徴の単純なバイナリ化と比較して、CIFAR-10で5.2%の性能向上を示した。
  • CIFAR-10ではCLHashより0.8%、MSCOCOでは1.0%の向上を達成し、IBフレームワークの統合による利点を確認した。
  • β のバランスの取れた値でモデルの性能が最も良くなる。β が小さすぎたり大きすぎたりすると性能が低下し、表現品質と圧縮の間の重要なトレードオフが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。