Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Scale Context Extracted Hashing for Fine-Grained Image Binary Encoding

Xuetong Xue, Jiaying Shi|arXiv (Cornell University)|Oct 14, 2022
Advanced Image and Video Retrieval Techniques被引用数 5
ひとこと要約

本稿では、注意誘導型情報抽出(AIE)モジュールを備えた二重ブランチアーキテクチャを用いて、グローバルな意味的特徴とローカルな詳細を同時にモデル化することで、細分化画像検索を向上させる、新たな深層ハッシングフレームワークであるクロススケールコンテキスト抽出ハッシングネットワーク(CSCE-Net)を提案する。コンテンツに適応した動的符号関数(DSF)を導入することで、二値符号化過程における情報損失を低減し、ImageNet100およびMS COCOベンチマークで最先端の性能を達成した。

ABSTRACT

Deep hashing has been widely applied to large-scale image retrieval tasks owing to efficient computation and low storage cost by encoding high-dimensional image data into binary codes. Since binary codes do not contain as much information as float features, the essence of binary encoding is preserving the main context to guarantee retrieval quality. However, the existing hashing methods have great limitations on suppressing redundant background information and accurately encoding from Euclidean space to Hamming space by a simple sign function. In order to solve these problems, a Cross-Scale Context Extracted Hashing Network (CSCE-Net) is proposed in this paper. Firstly, we design a two-branch framework to capture fine-grained local information while maintaining high-level global semantic information. Besides, Attention guided Information Extraction module (AIE) is introduced between two branches, which suppresses areas of low context information cooperated with global sliding windows. Unlike previous methods, our CSCE-Net learns a content-related Dynamic Sign Function (DSF) to replace the original simple sign function. Therefore, the proposed CSCE-Net is context-sensitive and able to perform well on accurate image binary encoding. We further demonstrate that our CSCE-Net is superior to the existing hashing methods, which improves retrieval performance on standard benchmarks.

研究の動機と目的

  • 既存のハッシング手法が二値符号化の過程で冗長な背景を抑制できず、重要な意味的コンテンツを保持できないという制限を解消すること。
  • ハミング空間における特徴表現を強化することで、目立たないターゲットや複雑な背景を対象とした検索精度を向上させること。
  • 連続的特徴から二値コードへの符号関数変換過程における情報損失を低減すること。
  • コードのバランスと意味的忠実性を維持する、コンテキストに敏感で適応的な二値符号化メカニズムを開発すること。

提案手法

  • CSCE-Netは、グローバル意味的特徴と細分化されたローカル特徴を同時に抽出する二重ブランチネットワークを採用する。
  • 注意誘導型情報抽出(AIE)モジュールは、スライディングウィンドウを用いてローカル特徴をグローバルコンテキストに一致させ、情報量の少ない領域を抑制する。
  • AIEモジュールは多スケールグローバルコンテキストを用いてローカル特徴をフィルタリングおよび強化し、顕著なオブジェクト領域に注目する。
  • 標準の符号関数に代わって、エンドツーエンドで学習可能な動的符号関数(DSF)を導入し、コンテキストに適応した二値量子化を実現する。
  • モデルは、度量学習のためのCosFaceと、DSFを用いた量子化損失を組み合わせた損失関数で訓練される。これにより、クラス内コンパクト性が保持される。
  • フレームワークは、三重項ベースの対照的損失とコードバランス正則化の組み合わせにより最適化される。

実験結果

リサーチクエスチョン

  • RQ1深層ハッシングモデルは、冗長な背景を抑制しつつ、二値コード内に重要な意味的コンテンツをよりよく保持できるか?
  • RQ2学習可能な、コンテンツに適応した符号関数は、固定符号関数に比べて二値符号化の精度を向上させられるか?
  • RQ3注意に基づくフィルタリングを伴うクロススケール特徴統合は、細分化画像データセットにおける検索性能をどの程度向上させるか?
  • RQ4情報損失が最も顕著になる低ビット符号化(例:16ビット)においても、提案手法は優れた性能を維持できるか?

主な発見

  • ImageNet100では、16ビット、32ビット、64ビットコードに対してそれぞれmAP 0.869、0.887、0.897の最先端の性能を達成した。
  • MS COCOでは、16ビット、32ビット、64ビットコードに対してそれぞれmAP 0.807、0.852、0.888を達成し、先行手法を上回った。
  • AIEモジュールは、16ビットコードにおいてImageNet100でmAPを3%、MS COCOで7%向上させた。
  • 動的符号関数(DSF)は情報損失を低減し、標準の量子化損失と比較してmAPで0.007の向上を示した。
  • CosFace損失とDSFの組み合わせが最良の性能を発揮し、適応的量子化を用いた度量学習の有効性を裏付けた。
  • アブレーションスタディの結果、AIEは単純な連結や単一スケールスライディングウィンドウ手法に比べ、mAPで1〜3%の優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。