Skip to main content
QUICK REVIEW

[論文レビュー] Zero shot hashing

Shubham Pachori, Shanmuganathan Raman|arXiv (Cornell University)|Oct 9, 2016
Advanced Image and Video Retrieval Techniques参考文献 42被引用数 3
ひとこと要約

本論文は、教師なし学習として問題を定式化することにより、トレーニングデータに存在しない未学習オブジェクトクラスの画像に対して、補助信号としてのテキスト記述のみを用いてハッシュコードを生成するゼロショットハッシングフレームワークを提案する。これにより、トレーニング時にラベル付き例を必要とせず、未知クラスのラベルを高精度に予測することが可能になる。

ABSTRACT

This paper provides a framework to hash images containing instances of unknown object classes. In many object recognition problems, we might have access to huge amount of data. It may so happen that even this huge data doesn't cover the objects belonging to classes that we see in our day to day life. Zero shot learning exploits auxiliary information (also called as signatures) in order to predict the labels corresponding to unknown classes. In this work, we attempt to generate the hash codes for images belonging to unseen classes, information of which is available only through the textual corpus. We formulate this as an unsupervised hashing formulation as the exact labels are not available for the instances of unseen classes. We show that the proposed solution is able to generate hash codes which can predict labels corresponding to unseen classes with appreciably good precision.

研究の動機と目的

  • トレーニングデータに存在しない未知のオブジェクトクラスの画像をハッシングする課題に対処すること。
  • ゼロショットラベル予測における補助信号としてのテキスト記述を活用すること。
  • 未学習クラスのためのコン act なバイナリコードを生成する教師なしハッシングフレームワークを開発すること。
  • 単一の意味的情報のみを用いて、新規オブジェクトカテゴリに属する画像の正確な検索と分類を可能にすること。

提案手法

  • 未知クラスにラベルが存在しないことから、ゼロショット画像ハッシングを教師なし学習問題として定式化する。
  • 未学習クラスを表す署名としてテキスト埋め込みを用い、それらを共有埋め込み空間における画像特徴と整合させる。
  • 画像とテキスト埋め込み間の意味的類似性を保持するとともに、バイナリコード制約を強制するハッシング損失関数を設計する。
  • 深層ニューラルネットワークを用いて、統合された埋め込みとハッシング関数をエンドツーエンドで最適化する。
  • 類似した画像-テキストペアを引き寄せ、類似しないペアを遠ざける対照的学習戦略を採用する。
  • 見慣れたクラスでのみモデルを訓練し、未学習クラスへの推論をテキスト記述のみで可能にする。

実験結果

リサーチクエスチョン

  • RQ1トレーニング時にラベル付き例が一切ない状況でも、未知オブジェクトクラスの画像に対して効果的なハッシュコードを生成できるか?
  • RQ2見慣れたクラスで訓練されたハッシングモデルが、テキスト記述のみを用いて未学習クラスにどの程度一般化できるか?
  • RQ3テキスト署名の使用が、ハッシングにおけるゼロショットラベル予測の精度をどの程度向上させるか?
  • RQ4教師なしハッシングフレームワークは、ゼロショット一般化のための画像とテキスト表現間の意味的整合性をどの程度維持できるか?

主な発見

  • 提案手法は、テキスト情報のみを用いて、未学習オブジェクトクラスのラベル予測において顕著な高い精度を達成する。
  • フレームワークは、テキストからの意味的埋め込みを活用することで、未学習クラスの画像に対するハッシュコードを効果的に生成する。
  • アプローチの教師なし性質のおかげで、未学習クラスのラベル付きデータが不要な状況でも、効果的なゼロショット一般化が可能になる。
  • モデルは画像とテキスト表現間の意味的類似性を維持しており、これは正確なゼロショット予測にとって不可欠である。
  • 結果から、テキスト署名のみで、新規カテゴリのための意味のあるハッシュコードを生成できることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。