Skip to main content
QUICK REVIEW

[論文レビュー] Bio-Inspired Hashing for Unsupervised Similarity Search

Chaitanya K. Ryali, J. J. Hopfield|arXiv (Cornell University)|Jan 14, 2020
Advanced Image and Video Retrieval Techniques参考文献 54被引用数 7
ひとこと要約

本稿では、生物学的に妥当な学習ルールを用いてスパースで高次元のバイナリコードを生成するデータ駆動型で生物学的インスピレーションを受けて設計されたハッシュ化アルゴリズム、BioHashを提案する。この手法は、CIFAR-10 や MNIST といったベンチマークデータセットにおいて、従来の教師なしハッシュ化手法、特にディープラーニングベースの手法を上回り、特にコード長が短い場合に顕著な性能を発揮する。

ABSTRACT

The fruit fly Drosophila's olfactory circuit has inspired a new locality sensitive hashing (LSH) algorithm, FlyHash. In contrast with classical LSH algorithms that produce low dimensional hash codes, FlyHash produces sparse high-dimensional hash codes and has also been shown to have superior empirical performance compared to classical LSH algorithms in similarity search. However, FlyHash uses random projections and cannot learn from data. Building on inspiration from FlyHash and the ubiquity of sparse expansive representations in neurobiology, our work proposes a novel hashing algorithm BioHash that produces sparse high dimensional hash codes in a data-driven manner. We show that BioHash outperforms previously published benchmarks for various hashing methods. Since our learning algorithm is based on a local and biologically plausible synaptic plasticity rule, our work provides evidence for the proposal that LSH might be a computational reason for the abundance of sparse expansive motifs in a variety of biological systems. We also propose a convolutional variant BioConvHash that further improves performance. From the perspective of computer science, BioHash and BioConvHash are fast, scalable and yield compressed binary representations that are useful for similarity search.

研究の動機と目的

  • ドーパミンのハエにおける生物学的臭覚系に見られるような、スパースで拡張的な神経モチーフを模倣したデータ駆動型ハッシュ化アルゴリズムの開発。
  • 特にヒブス学習に除法正規化を組み合わせた生物学的に妥当なシナプス可塑性ルールを活用することで、教師なし類似性検索の性能を向上させること。
  • スパースで高次元の表現が、古典的な低次元の LSH やディープラーニングベースのハッシュ化手法に比べて優れたリtrieval精度を達成できることを示すこと。
  • スパースで拡張的な回路が生物学的神経系に広く見られる理由を、局所性に敏感なハッシュ化(LSH)の効率的実装と結びつける計算的根拠を提供すること。

提案手法

  • 入力データをバイナリコードにマップするために、スパースで高次元の隠れ層(m >> d)を有する2層の順方向ネットワークを用いる。
  • 隠れ層は、局所的かつヒブス学習に類似した可塑性ルールを適用し、除法正規化を組み合わせることでスパarsityを強制するとともに、学習された特徴の直交化を促進する。
  • 活性化された前・後突起ニューロン間の結合強度を高める生物学的に妥当な更新ルールにより、変換重みを学習する。
  • スパース化は、フィードバック抑制を伴うk-Winner-Take-All(k-WTA)ダイナミクスによって達成され、各入力に対して上位k個のニューロンのみが活性化される。
  • 畳み込みアーキテクチャへの拡張として、画像データに対する性能向上を目的とした変種であるBioConvHashを提案する。
  • 最終的なハッシュコードは、隠れ層内の活性化ニューロンから得られるバイナリ表現であり、類似性検索の高速なハミング距離計算を可能にする。

実験結果

リサーチクエスチョン

  • RQ1FlyHash などのランダムプロジェクションベースの手法と比較して、データ駆動型で生物学的インスピレーションを受けて設計された学習ルールが、優れたハッシュ性能を発揮できるか。
  • RQ2除法正規化とヒブス可塑性をハッシュ化に組み込むことで、入力の変動に対するロバストネスとリtrieval精度が向上するか。
  • RQ3生物学的神経モチーフから得られるスパースで高次元の表現が、低次元またはディープラーニングベースのハッシュ化手法に比べ、教師なし類似性検索において優れた性能を発揮できるか。
  • RQ4スパースで拡張的な回路が生物学的神経系に広く見られる理由について、類似性検出のためのLSHとしての計算的根拠があるか。

主な発見

  • BioHash は、CIFAR-10CNN において、k=32 時に 64.61%、k=16 時に 63.47% の mAP@1000 を達成し、GreedyHash や SAH、DeepBit などの手法を顕著に上回る最先端の性能を発揮した。
  • k=2 時に、CIFAR-10CNN で 57.33% の mAP を達成し、FlyHash(25.67%)や PCAHash(21.89%)を上回った。これは、極めて短いコード長でも優れた性能を示している。
  • k=2(m=40)における BioHash は、1サンプルあたりたった 12 ビットのストレージコストしか必要としないが、他の手法が k=16 を使用する場合を上回る性能を示しており、その効率性と有効性を裏付けている。
  • 畳み込み版である BioConvHash はさらに性能を向上させ、この手法が階層的かつ畳み込み型のデータ表現にうまく一般化できることを示している。
  • 学習ルールに除法正規化を組み込むことで、局所的な明るさの変化に対しても BioHash はロバストであることが示された。
  • 結果は、スパースで拡張的な神経回路が、生物学的システムにおける局所性に敏感なハッシュ化の計算的基盤を果たしている可能性を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。