Skip to main content
QUICK REVIEW

[論文レビュー] E$^2$BoWs: An End-to-End Bag-of-Words Model via Deep Convolutional Neural Network

Xiaobin Liu, Shiliang Zhang|arXiv (Cornell University)|Sep 18, 2017
Advanced Image and Video Retrieval Techniques参考文献 29被引用数 3
ひとこと要約

本稿では、深層畳み込みニューラルネットワークを用いて意味的に判別力のある視覚的単語を生成する、エンド・ツー・エンドのBag-of-WordsモデルE²BoWsを提案する。最終全結合層をカテゴリ固有の意味特徴マップを生成する畳み込み層に置き換え、スパarsity正則化を施した新しいBag-of-Words層を導入することで、CIFAR-10、CIFAR-100、MIRFLICKR-25K、NUS-WIDEの各データセットにおいて、従来のBoW手法および最近のディープラーニングベースラインを上回る、最先端の精度と効率性を達成した。

ABSTRACT

Traditional Bag-of-visual Words (BoWs) model is commonly generated with many steps including local feature extraction, codebook generation, and feature quantization, etc. Those steps are relatively independent with each other and are hard to be jointly optimized. Moreover, the dependency on hand-crafted local feature makes BoWs model not effective in conveying high-level semantics. These issues largely hinder the performance of BoWs model in large-scale image applications. To conquer these issues, we propose an End-to-End BoWs (E$^2$BoWs) model based on Deep Convolutional Neural Network (DCNN). Our model takes an image as input, then identifies and separates the semantic objects in it, and finally outputs the visual words with high semantic discriminative power. Specifically, our model firstly generates Semantic Feature Maps (SFMs) corresponding to different object categories through convolutional layers, then introduces Bag-of-Words Layers (BoWL) to generate visual words for each individual feature map. We also introduce a novel learning algorithm to reinforce the sparsity of the generated E$^2$BoWs model, which further ensures the time and memory efficiency. We evaluate the proposed E$^2$BoWs model on several image search datasets including CIFAR-10, CIFAR-100, MIRFLICKR-25K and NUS-WIDE. Experimental results show that our method achieves promising accuracy and efficiency compared with recent deep learning based retrieval works.

研究の動機と目的

  • 手作業で設計された局所特徴とマルチステージ処理に依存する従来のBag-of-Words(BoW)モデルの限界を克服すること。
  • 深層畳み込みニューラルネットワーク(DCNN)をBoWフレームワークに統合することで、より良い意味的表現を実現し、画像検索における意味的ギャップを埋めること。
  • 特徴学習と視覚的単語生成の両方を共同最適化できるエンド・ツー・エンドの学習を可能にすること。
  • スケーラブルなインverted fileインデックスインデックスと高速な検索を実現するため、得られる視覚的単語表現の高効率性とスパarsityを保証すること。
  • 特に意味的類似性検索において、既存のディープラーニングベースの検索手法よりも一般化性能と判別力を向上させること。

提案手法

  • GoogLeNetの最終全結合層を、n個のオブジェクトカテゴリに対応するn個の意味特徴マップ(SFMs)を生成する畳み込み層に置き換える。
  • 各意味特徴マップは、新しいBag-of-Words Layer(BoWL)を経由して、1マップあたりm個のスパースな視覚的単語を生成し、合計でm×n個の視覚的単語が得られる。
  • 視覚的単語表現のスパarsityを強制するためにしきい値処理を適用し、メモリおよび計算効率を向上させる。
  • 3成分構成の損失関数を導入:(1) 学習用の分類損失、(2) 同じ画像がより多くの視覚的単語を共有するよう促すコントラスト損失、(3) 1画像あたりの視覚的単語数を低く保つためのスパarsity正則化。
  • バックプロパゲーションを用いてエンド・ツー・エンドで学習を実行し、特徴抽出、視覚的単語生成、スパarsityの共同最適化を可能にする。
  • インバーテッドファイルインデックスとTF-IDF重み付けをサポートしており、大規模な画像検索を効率的に行える。

実験結果

リサーチクエスチョン

  • RQ1深層畳み込みニューラルネットワークを用いて、従来のマルチステージBoWパイプラインに代わるエンド・ツー・エンドの視覚的単語生成が可能か?
  • RQ2手作業で設計された局所特徴を深層特徴に置き換えることで、画像検索における意味的判別力が向上するか?
  • RQ3スパarsity正則化を施した新しいBag-of-Words Layerは、精度を向上させつつも高い検索効率を維持できるか?
  • RQ4標準的な深層特徴(例:GoogLeNet)と比較して、提案されたE²BoWsモデルは多様なデータセットにどのように一般化するか?
  • RQ5学習された視覚的単語とバイナリコードを用いた場合、検索精度と計算効率のトレードオフはどのように変化するか?

主な発見

  • CIFAR-10では、E²BoWs-B(バイナリゼーション版)がmAP 0.563を達成し、最良のベースラインBHC [23](mAP 0.543)を上回った。
  • NUS-WIDEでは、E²BoWsモデルがmAP 0.599を達成し、GoogLeNet特徴(最良のベースラインmAP 0.594)を顕著に上回り、一般化性能に優れたことを示した。
  • MIRFLICKR-25Kにおける1画像あたりの平均視覚的単語数はわずか43.6であり、スパarsityと効率性が高く、BHCが要する480,000回の演算と比較して顕著に効率的である。
  • インバーテッドファイルインデックスを活用することで、CIFAR-10では1画像あたり8.64回の演算で済ませ、バイナリコードを用いた線形探索(8,294回)と比較して検索複雑度を大幅に低減した。
  • 提案された3成分構成の損失関数により、収束が速くなり、意味的判別力とスパarsityの両方が向上したことが、すべてのベンチマークデータセットで検証された。
  • E²BoWsが生成する視覚的単語表現は、より強い意味的手がかりを示しており、例として「目」の画像において「人間」を正しく特定するなど、BHC [23] よりも優れた意味的理解を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。