Skip to main content
QUICK REVIEW

[論文レビュー] A novel image tag completion method based on convolutional neural network

Yanyan Geng, Zhang, Guohui|arXiv (Cornell University)|Mar 2, 2017
Image Retrieval and Classification Techniques参考文献 33被引用数 5
ひとこと要約

本稿では、畳み込みニューラルネットワーク(CNN)を用いて視覚的特徴を抽出し、線形予測子を用いて不完全なタグから完全なタグベクトルを推定する、新しい画像タグ補完手法を提案する。CNNの重み、線形予測子のパrameter、完全なタグを制約付き最小化問題を通じて同時に最適化することで、Corel、Labelme、Flickrといったベンチマークデータセットにおいて、画像アノテーションおよびリtrievalタスクで最先端の性能を達成した。

ABSTRACT

In the problems of image retrieval and annotation, complete textual tag lists of images play critical roles. However, in real-world applications, the image tags are usually incomplete, thus it is important to learn the complete tags for images. In this paper, we study the problem of image tag complete and proposed a novel method for this problem based on a popular image representation method, convolutional neural network (CNN). The method estimates the complete tags from the convolutional filtering outputs of images based on a linear predictor. The CNN parameters, linear predictor, and the complete tags are learned jointly by our method. We build a minimization problem to encourage the consistency between the complete tags and the available incomplete tags, reduce the estimation error, and reduce the model complexity. An iterative algorithm is developed to solve the minimization problem. Experiments over benchmark image data sets show its effectiveness.

研究の動機と目的

  • 実世界の応用における不完全な画像タグの課題に対処することにより、効果的な画像リtrievalおよびアノテーションを可能にする。
  • より判別性の高い視覚的特徴を得るために、深層畳み込み表現を活用してタグ補完性能を向上させること。
  • CNNパラメータ、線形予測子の重み、完全なタグ割り当てを同時に最適化する統合学習フレームワークを構築すること。
  • 予測されたタグと利用可能な不完全なタグの整合性を保つために正則化を組み込み、視覚的に類似した画像同士のタグベクトルの類似性を促進すること。
  • スパarsity制約と構造最適化を用いて、モデルの複雑さと推定誤差を最小化すること。

提案手法

  • 画像パッチから階層的な視覚的特徴を抽出するため、CNNを用い、フィルタ応答のマックスプーリングにより畳み込み表現ベクトルを生成する。
  • CNN特徴ベクトル $ \mathbf{y} $ を完全なタグ割り当てベクトル $ \mathbf{t} $ にマッピングするため、線形予測子モデル $ \mathbf{t} = U\mathbf{y} - \mathbf{b} $ を適用する。
  • マスク行列 $ \Phi $ を用いて、予測されたタグと利用可能な不完全なタグの再構成誤差を最小化する統合最適化問題を定式化する。
  • 畳み込みによる類似度に基づいて、視覚的に類似した画像のタグ予測同士の距離を最小化することで、タグベクトルの整合性を強制する。
  • タグ割り当てベクトルにスパarsityペナルティを適用し、モデルの複雑さを低減するとともに一般化性能を向上させる。
  • 非凸最小化問題を、CNN重み、線形予測子パラメータ、タグ行列を繰り返し更新する交互勾配降下法で解く。

実験結果

リサーチクエスチョン

  • RQ1従来の手作業で設計された特徴と比較して、CNNに基づく視覚的表現は、画像タグ補完の正確性を向上させるか?
  • RQ2CNNパラメータ、線形予測子、完全なタグを同時に学習する統合最適化フレームワークは、どの程度有効か?
  • RQ3画像同士の視覚的類似性を組み込むことで、タグ予測性能はどの程度向上するか?
  • RQ4スパarsity正則化を組み込むことで、タグ補完タスクにおける一般化性能が向上し、過学習が軽減されるか?
  • RQ5本手法は、画像アノテーションおよびタグベースの画像リtrievalの両面で、最先端の手法と比較してどの程度優れているか?

主な発見

  • Corelデータセットでは、本手法がPrecision@5で0.47を達成し、Linら(0.35)およびLiら(0.44)を上回った。
  • Labelmeデータセットでは、本手法がPrecision@5で0.30を達成し、Wuら(0.23)およびLiら(0.25)を上回った。
  • Flickrデータセットでは、本手法がPrecision@5で0.28を達成し、Fengら(0.20)およびLinら(0.23)を上回った。
  • 画像リtrievalタスクでは、CorelでPos@Topが0.73を達成し、Linら(0.64)およびLiら(0.68)を上回った。
  • 交互勾配降下法は、Corelデータセットで40イテレーション以内に収束し、安定的かつ効率的な最適化が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。