Skip to main content
QUICK REVIEW

[論文レビュー] Multi-layered Semantic Representation Network for Multi-label Image Classification

Xiwen Qu, Hao Che|arXiv (Cornell University)|Jun 22, 2021
Text and Document Classification Technologies参考文献 33被引用数 6
ひとこと要約

本稿では、ラベル共起グラフを用いて局所的およびグローバルなラベル意味を同時にモデル化し、意味誘導型アテンション機構を用いて複数の畳み込み層を跨ぐ画像表現を学習する、マルチレイヤード意味的表現ネットワーク(MSRN)を提案する。MSRNは4つのベンチマークデータセットにおいて最先端の性能を達成し、COCOおよびVOC 2007でmAPおよびCF1において最大0.4%の向上を達成した。

ABSTRACT

Multi-label image classification (MLIC) is a fundamental and practical task, which aims to assign multiple possible labels to an image. In recent years, many deep convolutional neural network (CNN) based approaches have been proposed which model label correlations to discover semantics of labels and learn semantic representations of images. This paper advances this research direction by improving both the modeling of label correlations and the learning of semantic representations. On the one hand, besides the local semantics of each label, we propose to further explore global semantics shared by multiple labels. On the other hand, existing approaches mainly learn the semantic representations at the last convolutional layer of a CNN. But it has been noted that the image representations of different layers of CNN capture different levels or scales of features and have different discriminative abilities. We thus propose to learn semantic representations at multiple convolutional layers. To this end, this paper designs a Multi-layered Semantic Representation Network (MSRN) which discovers both local and global semantics of labels through modeling label correlations and utilizes the label semantics to guide the semantic representations learning at multiple layers through an attention mechanism. Extensive experiments on four benchmark datasets including VOC 2007, COCO, NUS-WIDE, and Apparel show a competitive performance of the proposed MSRN against state-of-the-art models.

研究の動機と目的

  • 局所的およびグローバルなラベル相関をモデル化することで、マルチラベル画像分類を改善すること。
  • CNNの複数の畳み込み層からの特徴を活用することで、意味的表現学習を強化すること。
  • アテンション機構を用いてラベル意味を介して関心領域への特徴学習を誘導すること。
  • 従来の手法が最終畳み込み層や局所的ラベル意味にのみ焦点を当てるという限界を是正すること。

提案手法

  • ラベル共起グラフを用いて局所的ラベル意味とグローバルなグループ意味を捉えるラベルグループ埋め込み(LGE)モジュールを導入する。
  • ラベルおよびグループ埋め込みを用いてCNNが関連する画像領域に注目できるようにする意味誘導型アテンション(SGA)モジュールを設計する。
  • LGEと複数の畳み込み層からの特徴マップをアテンション機構を通じて統合し、共有される意味的表現を生成する。
  • ResNet-101の最後の3つのまたはすべての残差ブロックから特徴を抽出するためのマルチブランチアーキテクチャを採用する。
  • 正則化を組み込んだ共同最適化フレームワークを用いて、ラベル埋め込み学習と特徴表現学習のバランスを取る。
  • 共起頻度に基づいてラベルをグループ化するグラフベースのクラスタリング戦略を適用し、高次相関のモデル化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1局所的およびグローバルなラベル意味を同時にモデル化することは、マルチラベル画像分類の性能向上に寄与するか?
  • RQ2複数の畳み込み層に跨る意味的表現学習は、最終層のみを用いる場合よりも優れた特徴の識別能をもたらすか?
  • RQ3ラベル意味に誘導されたアテンション機構は、マルチラベル予測のための関連画像領域の局在化を改善できるか?
  • RQ4ラベルグループ数や正則化強度といったハイパーパrameterに対して、モデルはどれほど感度を示すか?
  • RQ5提案フレームワークにおけるラベル固有の意味とグループレベルの意味の相対的寄与度は何か?

主な発見

  • VOC 2007では94.85%のmAPを達成し、前回の最先端手法よりCF1で0.4%、OF1で0.2%向上した。
  • COCOでは42.1%のmAPを達成し、2番目に良いモデルより0.1%高い性能を示し、CF1で0.2%、CF1-3で0.4%の向上を達成した。
  • NUS-WIDEでは61.5%のmAPと74.0%のOF1を達成し、比較されたすべての手法の中で最多の順位を獲得した。
  • Apparelデータセットでは99.65%のmAPを達成し、ResNet-101より0.18%、前回の最先端手法より0.06%高い性能を示した。
  • アブレーションスタディの結果、ラベル埋め込みとグループ埋め込みの両方が不可欠であることが確認され、1種類の埋め込みのみを用いた変種よりも、完全なMSRNモデルが優れた性能を示した。
  • ハイパーパrameterの変更に対してもモデルは頑健であり、グループ数(m)と正則化(λ)の異なる値においてmAPが0.5%未満で変動した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。