Skip to main content
QUICK REVIEW

[論文レビュー] Learning Category Correlations for Multi-label Image Recognition with Graph Networks

Qing Li, Xiaojiang Peng|arXiv (Cornell University)|Sep 28, 2019
Text and Document Classification Technologies参考文献 40被引用数 18
ひとこと要約

本稿では、単語埋め込みと1×1畳み込みを用いて、マルチラベル画像認識のための適応的ラベル相関グラフを学習する新しいグラフニューラルネットワークフレームワークA-GCNを提案する。スパース相関制約とプラグアンドプレイ型ラベルグラフモジュールを導入することで、ベースライン手法を上回り、MS-COCOおよびFashion550Kで最先端の性能を達成した。MS-COCOではResNet101ベースライン比でmAPが2.8%向上した。

ABSTRACT

Multi-label image recognition is a task that predicts a set of object labels in an image. As the objects co-occur in the physical world, it is desirable to model label dependencies. Previous existing methods resort to either recurrent networks or pre-defined label correlation graphs for this purpose. In this paper, instead of using a pre-defined graph which is inflexible and may be sub-optimal for multi-label classification, we propose the A-GCN, which leverages the popular Graph Convolutional Networks with an Adaptive label correlation graph to model label dependencies. Specifically, we introduce a plug-and-play Label Graph (LG) module to learn label correlations with word embeddings, and then utilize traditional GCN to map this graph into label-dependent object classifiers which are further applied to image features. The basic LG module incorporates two 1x1 convolutional layers and uses the dot product to generate label graphs. In addition, we propose a sparse correlation constraint to enhance the LG module and also explore different LG architectures. We validate our method on two diverse multi-label datasets: MS-COCO and Fashion550K. Experimental results show that our A-GCN significantly improves baseline methods and achieves performance superior or comparable to the state of the art.

研究の動機と目的

  • マルチラベル画像認識における事前定義・不変のラベル相関グラフの限界を解消すること。
  • データ駆動型でエンドツーエンド微分可能となる形で、意味的ラベル依存関係をモデル化すること。
  • 単語埋め込みから得られる動的で適応的なラベル相関を学習することで、マルチラベル分類の性能を向上させること。
  • スパース相関制約を用いて過剰平滑化を防ぎ、一般化性能とロバストネスを向上させること。
  • ラベル共起パターンを捉える能力を評価するために、さまざまなラベルグラフアーキテクチャの有効性を検証すること。

提案手法

  • 単語埋め込みから適応的ラベル相関グラフを生成するための、2つの1×1畳み込み層とドット積を用いたプラグアンドプレイ型ラベルグラフ(LG)モジュールを導入する。
  • 学習されたラベルグラフをグラフ畳み込みネットワーク(GCN)を用いて、画像特徴に適用可能なラベル依存分類器にマッピングする。
  • 学習された相関行列と単位行列との間でL1ノルム損失を用いてスパース相関制約を適用し、スパarsityを促進し、過剰平滑化を低減する。
  • 完全結合型やアテンションベースの変種を含む複数の代替LGアーキテクチャを検討し、ロバストネスと性能を評価する。
  • 分類損失とスパース相関正則化を組み合わせた損失関数を用いて、モデル全体をエンドツーエンドで訓練する。
  • ラベル間の意味的関係を手作業で作成したグラフに依存せずに、単語埋め込みをLGモジュールの入力として用いることで、ラベルの意味的関係を符号化する。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンド微分可能な適応的ラベル相関グラフは、固定または事前定義されたグラフを上回るマルチラベル画像認識性能を達成できるか?
  • RQ2スパース相関制約は、ラベルグラフ学習における過剰平滑化の抑制と一般化性能の向上にどの程度有効か?
  • RQ3異なるラベルグラフアーキテクチャ(例:FC、アテンションベース)は、マルチラベル認識において顕著な性能差を生じるか?
  • RQ4提案されたA-GCNフレームワークは、ラベル共起パターンが異なる多様なデータセットに一般化可能か?
  • RQ5標準的なGCNやベースラインCNNと比較して、適応的グラフはどの程度の性能向上をもたらすか?

主な発見

  • MS-COCOでは、ResNet101ベースラインのmAP 80.3%からA-GCNで83.1%に向上し、最先端のML-GCN手法を上回った。
  • スパース相関制約(L_A)により過剰平滑化が軽減され、性能が向上した。最適なα=1.0が得られ、それ以上の値は性能を低下させた。
  • LGモジュールにおけるFC-Aアーキテクチャが代替手法の中で最高の性能を示し、デフォルトの1×1畳み込みベース設計を上回った。
  • Fashion550Kでは、クリーンデータで微調整した際のmAPが66.32%に達し、ベースラインを3.4%上回り、再実装したML-GCNをも上回った。
  • 可視化結果から、共起する物体カテゴリ(例:スプーン、バックパック、歯ブラシ)において顕著な性能向上が確認され、ラベル依存関係の有効な学習が行われたことが裏付けられた。
  • 本手法は、MS-COCOおよびFashion550Kの両データセットにおいて、多様な学習設定下でも一貫した向上を示し、優れた一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。