Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge-Guided Multi-Label Few-Shot Learning for General Image Recognition

Tianshui Chen, Liang Lin|arXiv (Cornell University)|Sep 20, 2020
Text and Document Classification Technologies被引用数 13
ひとこと要約

本論文は、統計的ラベル共起知識をグラフ構造のニューラルネットワークに統合することで、マルチラベル画像認識および少数ショット学習を向上させる知識誘導型グラフルーティング(KGGR)フレームワークを提案する。2つのグラフ伝搬ネットワーク(意味論的に誘導される特徴相互作用用と、分類器重みの転送用)を用いることで、COCO、VOC、Visual Genomeベンチマークで最先端の性能を達成し、特に低ショット設定において、mAPで前人を上回る最大8.2%の向上を達成する。

ABSTRACT

Recognizing multiple labels of an image is a practical yet challenging task, and remarkable progress has been achieved by searching for semantic regions and exploiting label dependencies. However, current works utilize RNN/LSTM to implicitly capture sequential region/label dependencies, which cannot fully explore mutual interactions among the semantic regions/labels and do not explicitly integrate label co-occurrences. In addition, these works require large amounts of training samples for each category, and they are unable to generalize to novel categories with limited samples. To address these issues, we propose a knowledge-guided graph routing (KGGR) framework, which unifies prior knowledge of statistical label correlations with deep neural networks. The framework exploits prior knowledge to guide adaptive information propagation among different categories to facilitate multi-label analysis and reduce the dependency of training samples. Specifically, it first builds a structured knowledge graph to correlate different labels based on statistical label co-occurrence. Then, it introduces the label semantics to guide learning semantic-specific features to initialize the graph, and it exploits a graph propagation network to explore graph node interactions, enabling learning contextualized image feature representations. Moreover, we initialize each graph node with the classifier weights for the corresponding label and apply another propagation network to transfer node messages through the graph. In this way, it can facilitate exploiting the information of correlated labels to help train better classifiers. We conduct extensive experiments on the traditional multi-label image recognition (MLR) and multi-label few-shot learning (ML-FSL) tasks and show that our KGGR framework outperforms the current state-of-the-art methods by sizable margins on the public benchmarks.

研究の動機と目的

  • マルチラベル画像認識における既存手法の、明示的なラベル依存関係のモデリングの限界と、少数ショットカテゴリへの一般化の難しさを解決すること。
  • 統計的ラベル共起に関する事前知識を深層ニューラルネットワークに統合し、特徴および分類器学習を改善すること。
  • グラフベースのメッセージパッシングを通じて関連ラベル情報を活用することで、各カテゴリの大きな訓練データセットに依存するのを軽減すること。
  • 標準的なマルチラベル認識と少数ショットシナリオの両方で、より良い性能を達成するために、意味論的特徴学習と分類器知識転送を統合すること。

提案手法

  • カテゴリ間の事前相関をモデル化するため、統計的ラベル共起頻度に基づいた知識グラフを構築する。
  • カテゴリの意味論を用いて関連する意味的領域に特徴学習を集中させる、意味論的に誘導されたアテンションモジュールを導入する。
  • グラフニューラルネットワークを用いてノード間を伝搬・集約し、各カテゴリの文脈に適した表現を学習する。
  • グラフノードを分類器重みで初期化し、関連ラベル間で情報伝搬を行うための第二のグラフ伝搬ネットワークを適用する。
  • マルチラベル存在確率の予測のため、クロスエントロピー損失を用いてモデルを訓練する。
  • 二段階のメッセージパッシングを適用する:特徴空間での表現学習のための一つと、分類器の最適化のためのもう一つ(意味空間での伝搬)。

実験結果

リサーチクエスチョン

  • RQ1ラベル共起に関する事前知識は、マルチラベル画像認識における特徴表現学習を改善できるか?
  • RQ2グラフベースのメッセージパッシングは、リソースが限られた(少数ショットの)カテゴリの分類器学習をどのように向上させるか?
  • RQ3意味論的に誘導されたアテンションは、マルチラベル画像における関連オブジェクト領域の局在化をどの程度改善するか?
  • RQ4知識誘導型グラフルーティングは、マルチラベルシナリオにおいて、RNNを用いたラベル依存関係の逐次的モデリングを上回るか?
  • RQ5ラベル相関知識の統合により、各カテゴリの大きな訓練データセットへの依存を軽減できるか?

主な発見

  • KGGRフレームワークは、Microsoft COCOデータセットでmAP 84.3%を達成し、前人最高水準を2.1ポイント上回った。
  • 1ショットおよび5ショットの少数ショット学習設定では、それぞれmAP 52.3%および63.5%を達成し、前人を上回る8.2%および7.5%の向上を示した。
  • 意味論的に誘導されたアテンションモジュールを除去すると、mAPは80.9%に低下し、このモジュールが関連する意味的領域に注目する役割を果たしていることが示された。
  • 知識埋め込み型特徴伝搬を排除すると、COCOでmAPが2.1%低下し、文脈に適した特徴学習に貢献していることが確認された。
  • クロスエントロピー損失をユークリッド距離損失に置き換えると、mAPは84.3%から79.2%に低下し、マルチラベル分類においてクロスエントロピーがより効果的であることが示された。
  • グラフ意味論伝搬コンponentは顕著な寄与を示しており、COCOではmAPが84.3%から83.8%に低下し、1ショット少数ショット学習では52.3%から50.4%に低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。