Skip to main content
QUICK REVIEW

[論文レビュー] Cross-modal Hallucination for Few-shot Fine-grained Recognition

Frederik Pahde, Patrick Jähnichen|arXiv (Cornell University)|Jun 13, 2018
Domain Adaptation and Few-Shot Learning参考文献 26被引用数 16
ひとこと要約

本稿では、テキスト記述からクラス判別的画像を生成する判別的テキスト条件付きGANを用いて、少数ショットの細分化画像認識のためのクロスモーダルホラシネーションフレームワークを提案する。マルチモーダルな訓練データ(画像とテキスト)を活用し、クラス判別的識別器を用いた自己-paced戦略を適用することで、単一モーダルベースラインと比較してCUBデータセット上で少数ショット精度を4.9–8.6パーセンテージポイント向上した。

ABSTRACT

State-of-the-art deep learning algorithms generally require large amounts of data for model training. Lack thereof can severely deteriorate the performance, particularly in scenarios with fine-grained boundaries between categories. To this end, we propose a multimodal approach that facilitates bridging the information gap by means of meaningful joint embeddings. Specifically, we present a benchmark that is multimodal during training (i.e. images and texts) and single-modal in testing time (i.e. images), with the associated task to utilize multimodal data in base classes (with many samples), to learn explicit visual classifiers for novel classes (with few samples). Next, we propose a framework built upon the idea of cross-modal data hallucination. In this regard, we introduce a discriminative text-conditional GAN for sample generation with a simple self-paced strategy for sample selection. We show the results of our proposed discriminative hallucinated method for 1-, 2-, and 5- shot learning on the CUB dataset, where the accuracy is improved by employing multimodal data.

研究の動機と目的

  • 細分化視覚認識における限られた訓練データの課題、特に1–5枚のサンプルしか入手できない新規クラスが存在する少数ショット状況に対処すること。
  • 訓練中にマルチモーダルデータ(画像と細分化されたテキスト記述)を活用することで、ベースクラスと新規クラスの間の情報ギャップを埋めること。
  • 実際の画像が不足する状況でも、テキスト記述に条件づけられた高品質でクラス判別的な画像を生成することで、少数ショット学習のパフォーマンスを向上させること。
  • 再現性だけでなく、クラス判別性に基づいて生成画像を優先順位付けする自己-pacedなサンプル選択戦略を開発すること。
  • 訓練時はマルチモーダル(画像とテキスト)だが、テスト時は単一モーダル(画像のみ)である、新しいマルチモーダル少数ショット学習のベンチマークを確立すること。

提案手法

  • 生成器が現実的でかつクラス判別的なサンプルを生成できるように、テキスト記述に条件づけられた判別的テキスト条件付きGAN(tcGAN)を訓練する。
  • 識別器を「真偽」分類のみではなく、クラス判別的(D*)に変更することで、新規クラスの特徴を的確に捉えた生成画像の選別を可能にする。
  • 自己-paced学習戦略により、クラス判別的識別器D*の信頼度スコアに基づいて生成画像をランク付けし、最も判別的な画像のみを訓練に使用する。
  • 最終的な分類器は、実際の少数ショット画像と上位ランクのホラシネート画像の組み合わせで訓練され、低データ環境での一般化性能が向上する。
  • 訓練中に対照的学習を用いて、事前学習済みのテキストエンコーダーでテキスト記述を埋め込み、視覚的特徴と一致させる。
  • 実験は、150のベースクラスと50の新規クラスを有するCUB-200-2011データセットで実施し、新規クラスあたり1–20ショットを用いる。

実験結果

リサーチクエスチョン

  • RQ1テキスト条件付きGANを用いたクロスモーダルホラシネーションは、単一モーダルベースラインと比較して、少数ショットの細分化画像認識性能を向上させることができるか?
  • RQ2サンプル選択に標準的な真偽分類識別器ではなく、クラス判別的識別器(D*)を用いることで、より良い一般化性能が得られるか?
  • RQ3マルチモーダルデータ(画像とテキスト)は、新規クラスの実画像が不足する少数ショット学習において、どの程度補完的役割を果たすか?
  • RQ4クラス判別スコアに基づいたホラシネート画像の選択という自己-paced戦略は、モデルのロバストネス向上にどの程度有効か?
  • RQ5本稿で提案するフレームワークは、画像データのみに依存するか、ゼロショット生成に依存する既存の少数ショット学習手法を上回るか?

主な発見

  • 提案手法(StGD*)は1ショット学習でトップ5精度28.5%を達成し、単一モーダルベースライン(19.9%)を8.6パーセンテージポイント上回った。
  • 2ショット学習では、トップ5精度31.6%を達成し、ベースライン(24.8%)を6.8パーセンテージポイント上回った。
  • 5ショット学習では、トップ5精度41.7%を達成し、ベースライン(36.8%)を4.9パーセンテージポイント上回った。
  • クラス判別的識別器(D*)の使用は、再現性のみに基づいて順位付けする標準的な真偽分類識別器(StGD)と比較して、顕著にパフォーマンスを向上させた。
  • 定性的な分析により、D*によって高得点が付けられた画像はより多くのクラス判別的特徴を含んでおり、D*のみで順位付けされた画像は、実際の再現性は高くてもカテゴリが混在していることが確認された。
  • 結果から、マルチモーダルデータと判別的サンプル選択が、少数ショットの細分化認識における情報ギャップを埋めるために不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。