Skip to main content
QUICK REVIEW

[論文レビュー] Multi-modal Ensemble Classification for Generalized Zero Shot Learning

Rafael Felix, Michele Sasdelli|arXiv (Cornell University)|Jan 15, 2019
Domain Adaptation and Few-Shot Learning参考文献 27被引用数 17
ひとこと要約

本稿では、一般化ゼロショット学習(GZSL)のためのマルチモーダルアンサンブル分類フレームワークを提案する。訓練時および推論時において、ベイジアン推論によるモンテカルロドロップアウトと学習可能でキャリブレーションされたスタッキング手法を用いて、視覚的および意味的分類器を統合最適化する。この手法は、CUB や FLO といった細分化データセットにおいて、H-mean を最大で2.1パーセンテージポイント改善し、最先端の性能を達成する。

ABSTRACT

Generalized zero shot learning (GZSL) is defined by a training process containing a set of visual samples from seen classes and a set of semantic samples from seen and unseen classes, while the testing process consists of the classification of visual samples from seen and unseen classes. Current approaches are based on testing processes that focus on only one of the modalities (visual or semantic), even when the training uses both modalities (mostly for regularizing the training process). This under-utilization of modalities, particularly during testing, can hinder the classification accuracy of the method. In addition, we note a scarce attention to the development of learning methods that explicitly optimize a balanced performance of seen and unseen classes. Such issue is one of the reasons behind the vastly superior classification accuracy of seen classes in GZSL methods. In this paper, we mitigate these issues by proposing a new GZSL method based on multi-modal training and testing processes, where the optimization explicitly promotes a balanced classification accuracy between seen and unseen classes. Furthermore, we explore Bayesian inference for the visual and semantic classifiers, which is another novelty of our work in the GZSL framework. Experiments show that our method holds the state of the art (SOTA) results in terms of harmonic mean (H-mean) classification between seen and unseen classes and area under the seen and unseen curve (AUSUC) on several public GZSL benchmarks.

研究の動機と目的

  • GZSLにおける既存手法で長年の問題となっている、学習済みクラスと未学習クラスの分類精度の不均衡を解消すること。
  • 訓練時には使用されているが、推論時には活用が不十分な視覚的および意味的モダリティを、推論時にも効果的に活用すること。
  • 別々のZSLまたはGZSLモデルを必要とせず、学習済みクラスと未学習クラスの両方でバランスの取れた性能を最適化する統合学習フレームワークの構築。
  • 1つのハイパーパrameterを調整することで、ZSLから完全に教師あり学習までのさまざまな運用ポイントに柔軟に展開可能にする。
  • モンテカルロドロップアウトを用いたベイジアンアンサンブル学習により、一般化性能とロバストネスを向上させること。

提案手法

  • 学習済みクラスの視覚特徴と、学習済みおよび未学習クラスの意味的属性を用いて、視覚的および意味的分類器を別々に学習する。
  • 視覚的および意味的分類器の両方にモンテカルロ(MC)ドロップアウトを適用し、不確実性推定とアンサンブルベースの予測を可能にする。
  • 学習済みクラスと未学習クラスの精度の調和平均(H-mean)を最適化するように、視覚的および意味的ベイジアン分類器の出力を学習可能なキャリブレーションされたスタッキング手法で統合する。
  • ハイパーパrameter β を導入し、学習済みクラスと未学習クラスの性能のバランスを制御することで、再訓練なしにZSLとGZSLの間を補間可能なモデルに可能にする。
  • 検証セットを用いて最適な α(モダリティ統合重み)と β(学習済み/未学習性能のバランス)を学習し、テストデータに対しても一般化性能を高める。
  • 視覚的特徴のためのサイクルWGANベースのデータ拡張を導入し、分類重みの調整と組み合わせることで、さらに性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1推論時にも視覚的および意味的モダリティを活用するマルチモーダルアンサンブル手法は、単一モダリティまたは単一モダリティ学習手法を上回る性能を発揮するか?
  • RQ2学習済みクラスと未学習クラスの両方の性能をバランスよく最適化することで、H-mean および seen-unseen カーブ下の面積(AUSUC)指標が向上するか?
  • RQ31つの統合モデルをGZSL用に学習した場合、1つのハイパーパrameterを用いて再訓練なしにZSLおよび完全に教師ありの設定に動的に再構成可能か?
  • RQ4モンテカルロドロップアウトを用いたベイジアンアンサンブル学習は、標準的な分類器と比較して、ゼロショット分類におけるロバストネスと一般化性能をどのように向上させるか?
  • RQ5既存のGZSL手法が学習済みクラスに強くバイアスを示す理由は何か?そして、バランスの取れた性能を明示的に最適化することで、このバイアスを軽減できるか?

主な発見

  • 提案手法3MEは、CUBデータセットで54.3%というH-meanの新記録を達成し、以前の研究の52.2%から向上した。
  • FLOデータセットでは、H-meanが64.5%から66.8%に向上し、細分化ゼロショット学習において顕著な向上を示した。
  • SUN(39.4%)およびAwA(60.2%)でも最先端の結果を達成し、粗粒度データセットでは過去の最先端手法にわずかに上回る性能を示した。
  • ゼロショット学習(ZSL)では、CUBで71.1%、FLOで83.9%の精度を達成し、それぞれ57.8%および68.8%の過去の最先端手法を大幅に上回った。
  • 全評価データセットで最高のAUSUCスコアを達成し、学習済み/未学習クラスのトレードオフのあらゆる運用ポイントで優れた総合的性能を示した。
  • 学習可能なβを用いたキャリブレーションされたスタッキング機構により、再訓練なしにZSLモードとGZSLモードの間で動的適応が可能であり、両モードで高い性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。