Skip to main content
QUICK REVIEW

[論文レビュー] Meta Feature Modulator for Long-tailed Recognition

Renzhen Wang, Kaiqin Hu|arXiv (Cornell University)|Aug 8, 2020
Domain Adaptation and Few-Shot Learning参考文献 57被引用数 7
ひとこと要約

本稿では、深層ネットワークの途中特徴量を学習可能な調節パラメータで動的に調節するメタラーニングフレームワークであるMeta Feature Modulator (MFM)を提案する。小さなバランスの取れたメタデータセットに従って、アーキテクチャの変更なしに特徴表現の質を向上させることで、長尾分布の認識性能を向上させる。CIFAR-10、Fashion-MNIST、MIT-67シーンデータセットを含む複数のベンチマークで最先端の性能を達成した。

ABSTRACT

Deep neural networks often degrade significantly when training data suffer from class imbalance problems. Existing approaches, e.g., re-sampling and re-weighting, commonly address this issue by rearranging the label distribution of training data to train the networks fitting well to the implicit balanced label distribution. However, most of them hinder the representative ability of learned features due to insufficient use of intra/inter-sample information of training data. To address this issue, we propose meta feature modulator (MFM), a meta-learning framework to model the difference between the long-tailed training data and the balanced meta data from the perspective of representation learning. Concretely, we employ learnable hyper-parameters (dubbed modulation parameters) to adaptively scale and shift the intermediate features of classification networks, and the modulation parameters are optimized together with the classification network parameters guided by a small amount of balanced meta data. We further design a modulator network to guide the generation of the modulation parameters, and such a meta-learner can be readily adapted to train the classification network on other long-tailed datasets. Extensive experiments on benchmark vision datasets substantiate the superiority of our approach on long-tailed recognition tasks beyond other state-of-the-art methods.

研究の動機と目的

  • 現実世界の視覚認識において、長尾分布に起因する深層ネットワークの性能低下を解消すること。
  • 内部および外部のサンプル情報の活用が不十分な既存のリサンプリングおよびリウェートィング手法が特徴表現の質を損なうという限界を克服すること。
  • 訓練時に不均衡なデータに従って学習しても、バランスの取れたラベル分布に一般化できる分類ネットワークをメタラーニングフレームワークで実現すること。
  • 再トレーニングなしに異なる長尾データセットに適応可能な、移植可能な調節ネットワークを設計すること。
  • 最小限のアーキテクチャ変更で標準ネットワークのエンドツーエンド学習を可能にし、末尾クラスの性能を向上させること。

提案手法

  • 分類ネットワークの途中特徴量に対して、チャネル単位でスケーリングおよびシフトする学習可能な調節パラメータを導入し、訓練中に特徴量を動的に調節する。
  • 小さなバランスの取れたメタデータセット上で経験的リスク最小化を用いて、分類ネットワークと調節パラメータを同時に最適化する。
  • 入力特徴量とソフトラベルに基づいて調節パラメータを生成する調節ネットワークを設計し、文脈に応じた適応的で柔軟な特徴調節を可能にする。
  • バランスの取れたデータ上でメタロスを最小化するように調節ネットワークを訓練することで、クラス寄与度の再バランスを暗黙的に学習可能にする。
  • 微調整なしに、メタ学習済みの調節ネットワークを長尾データセットに適用し、調節ネットワークのデータセット間転送性を実現する。
  • 推論時に条件付き計算を必要としないため、調節ネットワークのスイッチを削除することで、推論の効率性を確保する。

実験結果

リサーチクエスチョン

  • RQ1メタ学習された特徴調節は、アーキテクチャの変更なしに、長尾認識における表現学習を向上させることができるか?
  • RQ2ある長尾データセットで学習した調節ネットワークは、異なる不均衡要因を持つ他のデータセットにも一般化可能か?
  • RQ3提案手法は、既存のリサンプリングおよびリウェートィングベースラインを上回りつつ、特徴表現の質を保持できるか?
  • RQ4極端な長尾分布下でも、調節ネットワークは末尾クラスを含むすべてのクラスに対してバランスの取れた好ましさを維持できるか?
  • RQ5事前学習済みの調節ネットワークは、異なるクラス不均衡レベルを持つ異なるデータセット間でどの程度転送可能か?

主な発見

  • 不均衡要因100の長尾CIFAR-10では、MFMがトップ1誤差を12.12%に低下(ベースモデルは14.01%)し、顕著な向上を示した。
  • 不均衡要因200のFashion-MNISTでは、CIFAR-10から転送した調節ネットワークが13.89%の誤差を達成し、ベースモデル(16.12%)を上回り、完全なファインチューニング済み調節ネットワークに近い性能を示した。
  • MIT-67シーン認識では、MFMがトップ1誤差24.63%を達成し、ベースモデル(28.54%)およびすべての比較手法(CB や MW-Net を含む)を上回った。
  • 残差接続(WH層)を導入することで、MIT-67における誤差はさらに24.20%に低下し、アーキテクチャ統合による性能向上が確認された。
  • 転送実験により、あるデータセットで学習した調節ネットワークが、異なる不均衡要因を持つ別のデータセットに対しても良好に一般化することが確認され、高いロバスト性と転送性を示した。
  • 条件付きバッチ正則化やアテンションモジュールを用いる手法とは異なり、条件付き計算を削除することで、推論の効率性を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。