Skip to main content
QUICK REVIEW

[論文レビュー] Between-class Learning for Image Classification

Yuji Tokozume, Yoshitaka Ushiku|arXiv (Cornell University)|Nov 28, 2017
Domain Adaptation and Few-Shot Learning参考文献 25被引用数 6
ひとこと要約

本論文は、画像分類のためのクラス間(BC)学習を提案する。モデルは、異なるクラスに属する2つの画像の混合比を予測するように訓練される。画像を波形として扱い、単純またはエネルギーに配慮した混合を適用することで、一般化性能が向上し、ImageNet-1Kのトップ-1誤差は19.4%、CIFAR-10の誤差は2.26%に低下する。

ABSTRACT

In this paper, we propose a novel learning method for image classification called Between-Class learning (BC learning). We generate between-class images by mixing two images belonging to different classes with a random ratio. We then input the mixed image to the model and train the model to output the mixing ratio. BC learning has the ability to impose constraints on the shape of the feature distributions, and thus the generalization ability is improved. BC learning is originally a method developed for sounds, which can be digitally mixed. Mixing two image data does not appear to make sense; however, we argue that because convolutional neural networks have an aspect of treating input data as waveforms, what works on sounds must also work on images. First, we propose a simple mixing method using internal divisions, which surprisingly proves to significantly improve performance. Second, we propose a mixing method that treats the images as waveforms, which leads to a further improvement in performance. As a result, we achieved 19.4% and 2.26% top-1 errors on ImageNet-1K and CIFAR-10, respectively.

研究の動機と目的

  • 音声認識で開発されたクラス間学習を、画像分類に拡張すること。
  • 視覚的に整合性のない画像を異なるクラスから混合させることで、モデルの一般化性能が向上するかどうかを調査すること。
  • CNNが画像を波形として暗黙的に扱うことで、混合ベースの学習が有効に機能するかどうかを検討すること。
  • 特徴量の分布制約を強化するシンプルで効果的な混合戦略を開発すること。
  • 多様なアーキテクチャとデータセットを用いてBC学習を実証的に検証し、一貫した性能向上を示すこと。

提案手法

  • 異なるクラスに属する2つの画像を、ランダムな混合比を用いて組み合わせて混合画像を生成する。
  • 回帰ヘッドを用いて混合比を回帰予測するようにモデルを訓練し、新たな比率予測ヘッドを導入する。
  • 内部分割(例えば、空間的クロップとブレンド)を用いた単純な混合手法を適用して、混合入力を生成する。
  • BC+を提案する。画像をゼロ平均の波形として扱い、各画像の平均を差し引いた後、画像エネルギーで正規化してから混合する。
  • 入力と監視の両方に同じ混合比を適用することで、単一の損失関数を用いたエンドツーエンド学習を可能にする。
  • モデルが複数のクラスが混合された状況でも比率を予測できるように、マルチクラス混合戦略を導入する。

実験結果

リサーチクエスチョン

  • RQ1視覚的に整合性のない状況下でも、音声認識で有効であったクラス間学習を画像分類に成功裏に適用できるか?
  • RQ2画像を波形として扱うことで、意味のあるデータ混合が可能となり、モデルの一般化性能が向上するか?
  • RQ3ネットワーク内の混合位置の選択(例えば、入力層対特徴層)が性能に与える影響はいかほどか?
  • RQ4性能を最大化するために最適な混合クラス数(例えば、2つ対3つ)は何か?
  • RQ5BC学習が特徴量分布に構造的制約を課し、一般化性能の向上に寄与するか?

主な発見

  • ResNeXt-101 (64×4d) を用いた ImageNet-1K において、BC学習によりトップ-1誤差が20.4%から19.4%に低下した。
  • 改善されたBC+手法により、Shake-Shake Regularization を用いた CIFAR-10 において、誤差率が2.86%から2.26%に低下した。
  • アブレーションスタディの結果、異なるクラスの2枚の画像を混合する(N=2)戦略が、ランダム混合や同クラス混合よりも一貫して優れた性能を示した。
  • 入力層での混合が最も高い性能を達成したが、より深い層(例:pool2)での混合は性能を低下させた。
  • 3次元PCAを用いた特徴量可視化により、BC学習が、より球形で密に凝集された特徴量分布を生成し、クラス内分散が低減されていることが確認された。
  • 本手法は、単純な11層CNNから最先端のモデルに至るまで、多数のアーキテクチャで一貫した性能向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。