Skip to main content
QUICK REVIEW

[論文レビュー] MixUp as Locally Linear Out-Of-Manifold Regularization

Hongyu Guo, Yongyi Mao|arXiv (Cornell University)|Sep 7, 2018
Domain Adaptation and Few-Shot Learning被引用数 6
ひとこと要約

本稿では、マニフォールドへの侵入を根本的要因として特定し、MixUpを局所線形のマニフォールド外正則化として定式化する、AdaMixUpを提案する。AdaMixUpは、ポリシー生成器と侵入検出器を用いて混合ポリシーを学習することで、合成例が実データポイントと干渉するのを回避し、一般化性能を向上させる。CIFAR-10およびCIFAR-100で最先端の性能を達成した。

ABSTRACT

MixUp is a recently proposed data-augmentation scheme, which linearly interpolates a random pair of training examples and correspondingly the one-hot representations of their labels. Training deep neural networks with such additional data is shown capable of significantly improving the predictive accuracy of the current art. The power of MixUp, however, is primarily established empirically and its working and effectiveness have not been explained in any depth. In this paper, we develop an understanding for MixUp as a form of "out-of-manifold regularization", which imposes certain "local linearity" constraints on the model's input space beyond the data manifold. This analysis enables us to identify a limitation of MixUp, which we call "manifold intrusion". In a nutshell, manifold intrusion in MixUp is a form of under-fitting resulting from conflicts between the synthetic labels of the mixed-up examples and the labels of original training data. Such a phenomenon usually happens when the parameters controlling the generation of mixing policies are not sufficiently fine-tuned on the training data. To address this issue, we propose a novel adaptive version of MixUp, where the mixing policies are automatically learned from the data using an additional network and objective function designed to avoid manifold intrusion. The proposed regularizer, AdaMixUp, is empirically evaluated on several benchmark datasets. Extensive experiments demonstrate that AdaMixUp improves upon MixUp when applied to the current art of deep classification models.

研究の動機と目的

  • MixUpをデータ依存的で局所線形なマニフォールド外正則化の一種として位置づけることにより、その理論的裏付けを提供すること。
  • 標準的なMixUpにおける主要な限界要因である「マニフォールドへの侵入」——実データラベルと矛盾するソフトラベルを受ける合成例がマニフォールドに干渉すること——を同定すること。
  • マニフォールドへの侵入を回避するための、適応的かつデータ駆動型の混合ポリシーを自動で学習する手法を開発すること。
  • 合成例がデータマニフォールドと交差するリスクを最小限に抑えることで、深層ニューラルネットワークの一般化性能を向上させること。
  • ベンチマーク画像分類データセット上での有効性を検証し、標準的なMixUpよりも優れた性能を示すことを目的とする。

提案手法

  • 入力空間およびラベル空間における線形補間により合成例を生成する、局所線形のマニフォールド外正則化スキームとしてMixUpを定式化する。
  • データから最適な混合領域を学習するポリシー生成ネットワークを導入し、2サンプル間の単純な補間を超えた高次元の混合を可能にする。
  • 入力空間において実データポイントに近すぎる合成例を検出・ペナルティ化するため、侵入検出器を採用する。
  • 2段階の訓練プロセスを採用:まず、学習済みポリシーで混合サンプルを生成し、次に侵入検出器からのフィードバックを用いてポリシーを精緻化する。
  • 分類損失と侵入損失を同時に最適化することで、マニフォールドへの侵入を回避する正則化を訓練中に適用する。
  • 微分可能なポリシー生成器を用いて、バッチごとに混合ハイパーパrameter(αおよびΔ)を動的に調整し、手動によるチューニングの必要性を排除する。

実験結果

リサーチクエスチョン

  • RQ1MixUpはどのような正則化の形として機能し、その背後にあるインダクティブバイアスは何か?
  • RQ2ハイパーパrameterが不適切に設定された場合にMixUpの性能が劣化する原因は何か、そしてそれはどのように形式的に特徴づけられるか?
  • RQ3マニフォールドへの侵入リスクを定量的にモデル化し、エンドツーエンドの学習フレームワークで緩和可能か?
  • RQ4固定でグローバルなハイパーパrameterを用いるMixUpと比較して、適応的かつデータ駆動型の混合ポリシー学習は、より良い一般化をもたらすか?
  • RQ5異なるデータ量の環境やモデル容量の下で、提案手法は標準的なMixUpと比較して、ロバスト性と性能の面で優れているか?

主な発見

  • マニフォールドへの侵入——合成例が実データに干渉するが、ラベルが一貫しないソフトラベルを受ける——が、標準的なMixUpにおけるアンダーフィッティングと性能劣化の原因である。
  • 侵入検出器を組み込むことで、CIFAR-100ではテスト誤差が2.01%低下し(20.97% vs. 24.75%)、AdaMixUpが標準的なMixUpを上回った。
  • CIFAR-10では、侵入検出器を用いた場合、AdaMixUpが3.52%のテスト誤差を達成し、ベースライン(5.53%)およびMixUp(3.83%)を上回った。
  • 訓練データ量が増加するにつれて、AdaMixUpと標準的なMixUpの性能差が拡大する傾向にあり、データが限られた条件下での一般化性能の向上が顕著に現れた。
  • AdaMixUpはモデル容量に強く対応しており、より大きなResNet-18の変種では、フィルタ数が増えるほど精度が向上し、一般化性能の向上が顕著に見られた。
  • 入力空間ではなく隠れ層で補間を行うと、顕著な性能低下(CIFAR-100で22.21%の誤差)が生じ、埋め込み空間における外観的類似性が著しく劣化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。