Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Augmentation via Data Subsampling

Michael Kuchnik, Virginia Smith|arXiv (Cornell University)|Oct 11, 2018
Machine Learning and Data Classification被引用数 10
ひとこと要約

本論文は、影響力と損失に基づくメトリクスを用いて、高い影響を持つデータポイントを戦略的に部分抽出することで、効率的なデータ拡張を提案する。CIFAR10およびMNISTにおいて、完全な拡張と比較して90%のデータサイズ削減を達成しながら、99.86%の正確性を維持し、モデル性能を損なうことなくトレーニングコストを大幅に削減する。

ABSTRACT

Data augmentation is commonly used to encode invariances in learning methods. However, this process is often performed in an inefficient manner, as artificial examples are created by applying a number of transformations to all points in the training set. The resulting explosion of the dataset size can be an issue in terms of storage and training costs, as well as in selecting and tuning the optimal set of transformations to apply. In this work, we demonstrate that it is possible to significantly reduce the number of data points included in data augmentation while realizing the same accuracy and invariance benefits of augmenting the entire dataset. We propose a novel set of subsampling policies, based on model influence and loss, that can achieve a 90% reduction in augmentation set size while maintaining the accuracy gains of standard data augmentation.

研究の動機と目的

  • ディープラーニングにおける完全データ拡張の高い計算コストとストレージコストに対処すること。
  • 全データセットを拡張するのと同等の性能を達成するために、拡張する必要がある小さな訓練ポイントのサブセットを特定すること。
  • サポートベクターまたはモデル固有の仮定に依存しない、一般化可能でモデルに依存しない部分抽出ポリシーの開発。
  • 変換セットのヒューリスティックなチューニングの必要性を減らすことで、データ拡張の効率性と使いやすさを向上させること。
  • 影響力、損失、多様性に基づく選択戦略が、拡張セットサイズを最小限に抑える上でどの程度有効であるかを評価すること。

提案手法

  • 訓練損失が大きいデータポイントを優先して拡張する、損失に基づく部分抽出ポリシーを提案する。
  • 影響関数を用いて、モデル予測に最も影響を与えるポイントを特定する影響力に基づくポリシーを導入する。
  • k-DPPカーネルを用いて、影響力と特徴ベースの多様性(ボトルネック特徴)を組み合わせ、選択の質と多様性のバランスをとる。
  • サンプル再重み付けとオンライン学習を用いて、選択された拡張サブセットの性能をさらに向上させる。
  • DPPに基づく選択のための公開済み実装を用い、数値的不安定性を解消するための正規化とスケーリングを施す。
  • 制御されたトレーニングレジーム下で、複数のデータセット(MNIST、CIFAR10、NORB)とモデル(ResNet、Xception、SVM)を対象に、手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1完全なデータ拡張と同等の性能を達成するために、顕著に削減されたデータポイントのセットを拡張可能か?
  • RQ2影響力と損失メトリクスは、ランダムまたはヒューリスティックなサンプリングに比べて、拡張候補の選択においてどの程度優れているか?
  • RQ3DPPを用いた多様性認識選択を、影響力または損失に基づく選択と組み合わせることで、性能はどの程度向上するか?
  • RQ4部分抽出に基づく拡張は、データセットサイズに比例してトレーニング時間と正確性が線形にスケーリングするか?
  • RQ5影響力に基づくポリシーは、SVMを越えて異なるモデルやデータモダリティにも一般化可能か?

主な発見

  • 提案された影響力に基づくおよび損失に基づく部分抽出ポリシーは、完全なデータ拡張と比較して99.86%以上の正確性を達成しながら、拡張セットサイズを90%削減した。
  • 平行移動拡張を用いたCIFAR10では、全データの10%を拡張するだけで、完全拡張と同等の正確性に到達した。
  • 影響力に基づく選択は、すべての評価対象データセットとモデルで、ランダムサンプリングや単純なベースラインを上回った。
  • 影響力重み付きDPPアプローチは、影響力駆動の選択と同等の性能を示し、質と多様性を組み合わせることの価値を裏付けた。
  • トレーニング時間はデータセットサイズに比例して線形にスケーリングされ、部分抽出がトレーニングコストに比例して削減されることを確認した。
  • 本手法は、ResNetやXceptionモデルに対しても有効であり、SVMに限定されない広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。