Skip to main content
QUICK REVIEW

[論文レビュー] KeepAugment: A Simple Information-Preserving Data Augmentation Approach

Chengyue Gong, Dilin Wang|arXiv (Cornell University)|Nov 23, 2020
Advanced Neural Network Applications参考文献 43被引用数 12
ひとこと要約

KeepAugmentは、勾配に基づくアトリビューション手法を用いて画像の重要度マップを計算し、強調された情報豊富な領域を保持することで、データ拡張中に画像の顕著な領域を損なわないシンプルで効果的なデータ拡張手法を提案する。高重要度領域のカットや貼り付けを回避することで、計算コストを増加させることなく忠実度を向上させ、ImageNet、COCO、Market1501などの複数のベンチマークで画像分類、物体検出、マルチカメラトラッキングの分野で最先端の結果を達成している。

ABSTRACT

Data augmentation (DA) is an essential technique for training state-of-the-art deep learning systems. In this paper, we empirically show data augmentation might introduce noisy augmented examples and consequently hurt the performance on unaugmented data during inference. To alleviate this issue, we propose a simple yet highly effective approach, dubbed \emph{KeepAugment}, to increase augmented images fidelity. The idea is first to use the saliency map to detect important regions on the original images and then preserve these informative regions during augmentation. This information-preserving strategy allows us to generate more faithful training examples. Empirically, we demonstrate our method significantly improves on a number of prior art data augmentation schemes, e.g. AutoAugment, Cutout, random erasing, achieving promising results on image classification, semi-supervised image classification, multi-view multi-camera tracking and object detection.

研究の動機と目的

  • 既存のデータ拡張手法がノイズや曖昧な例を導入することでモデル性能が低下する問題に対処すること。
  • 顕著度マップで特定された意味的に重要な領域を保持することで、拡張された学習例の忠実度を向上させること。
  • 追加の監督信号や複雑な訓練を必要とせず、領域レベルおよび画像レベルの両方の拡張を強化できる汎用的で軽量な手法を開発すること。
  • 画像分類、半教師あり学習、マルチビュー追跡、物体検出を含む多様なビジョンタスクにおいて一貫した性能向上を実証すること。

提案手法

  • 本手法は、勾配に基づくアトリビューション手法(例:顕著度マップ)を用いて入力画像内の高重要度領域を特定する。
  • 領域レベルの拡張(例:Cutout)では、顕著度スコアが高い領域をカットまたはマスクしないようにする。
  • 画像レベルの拡張(例:RandAugment、AutoAugment)では、元の画像からの高重要度パッチを再挿入する「ペーストバック」戦略を適用する。
  • バックボーンネットワークを変更せずに既存のデータ拡張パイプラインに統合可能なプラグインモジュールとして実装される。
  • 訓練中に1枚の画像につき1度だけ顕著度マップを計算し、重要度マップに応じてサンプルごとに動的に拡張ポリシーを調整する。
  • ラベル不変性とラベル混合の両方の拡張手法と互換性があり、CutMixなどに対して実証的検証がなされている。

実験結果

リサーチクエスチョン

  • RQ1データ拡張中に顕著な画像領域を保持することで、モデルの一般化性能が向上し、学習におけるノイズが低減するか?
  • RQ2拡張例の忠実度が画像分類および物体検出の下流性能にどのように影響するか?
  • RQ3顕著度マップを用いたシンプルで教師なしの手法が、AutoAugment や CutMix といった強力なベースラインを上回ることができるか?
  • RQ4提案手法は、半教師あり学習やマルチビュー追跡を含む、さまざまなデータ拡張タイプと学習パラダイムに一般化可能か?

主な発見

  • AutoAugmentに上書きして適用した場合、PyramidNet-ShakeDropを用いたCIFAR-10で98.7%のテスト精度を達成し、ベースラインを著しく上回った。
  • COCO 2017物体検出ベンチマークにおいて、ResNet-50を用いたRetinaNetではmAPを37.9から39.1に向上、ResNet-101を用いた場合では39.9から41.2に向上し、Even the Detectron2ベースラインをも上回った。
  • Market1501におけるマルチビュー・マルチカメラトラッキングに適用した場合、最近の最先端の結果をさらに上回った。
  • 半教師あり学習において、ImageNetで事前学習したモデルのCOCO物体検出タスクへの転移性能を向上させた。
  • KeepCutMixで事前学習したモデルはCutMixで学習したモデルを上回り、一部の設定ではCutMixでさえDetectron2ベースラインを下回った。
  • 本手法は複数のアーキテクチャとタスクにわたり有効であり、追加の訓練や監督を必要とせず、一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。