Skip to main content
QUICK REVIEW

[論文レビュー] RecursiveMix: Mixed Learning with History

Lingfeng Yang, Xiang Li|arXiv (Cornell University)|Mar 14, 2022
Domain Adaptation and Few-Shot Learning被引用数 10
ひとこと要約

RecursiveMix (RM) は、以前の学習イテレーションで得られた歴史的入力-予測-ラベルの三つ組みを再帰的に再利用することで、多様でマルチスケールの混合サンプルを生成する、新しいデータ拡張手法である。計算コストをほとんど増加させることなく、モデルの汎化性能を向上させる。SOTAの性能を達成し、CIFAR-100ではResNet-50を3.2%、ImageNetでは2.8%向上させ、COCOオブジェクト検出ではCutMixを1.4 APポイント上回った。

ABSTRACT

Mix-based augmentation has been proven fundamental to the generalization of deep vision models. However, current augmentations only mix samples at the current data batch during training, which ignores the possible knowledge accumulated in the learning history. In this paper, we propose a recursive mixed-sample learning paradigm, termed "RecursiveMix" (RM), by exploring a novel training strategy that leverages the historical input-prediction-label triplets. More specifically, we iteratively resize the input image batch from the previous iteration and paste it into the current batch while their labels are fused proportionally to the area of the operated patches. Further, a consistency loss is introduced to align the identical image semantics across the iterations, which helps the learning of scale-invariant feature representations. Based on ResNet-50, RM largely improves classification accuracy by $\sim$3.2\% on CIFAR100 and $\sim$2.8\% on ImageNet with negligible extra computation/storage costs. In the downstream object detection task, the RM pretrained model outperforms the baseline by 2.1 AP points and surpasses CutMix by 1.4 AP points under the ATSS detector on COCO. In semantic segmentation, RM also surpasses the baseline and CutMix by 1.9 and 1.1 mIoU points under UperNet on ADE20K, respectively. Codes and pretrained models are available at \url{https://github.com/megvii-research/RecursiveMix}.

研究の動機と目的

  • 現在のバッチのみを用いる既存のミックスベースのデータ拡張手法が、学習履歴に蓄積された貴重な知識を無視しているという限界を是正する。
  • 歴史的入力-予測-ラベル三つ組みが、モデルの汎化性能および特徴学習をどのように向上させられるかを調査する。
  • 反復間における空間的・意味的整合性を明示的に学習する訓練パラダイムを構築し、スケール不変性および空間認識特徴を強化する。
  • 画像分類、検出、セグメンテーションのベンチマークで顕著な性能向上を達成しつつ、追加の計算コストおよびメモリコストを最小限に抑える。
  • オブジェクト検出やセマンティックセグメンテーションなど、空間理解が重要な下流タスクにおいて、再帰的ミキシングの有効性を実証する。

提案手法

  • RecursiveMix は、前回の学習イテレーションの入力バッチを再帰的にリサイズ・貼り付けすることで、現在のバッチに組み込み、再帰的データミキシングパラダイムを形成する。
  • 歴史的および現在のサンプルのラベルは、貼り付け領域の面積に比例して混合係数 λ を用いて融合される。
  • 対応する領域の注目領域(ROI)間の特徴表現を一致させるための整合性損失が導入され、空間的意味的整合性が強制される。
  • 軽量な RoI 演算子とオプションの全結合層を用いて整合性損失を計算し、計算コストを最小限に抑える。
  • 歴史的三つ組み(入力、予測、ラベル)は、1イテレーションのみのミニバッチとして保存されるため、ストレージコストは無視できる。
  • 再帰的ミキシングプロセスにより、データの多様性が向上し、同じインスタンスのマルチスケールおよびマルチスケールのビューが得られ、監視信号が豊かになる。

実験結果

リサーチクエスチョン

  • RQ1現在のバッチのみを用いるのではなく、歴史的入力-予測-ラベル三つ組みを活用することで、深層視覚モデルの汎化能力をさらに向上させられるか?
  • RQ2歴史データを用いた再帰的ミキシングは、特にスケール不変性および空間認識特徴の観点から、特徴学習をどのように向上させるか?
  • RQ3RecursiveMix は、計算コストおよびメモリコストをほとんど増やさずに、画像分類、オブジェクト検出、セマンティックセグメンテーションタスクの性能をどの程度向上させられるか?
  • RQ4歴史的サンプルと現在の混合サンプル間の整合性損失は、標準的なミックス手法と比較して、より正確で頑健な特徴学習をもたらすか?
  • RQ5RecursiveMix は、CutMix や Mixup といった既存のSOTAミックス拡張技術を上回る、シンプルでありながら効果的なベースラインとして機能できるか?

主な発見

  • RecursiveMix は、CIFAR-100 で ResNet-50 の精度を 3.2% 向上させ、ImageNet では 2.8% 向上させ、ベースラインおよび CutMix を顕著に上回った。
  • ATSS ディテクタを用いた COCO オブジェクト検出ベンチマークでは、RM事前学習済みの ResNet-50 がベースラインより 2.1 AP ポイント高く、CutMix よりも 1.4 AP ポイント高い成績を収めた。
  • UperNet を用いた ADE20K におけるセマンティックセグメンテーションでは、RM はベースラインより 1.9 mIoU、CutMix より 1.1 mIoU 高く、密度予測タスクにおける強い汎化性能を示した。
  • これらの向上は、メモリ(5887.0 MB 対 5832.0 MB)とトレーニング時間(73.8 時間)のわずかな増加で達成されており、高い効率性を示した。
  • クラスアクティビティマップの可視化により、RM は Mixup や CutMix よりも多様で複数オブジェクトを含む入力を生成し、意味のある領域の局在化がより良好に行われていることが確認された。
  • 有効なクラス分析により、RM は1枚の画像あたり平均4〜5つのオブジェクトに対して監視を提供しており、ベースライン手法よりも豊かで多様な監視信号を提供していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。