Skip to main content
QUICK REVIEW

[論文レビュー] SnapMix: Semantically Proportional Mixing for Augmenting Fine-grained Data

Shaoli Huang, Xinchao Wang|arXiv (Cornell University)|Dec 9, 2020
Advanced Neural Network Applications参考文献 35被引用数 8
ひとこと要約

SnapMixは、クラスアクティベーションマップ(CAM)を用いて意味的構成を推定することで、ラベルノイズを低減する、細分化画像認識のための新しいデータ拡張手法を提案する。ピクセルベースの混合とは異なり、領域の面積比ではなく意味的関連性に基づいてラベルの割合を計算するため、ResNet や DenseNet アーキテクチャを含む、さまざまなデータセットおよびネットワークの深さにおいて一貫して既存手法を上回る性能を発揮する。

ABSTRACT

Data mixing augmentation has proved effective in training deep models. Recent methods mix labels mainly based on the mixture proportion of image pixels. As the main discriminative information of a fine-grained image usually resides in subtle regions, methods along this line are prone to heavy label noise in fine-grained recognition. We propose in this paper a novel scheme, termed as Semantically Proportional Mixing (SnapMix), which exploits class activation map (CAM) to lessen the label noise in augmenting fine-grained data. SnapMix generates the target label for a mixed image by estimating its intrinsic semantic composition, and allows for asymmetric mixing operations and ensures semantic correspondence between synthetic images and target labels. Experiments show that our method consistently outperforms existing mixed-based approaches on various datasets and under different network depths. Furthermore, by incorporating the mid-level features, the proposed SnapMix achieves top-level performance, demonstrating its potential to serve as a solid baseline for fine-grained recognition. Our code is available at https://github.com/Shaoli-Huang/SnapMix.git.

研究の動機と目的

  • 細分化認識に応用された既存のデータ混合手法において深刻なラベルノイズが生じる問題に対処すること。
  • 合成画像とそのラベルの間の意味的整合性を保証することで、データ拡張の効果を高めること。
  • 画像ブレンドとラベルブレンドを分離することで、多様性を高めつつラベルの一貫性を維持できる非対称な混合操作を可能にすること。
  • 浅いネットワークでも良好に動作する、堅牢で汎用的なベースラインを構築すること。

提案手法

  • 各ピクセルがその予測クラスに対してどの程度意味的に関連しているかを推定するために、クラスアクティベーションマップ(CAM)を用いる。
  • CAMを正規化して、各ピクセルの値がそのクラスへの相対的寄与度を表す「意味的パーセントマップ(SPM)」に変換する。
  • SPM値を領域内に集計することで、画像領域の意味的構成の内在的割合を計算する。
  • ピクセル領域の面積比ではなく、意味的割合に基づいてラベルを混合することで、実際の意味的コンテンツとより整合性の高いラベル混合を実現する。
  • 画像ブレンドとラベルブレンドを分離することで、非対称なカットアンドペースト混合を可能にし、多様な拡張を実現する。
  • ハイパーパrameter α を用いたベータ分布を用いて、ランダムなパッチのサンプリングを行う。実験により、α の変化に対して高いロバストネスを示した。

実験結果

リサーチクエスチョン

  • RQ1CAMを用いた意味的構成推定は、細分化認識における混合データのラベルノイズを低減できるか?
  • RQ2面積ベースの混合と比較して、意味的割合に基づく混合は、モデルの精度および一般化性能において優れているか?
  • RQ3非対称な混合操作は、ラベルの一貫性を損なわずにデータの多様性を向上させられるか?
  • RQ4ImageNetの事前学習なしで訓練を開始した場合、SnapMixはどの程度の性能を示すか?
  • RQ5提案手法は、さまざまなCNNアーキテクチャおよびハイパーパrameter設定においてロバストであるか?

主な発見

  • CUBでResNet-18を用いてスクラッチから訓練した場合、SnapMixは70.31%のトップ1精度を達成し、CutMix(60.03%)およびMixUp(67.63%)を上回った。
  • CUBデータセットにおいて、SnapMixはResNet-50の精度をベースラインの66.92%から72.39%まで向上させ、CutMixおよびMixUpを上回った。
  • InceptionV3を用いた場合、SnapMixは85.54%の精度を達成し、CutMix(84.31%)およびMixUp(83.83%)を上回った。
  • DenseNet121を用いた場合、SnapMixは87.42%の精度に達し、CutMix(86.11%)およびMixUp(86.65%)に対して顕著な向上を示した。
  • ハイパーパrameter α に対してロバストであり、テストされた値の範囲で精度が87.37%を中心に±0.5%以内で変動した。
  • アブレーションスタディの結果、意味的割合に基づくラベル混合が性能向上の主因であり、非対称混合はわずかだが一貫した改善をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。