Skip to main content
QUICK REVIEW

[論文レビュー] Shape-Texture Debiased Neural Network Training

Yingwei Li, Qihang Yu|arXiv (Cornell University)|Oct 12, 2020
Adversarial Robustness in Machine Learning参考文献 48被引用数 5
ひとこと要約

本論文は、形状とテクスチャの相反する手がかりを含む画像をトレーニングデータに追加することで、CNNの一般化性能とロバスト性を向上させる形状-テクスチャのバイアス除去ニューラルネットワークトレーニング手法を提案する。この手法では、両方の手がかりからの共同監視を提供する。ResNet-152を用いた実験で、ImageNet(+1.2% top-1精度)、ImageNet-A(+5.2%)、ImageNet-C(+8.3%)、Stylized-ImageNet(+11.1%)、FGSMに対する敵対的防御(+14.4%)において最先端の性能を達成し、MixupおよびCutMixとも互換性がある。

ABSTRACT

Shape and texture are two prominent and complementary cues for recognizing objects. Nonetheless, Convolutional Neural Networks are often biased towards either texture or shape, depending on the training dataset. Our ablation shows that such bias degenerates model performance. Motivated by this observation, we develop a simple algorithm for shape-texture debiased learning. To prevent models from exclusively attending on a single cue in representation learning, we augment training data with images with conflicting shape and texture information (eg, an image of chimpanzee shape but with lemon texture) and, most importantly, provide the corresponding supervisions from shape and texture simultaneously. Experiments show that our method successfully improves model performance on several image recognition benchmarks and adversarial robustness. For example, by training on ImageNet, it helps ResNet-152 achieve substantial improvements on ImageNet (+1.2%), ImageNet-A (+5.2%), ImageNet-C (+8.3%) and Stylized-ImageNet (+11.1%), and on defending against FGSM adversarial attacker on ImageNet (+14.4%). Our method also claims to be compatible with other advanced data augmentation strategies, eg, Mixup, and CutMix. The code is available here: https://github.com/LiYingwei/ShapeTextureDebiasedTraining.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)の表現学習における形状またはテクスチャへの固有のバイアスが、標準的およびロバスト性ベンチマークの性能を低下させることを是正する。
  • 形状とテクスチャの表現を統合することで、一般化性能および敵対的ロバスト性が向上するかどうかを調査する。
  • 形状とテクスチャの相関関係を明示的に破壊しながら、二重の監視信号を保持するデータ拡張戦略を開発する。
  • 既存の高度なデータ拡張技術(例:MixupやCutMix)と統合可能なことを実証する。
  • 画像分類の範囲を超えて、セマンティックセグメンテーションへの応用可能性を示す、バイアス除去フレームワークの拡張を目的とする。

提案手法

  • 2つのランダムに選択された画像間でスタイル変換を適用し、AdaINを用いて一方の画像のテクスチャを他方の画像の形状に移すことで、手がかりの相反する画像を生成する。
  • 両方の元画像の正例ラベルを組み合わせることで、各相反画像に対してソフトラベルを構築し、形状およびテクスチャ両方からの監視を保証する。
  • 形状およびテクスチャの両方の監視を組み込んだ統合損失関数を用いてモデルを訓練し、片方の手がかりに過剰に依存するのを防ぐ。
  • スタイル変換中にオブジェクトの境界を保持するために、スタイライゼーション係数(α=0.2)および形状-テクスチャ係数(γ=0.95)を用いる。
  • 画像分類およびセマンティックセグメンテーションの両タスクに本手法を適用し、セグメンテーション固有の要件に応じてデータ生成およびラベル構成を調整する。
  • CutMixやMixupなどの既存のデータ拡張戦略と統合し、直交的な性能向上を示す。

実験結果

リサーチクエスチョン

  • RQ1形状とテクスチャの相反する手がかりを持つ画像でCNNをトレーニングすることで、標準的および損傷を加えた画像ベンチマークにおける一般化性能が向上するか?
  • RQ2トレーニング中に形状とテクスチャの両方の監視を組み合わせることで、モデルが片方の手がかりに偏るバイアスが効果的に低減されるか?
  • RQ3本手法は、vanillaトレーニングや他のデータ拡張技術と比較して、敵対的攻撃に対するロバスト性に優れているか?
  • RQ4バイアス除去フレームワークは、セマンティックセグメンテーションのような密度予測タスクへも拡張可能か?
  • RQ5本手法は、CutMix や Mixup といった既存の高度なデータ拡張戦略と互換性があり、相乗効果を発揮するか?

主な発見

  • 本手法を用いてトレーニングしたResNet-152は、ImageNetで79.8%のtop-1精度を達成し、ベースラインモデルと比較して+1.2%の絶対的向上を示した。
  • バイアス除去モデルは、ImageNet-Aで+5.2%、ImageNet-Cで+8.3%、Stylized-ImageNetで+11.1%のロバストネス向上を示した。
  • 敵対的ロバストネスの観点では、ImageNetにおけるFGSM攻撃に対して、クリーン精度が+14.4%向上した。
  • CutMixと組み合わせた場合、CutMix-ResNeXt-101のImageNetにおけるtop-1精度は81.2%に向上し、ベースラインと比較して+0.7%の向上を示した。
  • セマンティックセグメンテーションでは、DeepLabv3-ResNet-101が77.6%のmIOUを達成し、ベースラインのvanillaモデルより1.1%、2倍のトレーニングスケジュールベースラインより0.9%優れた性能を示した。
  • 本手法は、より長いトレーニングスケジュールと比較しても有効であるため、性能向上は能力の増大によるものではなく、より優れた表現学習に起因することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。