[論文レビュー] Exploring Corruption Robustness: Inductive Biases in Vision Transformers and MLP-Mixers
本稿では、ImageNet-C およびテクスチャ・キューの矛盾を示すデータセットを用いて、事前学習済みモデルを用いて、ビジョントランスフォーマー、MLP-Mixer、CNN の腐敗耐性および形状バイアスを調査する。視覚トランスフォーマーは、CNN や MLP-Mixer よりも本質的に腐敗に対してより耐性があり、より強い形状バイアスを示すことが判明した。DeiT-tiny のような小規模モデルでさえ、パラメータ数が5倍少ないにもかかわらず、ResNet-50 を上回っている。
Recently, vision transformers and MLP-based models have been developed in order to address some of the prevalent weaknesses in convolutional neural networks. Due to the novelty of transformers being used in this domain along with the self-attention mechanism, it remains unclear to what degree these architectures are robust to corruptions. Despite some works proposing that data augmentation remains essential for a model to be robust against corruptions, we propose to explore the impact that the architecture has on corruption robustness. We find that vision transformer architectures are inherently more robust to corruptions than the ResNet-50 and MLP-Mixers. We also find that vision transformers with 5 times fewer parameters than a ResNet-50 have more shape bias. Our code is available to reproduce.
研究の動機と目的
- ビジョントランスフォーマー、MLP-Mixer、CNN の間における腐敗耐性を評価・比較すること。
- 形状バイアスと画像の腐敗に対する耐性との関係を調査すること。
- 自己注意機構に特徴的なアーキテクチャのインダクティブバイアスが、データ拡張とは独立して耐性に寄与するかどうかを特定すること。
- 小規模なビジョントランスフォーマー・モデルが、大規模な CNN よりも耐性および形状バイアスで同等か上回るかどうかを評価すること。
提案手法
- ResNet-50、ビジョントランスフォーマー(ViT、DeiT、Swin、CaiT)、MLP-Mixers(Base、Large)の3つのアーキテクチャにまたがる20個の事前学習済みモデルの評価。
- ImageNet-C における平均腐敗誤差(mCE)の測定により、腐敗耐性を定量化。
- 形状とテクスチャが矛盾するテクスチャ・キュー・コントフリクトデータセットを用いて、形状バイアスを評価。
- モデル間での形状バイアスと mCE の相関分析により、腐敗耐性に及ぼすアーキテクチャ的要因を特定。
- パラメータ数を変化させたモデルの比較により、モデルサイズが耐性およびバイアスに与える影響を評価。
- クリーン画像および腐敗画像における性能評価として、標準的な ImageNet Top-1 精度と mCE を使用。
実験結果
リサーチクエスチョン
- RQ1ビジョントランスフォーマーは、CNN や MLP-Mixer よりも一般的な画像の腐敗に対してより耐性があるか?
- RQ2異なるアーキテクチャ間で、形状バイアスと腐敗耐性の間に相関があるか?
- RQ3小規模なビジョントランスフォーマー・モデルは、大規模な CNN よりも腐敗耐性および形状バイアスが優れているか?
- RQ4自己注意機構のようなアーキテクチャ的インダクティブバイアスが、データ拡張とは独立して耐性に寄与する程度はどの程度か?
- RQ5Swin、DeiT、ViT などの異なるビジョントランスフォーマーのバリエーションは、形状バイアスおよび mCE においてどのように比較されるか?
主な発見
- ビジョントランスフォーマーは、CNN や MLP-Mixer よりも一貫して腐敗耐性が高く、Swin-T_large モデルが mCE 34.63% という最低水準を記録した。
- DeiT_tiny ビジョントランスフォーマー(500万パラメータ)は、形状バイアス 29.37% を達成し、パラメータ数が5倍少ないにもかかわらず、ResNet-50(26.17%)を上回った。
- 形状バイアスと mCE の間に強い逆相関関係が存在する:形状バイアスが高いモデルは腐敗に対してより耐性がある。これは、形状バイアスが耐性を高めるという仮説を支持する。
- MLP-Mixers は中程度の形状バイアス(36.90–38.64%)を示し、ImageNet-C では CNN と同等の性能を示したが、ビジョントランスフォーマーほど耐性が高くなかった。
- Swin-T_large モデルは、最高の Top-1 精度(85.92%)と最低の mCE(34.63%)を達成し、階層的ウィンドウベースの自己注意機構がグローバル表現および耐性を向上させたと考えられる。
- モデルサイズ(パラメータ数)と形状バイアス、mCE の間に明確な相関は認められず、耐性はスケールではなくアーキテクチャ設計に起因していることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。