[論文レビュー] Can CNNs Be More Robust Than Transformers?
この論文は、入力画像をパッチに分割し、大きなカーネルサイズ(例:11×11)を採用し、正規化および活性化層を削減するという3つの簡単なアーキテクチャ的変更を組み込むことで、自己注意機構を用いないにもかかわらず、畳み込みニューラルネットワーク(CNNs)がビジョントランスフォーマーと同等またはそれ以上の頑健性を達成できることを示している。その結果得られたRobust-ResNetは、分布外ベンチマークにおいてDeiT-Sを上回り、ImageNet-Rでは4.0%高い正確性を達成し、ImageNet-Sketchでは3.9%高い正確性を示した。
The recent success of Vision Transformers is shaking the long dominance of Convolutional Neural Networks (CNNs) in image recognition for a decade. Specifically, in terms of robustness on out-of-distribution samples, recent research finds that Transformers are inherently more robust than CNNs, regardless of different training setups. Moreover, it is believed that such superiority of Transformers should largely be credited to their self-attention-like architectures per se. In this paper, we question that belief by closely examining the design of Transformers. Our findings lead to three highly effective architecture designs for boosting robustness, yet simple enough to be implemented in several lines of code, namely a) patchifying input images, b) enlarging kernel size, and c) reducing activation layers and normalization layers. Bringing these components together, we are able to build pure CNN architectures without any attention-like operations that are as robust as, or even more robust than, Transformers. We hope this work can help the community better understand the design of robust neural architectures. The code is publicly available at https://github.com/UCSC-VLAA/RobustCNN.
研究の動機と目的
- 自己注意機構のおかげでビジョントランスフォーマーがCNNよりも本質的に頑健であるという一般的な信念に挑戦すること。
- 自己注意機構とは独立して、トランスフォーマーの頑健性向上に寄与する具体的なアーキテクチャ的要素を同定すること。
- 自己注意機構を一切使用しないで、トランスフォーマーと同等またはそれ以上の頑健性を達成できるシンプルで効果的なCNNベースのアーキテクチャを構築すること。
- 頑健性の向上が、訓練の手法やデータ拡張に依存するのではなく、アーキテクチャ設計そのものによって達成できることを実証すること。
提案手法
- 入力画像を重複のないパッチに分割し、大きなパッチサイズが頑健性を向上させることを示した。
- 標準的な小さなカーネル(例:3×3)を大きなカーネル(例:7×7 や 11×11)に置き換えることで、グローバルな受容 field を拡大し、頑健性を向上させた。
- 正規化層(例:BatchNorm)および活性化関数(例:GELU)の数を減らすことで、分布シフトを最小限に抑え、一般化性能を向上させた。
- これらの3つの要素を組み合わせ、変更されたResNetアーキテクチャ(Robust-ResNet)を構築し、それらの統合的影響を評価した。
- 知識蒸留を用い、DeiT-Sを教師モデルとして採用することで、改善がアーキテクチャの要因に起因するものであることを検証した。
- アーキテクチャをより大きなモデル(例:DeiT-Baseレベル)にスケーリングし、設計原理の一般化およびスケーラビリティをテストした。
実験結果
リサーチクエスチョン
- RQ1ビジョントランスフォーマーのうち、分布外の頑健性に最も寄与しているアーキテクチャ的要素は何か?
- RQ2自己注意機構を一切使用しない純粋なCNNアーキテクチャが、ビジョントランスフォーマーと同等またはそれ以上の頑健性を達成できるか?
- RQ3大きなカーネルサイズ、パッチ化、正規化/活性化層の削減といったアーキテクチャ的改善が、異なるモデルスケールやデータセットにおいても有効に機能するか?
- RQ4知識蒸留によって、ビジョントランスフォーマーの頑健性がCNNに転送可能か、それとも頑健性はアーキテクチャそのものに内在するものか?
- RQ5CNNとトランスフォーマーの間の頑健性の差は、アーキテクチャ設計の違いに起因するのか、それとも訓練の手法によるものなのか?
主な発見
- 大きなカーネル(11×11)、パッチ化された入力、正規化/活性化層の削減を施したCNN、Robust-ResNetは、Stylized-ImageNetで16.2%対18.6%の正確性を示し、DeiT-Sを2.4%上回った。
- ImageNet-Rでは、Robust-ResNetが41.9%の正確性を達成したのに対し、DeiT-Sは45.9%であった。4.0%の向上を示し、スタイルや分布シフトに対する優れた頑健性を示した。
- ImageNet-Sketchでは、Robust-ResNetが33.0%の正確性を達成し、DeiT-Sの29.1%を3.9%上回った。多様な分布外ベンチマークにおいて一貫した向上を確認した。
- 同じアーキテクチャ的改善により、正規化層の削減のおかげで23%のトレーニング速度向上が得られ、頑健性向上に加え効率性の向上も達成した。
- DeiT-Sからの知識蒸留は、標準的なResNetsには頑健性を転送できなかったが、提案されたRobust-ResNetには成功した。これにより、頑健性は訓練ではなくアーキテクチャそのものに起因することが確認された。
- DeiT-BaseのFLOPsに相当するスケールに拡張した場合、Robust-ResNetの変種(例:Robust-ResNet-Up-Inverted-DW-B)はImageNet-Rで50.5%の正確性を達成し、DeiT-B(44.7%)を上回った。設計原理のスケーラビリティを実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。