[論文レビュー] Denoising Masked AutoEncoders Help Robust Classification
本稿では、ガウスノイズとパッチマスキングを用いて画像を劣化させ、元の画像を再構築することで、自己教師あり事前学習を行う自己教師付き手法であるDenoising Masked AutoEncoders (DMAE)を提案する。事前学習済みエンコーダーは、先行手法と比較して顕著に少ないパラメータ数でImageNetにおいて最先端の認証可能ロバスト性を達成し、敵対的攻撃下でもより大きなモデルを上回るロバスト精度を示した。
In this paper, we propose a new self-supervised method, which is called Denoising Masked AutoEncoders (DMAE), for learning certified robust classifiers of images. In DMAE, we corrupt each image by adding Gaussian noises to each pixel value and randomly masking several patches. A Transformer-based encoder-decoder model is then trained to reconstruct the original image from the corrupted one. In this learning paradigm, the encoder will learn to capture relevant semantics for the downstream tasks, which is also robust to Gaussian additive noises. We show that the pre-trained encoder can naturally be used as the base classifier in Gaussian smoothed models, where we can analytically compute the certified radius for any data point. Although the proposed method is simple, it yields significant performance improvement in downstream classification tasks. We show that the DMAE ViT-Base model, which just uses 1/10 parameters of the model developed in recent work arXiv:2206.10550, achieves competitive or better certified accuracy in various settings. The DMAE ViT-Large model significantly surpasses all previous results, establishing a new state-of-the-art on ImageNet dataset. We further demonstrate that the pre-trained model has good transferability to the CIFAR-10 dataset, suggesting its wide adaptability. Models and code are available at https://github.com/quanlin-wu/dmae.
研究の動機と目的
- 画像分類における認証可能な敵対的防御のためのロバスト性を向上させる自己教師あり事前学習手法を開発すること。
- 従来の2段階モデルがノイズ除去と分類のための別々の学習を必要とし、大規模なパラメータ数を要するという制限を克服すること。
- 単一でコンactなビジョントランスフォーマーが統合的な事前学習目的を通じてロバストで転移可能な表現を学習できることを示すこと。
- 既存の手法と比較して顕著に少ないパラメータ数でImageNetにおいて最先端の認証可能精度を達成すること。
提案手法
- 各画素にガウスノイズを追加し、ランダムにパッチをマスキングすることで、入力画像を劣化させ、ノイズが多くかつ一部が隠された入力を生成する。
- 腐敗させた入力を元の綺麗な画像に再構築するように、ビジョントランスフォーマーのエンコーダ-デコーダー・モデルを訓練する。この際、ノイズ除去の監視情報を含むマスクドオートエンコーディング目的関数を用いる。
- 事前学習済みエンコーダーをガウスノイズスムージングモデルにおけるベース分類器として用い、ノイズが付加された入力の期待値を用いて解析的にロバスト性を認証する。
- 標準的なクロスエントロピー損失または一貫性正則化を用いて、ImageNet上でエンコーダーを微調整し、下流タスクにおけるロバスト精度を向上させる。
- モデルの固有のノイズおよびマスキングパッチへのロバスト性を活用し、追加の敵対的データを用いずに認証可能ロバスト性を向上させる。
- ラベルなしでImageNet上で事前学習を行い、その後最小限の微調整で下流タスクに適応させることで、強力な転移性を示した。
実験結果
リサーチクエスチョン
- RQ1単一でコンパクトなビジョントランスフォーマーは、統合的な自己教師あり事前学習目的を通じて、ロバストで意味的に意味のある表現を学習できるか?
- RQ2ノイズ劣化とパッチマスキングの両方を事前学習に組み込むことで、標準的なマスクドオートエンコーディングに比べてより優れた認証可能ロバスト性が得られるか?
- RQ3より大きな2段階モデルと比較して、より小さなモデルがImageNetにおいて最先端の認証可能精度を達成できるか?
- RQ4事前学習の長さが、ガウススムージングフレームワークにおける下流の認証可能ロバスト性にどのように影響するか?
- RQ5事前学習済みDMAEエンコーダーは、CIFAR-10などの他のデータセットへどの程度転移可能か?
主な発見
- DMAE ViT-Base(87Mパラメータ)は、Carliniら(2022年)の研究で使用された10倍のパラメータ数を要するモデルと比較して、競争力あるか、それ以上の認証可能精度を達成した。
- DMAE ViT-Large(304Mパラメータ)は、すべてのテスト済みの$σ$および$r$設定において、ImageNetで新たな最先端の認証可能精度を確立した。
- 1100エポックで事前学習されたモデルは、700エポックのバージョンを常に上回り、より長い事前学習が下流のロバスト性を向上させることを示した。
- 一貫性正則化(CR)による微調整は、標準的な学習(RS)と比較して、$r=3.0$で最大5.7%の認証可能精度の向上をもたらした。これは、既存の防御手法と強い相性であることを示した。
- 事前学習済みDMAEモデルは強力な転移性を示し、CIFAR-10に微調整した際に顕著な性能向上を達成した。これは、ImageNetを越えた幅広い応用可能性を示している。
- 高いノイズレベル($\sigma=1.0$)下でも、DMAEモデルは強力な性能を維持したが、MAEは一般化できず、追加ノイズに対する強化されたロバスト性を証明した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。