Skip to main content
QUICK REVIEW

[論文レビュー] A Winning Hand: Compressing Deep Networks Can Improve Out-Of-Distribution Robustness

James Diffenderfer, Brian R. Bartoldson|arXiv (Cornell University)|Jun 16, 2021
Generative Adversarial Networks and Image Synthesis被引用数 12
ひとこと要約

本稿では、ロットゥリーチ・スタイルのプルーニングと量子化が、コンパクトで正確かつ頑健な(CARD)深層ニューラルネットワークを生成できることを示している。驚くべきことに、これらの手法は、より大きなモデルよりも分布外(OOD)の頑健性を向上させる。スパースでバイナリ重みを持つCARDを訓練し、スペクトル類似度ゲーティングを用いたドメイン適応型CARD-Deckを用いることで、CIFAR-10-C(96.8%の標準的、92.75%の頑健性)およびCIFAR-100-C(80.6%の標準的、71.3%の頑健性)で最先端の性能を達成し、メモリ使用量を低く抑えている。

ABSTRACT

Successful adoption of deep learning (DL) in the wild requires models to be: (1) compact, (2) accurate, and (3) robust to distributional shifts. Unfortunately, efforts towards simultaneously meeting these requirements have mostly been unsuccessful. This raises an important question: Is the inability to create Compact, Accurate, and Robust Deep neural networks (CARDs) fundamental? To answer this question, we perform a large-scale analysis of popular model compression techniques which uncovers several intriguing patterns. Notably, in contrast to traditional pruning approaches (e.g., fine tuning and gradual magnitude pruning), we find that "lottery ticket-style" approaches can surprisingly be used to produce CARDs, including binary-weight CARDs. Specifically, we are able to create extremely compact CARDs that, compared to their larger counterparts, have similar test accuracy and matching (or better) robustness -- simply by pruning and (optionally) quantizing. Leveraging the compactness of CARDs, we develop a simple domain-adaptive test-time ensembling approach (CARD-Decks) that uses a gating module to dynamically select appropriate CARDs from the CARD-Deck based on their spectral-similarity with test samples. The proposed approach builds a "winning hand'' of CARDs that establishes a new state-of-the-art (on RobustBench) on CIFAR-10-C accuracies (i.e., 96.8% standard and 92.75% robust) and CIFAR-100-C accuracies (80.6% standard and 71.3% robust) with better memory usage than non-compressed baselines (pretrained CARDs and CARD-Decks available at https://github.com/RobustBench/robustbench). Finally, we provide theoretical support for our empirical findings.

研究の動機と目的

  • コンパクトで正確かつ頑健な(CARD)深層ニューラルネットワークが、それまでのこれらの特性の統合に失敗したにもかかわらず、存在可能かどうかを調査すること。
  • 特にロットゥリーチ・スタイルのプルーニングを含むモデル圧縮技術が、OOD頑健性を損なうのではなく、向上させることを特定すること。
  • 分布シフト下での頑健性向上を図るため、CARDのコンパクト性を活用した動的アンサンブル戦略の開発。
  • 圧縮による頑健性向上の経験的発見を理論的に裏付けること。

提案手法

  • スパースでバイナリ重みを持つニューラルネットワークを、高い精度と頑健性を達成するために、ロットゥリーチ・スタイルのプルーニングと量子化を適用する。
  • CARD-Deckフレームワークの導入:テスト入力とのスペクトル類似度に基づいて、ゲーティングモジュールによって選択されたCARDの動的アンサンブル。
  • テストサンプルとCARD間のスペクトル類似度を用いて、テスト時における適応的モデル選択を支援する。
  • トレーニング中にデータ拡張(例:AugMix、ガウスノイズ)を活用し、個々のCARDの汎化性能と頑健性を向上させる。
  • 条件付きワサーラインステル距離を用いた理論的分析により、アンサンブル設定におけるOODシフトと一般化誤差の上限を導出する。
  • 経験的頑健性、一般化ギャップ、分布シフトの成分に分離可能な頑健性分解を導出する。

実験結果

リサーチクエスチョン

  • RQ1モデル圧縮を用いて、コンパクトで正確かつ頑健な深層ニューラルネットワーク(CARD)を構築可能か?
  • RQ2ロットゥリーチ・スタイルのプルーニングと量子化が、OOD頑健性を低下させるのではなく、向上させるか?
  • RQ3データ拡張のような既存の頑健性技術を、CARDと効果的に組み合わせて性能をさらに向上できるか?
  • RQ4CARDのコンパクト性が、標準アンサンブルを上回る効率的で適応的なアンサンブル戦略の実現を可能にするか?
  • RQ5観察された圧縮による頑健性向上の背後にある理論的基盤はあるか?

主な発見

  • ロットゥリーチ・スタイルのプルーニングと量子化により、高精度を維持しながら、より大きなフルプレシジョンモデルよりもOOD頑健性を向上させるCARDが得られる。
  • 提案されたCARD-Deckフレームワークは、CIFAR-10-Cで96.8%の標準的精度と92.75%の頑健性精度を達成し、新しいSoTAを樹立し、非圧縮ベースラインを上回っている。
  • CIFAR-100-Cでは、80.6%の標準的精度と71.3%の頑健性精度を達成し、再び低メモリ使用量で新しいSoTAを樹立している。
  • CARD-Deckにおけるスペクトル類似度に基づくゲーティングは、腐食タイプごとに最良の性能を示すCARDを一貫して選択し、多様な分布シフト下での頑健性を向上させている。
  • 理論的分析により、圧縮による頑健性向上は、一般化誤差と分布シフト誤差が有界であることに起因しており、経験的発見を裏付けている。
  • 本研究は、CARD仮説を検証した:頑健でコンパクトなネットワークは訓練の初期段階に存在し、ロットゥリーチ・イニシャライゼーションを用いて同定可能であり、ロットゥリーチの原則を頑健性へと拡張できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。