Skip to main content
QUICK REVIEW

[論文レビュー] Why Robust Generalization in Deep Learning is Difficult: Perspective of Expressive Power

Binghui Li, Jikai Jin|arXiv (Cornell University)|May 27, 2022
Machine Learning and Algorithms被引用数 6
ひとこと要約

この論文は、ReLUネットワークの表現力の分析を通じて、高 robust 訓練精度を達成しても、深層学習におけるロバスト一般化がなぜ困難なままであるかを説明している。well-separatedなデータに対しては、低ロバスト一般化誤差を達成するには、データ次元 d に対して指数関数的に増大するネットワークサイズが必要であることが示され、標準的一般化が容易であっても、ロバスト学習における根本的な表現力の限界が明らかになった。

ABSTRACT

It is well-known that modern neural networks are vulnerable to adversarial examples. To mitigate this problem, a series of robust learning algorithms have been proposed. However, although the robust training error can be near zero via some methods, all existing algorithms lead to a high robust generalization error. In this paper, we provide a theoretical understanding of this puzzling phenomenon from the perspective of expressive power for deep neural networks. Specifically, for binary classification problems with well-separated data, we show that, for ReLU networks, while mild over-parameterization is sufficient for high robust training accuracy, there exists a constant robust generalization gap unless the size of the neural network is exponential in the data dimension $d$. This result holds even if the data is linear separable (which means achieving standard generalization is easy), and more generally for any parameterized function classes as long as their VC dimension is at most polynomial in the number of parameters. Moreover, we establish an improved upper bound of $\exp({\mathcal{O}}(k))$ for the network size to achieve low robust generalization error when the data lies on a manifold with intrinsic dimension $k$ ($k \ll d$). Nonetheless, we also have a lower bound that grows exponentially with respect to $k$ -- the curse of dimensionality is inevitable. By demonstrating an exponential separation between the network size for achieving low robust training and generalization error, our results reveal that the hardness of robust generalization may stem from the expressive power of practical models.

研究の動機と目的

  • 近似的にゼロのロバスト訓練誤差を達成しているにもかかわらず、なぜロバスト一般化誤差が依然として高いままなのかを理解すること。
  • データの分離可能性や低固有次元性が、ロバスト性一般化ギャップを軽減できるかどうかを調査すること。
  • 表現力(特にネットワークサイズと VC次元)がロバスト一般化性能に与える役割を分析すること。
  • 異なるデータ仮定のもとで、低ロバスト一般化誤差を達成するために必要なネットワークサイズの理論的下界および上界を確立すること。

提案手法

  • VC次元および被覆数を用いて表現能力を制限するReLUネットワークの理論的分析。
  • 非負のリッチィ曲率を持つリーマン多様体とパッキング数の議論を用いて、ネットワークサイズの下界を構築。
  • ビショップ=クロモフ体積比較定理を用いて、多様体内の測地線球の体積を制限。
  • ニヤギ・スメール・ヴァインバーガーの多様体学習フレームワークを応用し、データの幾何構造と一般化の関係を関連。
  • k次元多様体上に存在するデータに対して、ネットワークサイズの下界を Ω((2ε√(d/k))⁻ᵏ/²) として導出。
  • ロバスト一般化誤差の一般化下界を証明し、ネットワークサイズが d に対して指数関数的に増大しない限り、誤差は指数関数的に増大することを示した。

実験結果

リサーチクエスチョン

  • RQ1既存のロバスト訓練手法は、ほぼ完璧なロバスト訓練精度を達成しているが、なぜ一般化に失敗するのか?
  • RQ2データの分離可能性や低固有次元性が、ロバスト一般化に必要なネットワークサイズを低減できるか?
  • RQ3ロバスト一般化ギャップは根本的に深層ネットワークの表現力の限界に起因しているのか?
  • RQ4高次元空間における分離可能なデータに対して、低ロバスト一般化誤差を達成するために必要な最小ネットワークサイズは何か?
  • RQ5データの固有次元 k が、ロバスト一般化に必要なネットワークサイズにどのように影響するか?

主な発見

  • d次元空間におけるwell-separatedなデータに対しては、低ロバスト一般化誤差を達成するには、標準的一般化が自明であっても、ReLUネットワークのサイズがdに対して指数関数的に増大する必要がある。
  • データの分離可能性にかかわらず、ロバスト一般化ギャップは、ネットワークサイズがデータ次元 d に対して指数関数的に増大しない限り避けられない。
  • データがk次元多様体上に存在し、k ≪ d である場合、低ロバスト一般化誤差を達成するために必要なネットワークサイズは、exp(O(k)) で上界が与えられ、固有次元に応じてスケーラビリティが向上することが示された。
  • 一致する下界により、ロバスト一般化誤差が高くなるのは、ネットワークサイズがkに対して指数関数的に増大しない限り避けられないことが示され、次元の呪いが本質的であることが明らかになった。
  • 実用的なモデルの表現力は、分離可能性や低固有次元といった好都合なデータ条件が整っていても、ロバスト一般化ギャップを埋めるのに不十分である。
  • この論文は、低ロバスト訓練誤差を達成するために必要なネットワークサイズと、低ロバスト一般化誤差を達成するために必要なネットワークサイズとの間に指数的ギャップが存在することを確立し、ロバスト深層学習の核心的な難しさを説明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。