Skip to main content
QUICK REVIEW

[논문 리뷰] Why Robust Generalization in Deep Learning is Difficult: Perspective of Expressive Power

Binghui Li, Jikai Jin|arXiv (Cornell University)|2022. 05. 27.
Machine Learning and Algorithms인용 수 6
한 줄 요약

이 논문은 ReLU 네트워크의 표현 능력을 분석함으로써, 높은 강건 훈련 정확도를 달성함에도 불구하고 딥 러닝에서 강건 일반화가 여전히 어려운 이유를 설명한다. 잘 분리된 데이터에 대해선 낮은 강건 일반화 오차를 달성하기 위해 데이터 차원 d에 대해 지수적으로 증가하는 네트워크 크기가 필요하며, 이는 표준 일반화가 쉬운 경우에도 마찬가지로 적용됨을 입증함으로써 강건 학습에서의 근본적인 표현 능력 한계를 드러낸다.

ABSTRACT

It is well-known that modern neural networks are vulnerable to adversarial examples. To mitigate this problem, a series of robust learning algorithms have been proposed. However, although the robust training error can be near zero via some methods, all existing algorithms lead to a high robust generalization error. In this paper, we provide a theoretical understanding of this puzzling phenomenon from the perspective of expressive power for deep neural networks. Specifically, for binary classification problems with well-separated data, we show that, for ReLU networks, while mild over-parameterization is sufficient for high robust training accuracy, there exists a constant robust generalization gap unless the size of the neural network is exponential in the data dimension $d$. This result holds even if the data is linear separable (which means achieving standard generalization is easy), and more generally for any parameterized function classes as long as their VC dimension is at most polynomial in the number of parameters. Moreover, we establish an improved upper bound of $\exp({\mathcal{O}}(k))$ for the network size to achieve low robust generalization error when the data lies on a manifold with intrinsic dimension $k$ ($k \ll d$). Nonetheless, we also have a lower bound that grows exponentially with respect to $k$ -- the curse of dimensionality is inevitable. By demonstrating an exponential separation between the network size for achieving low robust training and generalization error, our results reveal that the hardness of robust generalization may stem from the expressive power of practical models.

연구 동기 및 목표

  • 근본적인 강건 훈련 오차가 거의 0에 가까운데도 불구하고 강건 일반화 오차가 여전히 높은 이유를 이해하는 것.
  • 데이터의 분리 가능성과 낮은 내재 차원성이 강건성 일반화 갭을 완화할 수 있는지 조사하는 것.
  • 표현 능력, 특히 네트워크 크기와 VC 차원이 강건 일반화 성능에 미치는 영향을 분석하는 것.
  • 다양한 데이터 가정 하에 낮은 강건 일반화 오차를 달성하기 위해 필요한 네트워크 크기의 이론적 하한 및 상한을 설정하는 것.

제안 방법

  • 표현 능력을 제한하기 위해 VC 차원과 코팅 수를 사용한 ReLU 네트워크의 이론적 분석.
  • 비음성 Ricci 곡률을 가진 리만 다양체와 패킹 수를 이용한 네트워크 크기 하한의 구성.
  • 지오데식 볼의 부피를 유도하기 위해 Bishop-Gromov 부피 비교 정리를 사용.
  • 데이터 기하학과 일반화를 연결하기 위해 Niyogi-Smale-Weinberger 다양체 학습 프레임워크를 적용.
  • k차원 다양체 위의 데이터에 대해 네트워크 크기의 하한을 Ω((2ε√(d/k))⁻ᵏ/²)로 유도.
  • 일반적인 하한을 증명하여, 네트워크 크기가 d에 대해 지수적으로 증가하지 않는 한 강건 일반화 오차는 지수적으로 증가함을 입증.

실험 결과

연구 질문

  • RQ1기존의 강건 훈련 방법들은 거의 완벽한 강건 훈련 정확도를 달성하지만, 왜 강건하게 일반화하지 못하는가?
  • RQ2데이터의 분리 가능성이나 낮은 내재 차원성이 강건 일반화를 위한 네트워크 크기를 줄일 수 있는가?
  • RQ3강건 일반화 갭은 근본적으로 딥 네트워크의 표현 능력 한계 때문인가?
  • RQ4고차원에서 분리된 데이터에 대해 낮은 강건 일반화 오차를 달성하기 위한 최소 네트워크 크기는 얼마인가?
  • RQ5데이터의 내재 차원 k가 강건 일반화를 위한 네트워크 크기에 어떤 영향을 미치는가?

주요 결과

  • d차원 공간에서 잘 분리된 데이터에 대해선 낮은 강건 일반화 오차를 달성하기 위해 ReLU 네트워크 크기가 d에 대해 지수적으로 증가해야 하며, 이는 표준 일반화가 매우 쉬운 경우에도 마찬가지다.
  • 데이터의 분리 가능성과 관계없이, 네트워크 크기가 데이터 차원 d에 대해 지수적으로 증가하지 않는 한 강건 일반화 갭은 피할 수 없다.
  • 데이터가 k차원 다양체 위에 있고 k ≪ d일 경우, 낮은 강건 일반화 오차를 달성하기 위해 필요한 네트워크 크기는 exp(O(k)) 이하로 제한되며, 이는 내재 차원에 따라 개선된 스케일러빌리티를 보여준다.
  • 일치하는 하한을 통해 강건 일반화 오차가 k에 대해 지수적으로 증가하지 않는 한 여전히 높게 유지됨을 입증함으로써, 내재 차원에 대한 본질적인 차원의 저주를 확인한다.
  • 실제 모델의 표현 능력은 분리 가능성과 낮은 내재 차원과 같은 유리한 데이터 조건 하에서도 여전히 강건 일반화 갭을 메울 수 없으며, 이는 표현 능력의 한계를 보여준다.
  • 논문은 낮은 강건 훈련 오차를 달성하기 위해 필요한 네트워크 크기와 낮은 강건 일반화 오차를 달성하기 위해 필요한 네트워크 크기 사이에 지수적 분리가 존재함을 확립하며, 강건 딥 러닝의 핵심 곤경을 설명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.