Skip to main content
QUICK REVIEW

[논문 리뷰] Robustness in deep learning: The good (width), the bad (depth), and the ugly (initialization)

Zhenyu Zhu, Fanghui Liu|arXiv (Cornell University)|2022. 09. 15.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 편미네이션 안정성 지표를 사용하여 넓이, 깊이, 초기화가 딥 뉴럴 네트워크의 평균 적대적 내성에 미치는 영향을 조사한다. 넓이가 과다 매개변수화된 영역에서는 내성을 향상시키지만, 과소 매개변수화된 영역에서는 해로운 영향을 미친다는 것을 보여주며, 깊이의 영향은 초기화에 따라 크게 달라진다—레이시안 초기화에서는 레이지 트레이닝에서 내성을 향상시키지만, 헤이 또는 NTK 초기화에서는 내성을 떨어뜨린다.

ABSTRACT

We study the average robustness notion in deep neural networks in (selected) wide and narrow, deep and shallow, as well as lazy and non-lazy training settings. We prove that in the under-parameterized setting, width has a negative effect while it improves robustness in the over-parameterized setting. The effect of depth closely depends on the initialization and the training mode. In particular, when initialized with LeCun initialization, depth helps robustness with the lazy training regime. In contrast, when initialized with Neural Tangent Kernel (NTK) and He-initialization, depth hurts the robustness. Moreover, under the non-lazy training regime, we demonstrate how the width of a two-layer ReLU network benefits robustness. Our theoretical developments improve the results by [Huang et al. NeurIPS21; Wu et al. NeurIPS21] and are consistent with [Bubeck and Sellke NeurIPS21; Bubeck et al. COLT21].

연구 동기 및 목표

  • 과다 매개변수화가 적대적 내성에 유리한지 해로운지에 대한 이론적 모순을 해결하기 위해.
  • 딥 뉴럴 네트워크의 평균 내성에 영향을 미치는 넓이, 깊이, 초기화의 역할을 분석하기 위해.
  • 다른 학습 영역(레이지 대비 비레이지)과 초기화 방법에 따라 편미네이션 안정성에 대한 이론적 상한을 수립하기 위해.
  • 기존의 내성 연구를 확장하여 과다 및 과소 매개변수화된 설정에서 넓이, 깊이, 초기화의 상호작용을 포함하기 위해.
  • 완전 연결형, 컨볼루션형, 리세드 네트워크에서 이론적 결과를 실험적으로 검증하기 위해.

제안 방법

  • 입력 편미네이션에 대한 네트워크 출력의 기대값을 ℓ₂ 공역 ε 내에서 정의된 기울기의 노름으로 정의한 편미네이션 안정성 지표를 제안한다.
  • 다양한 초기화 방법(레이시안, 헤이, NTK)과 학습 영역(레이지 및 비레이지)에 대해 딥 ReLU 네트워크의 편미네이션 안정성에 대한 이론적 상한을 유도한다.
  • 점근적 분석을 통해 과소 매개변수화 및 과다 매개변수화 설정에서 넓이와 깊이의 내성에 대한 영향을 분석한다.
  • 비레이지 학습 영역에서 두 층의 ReLU 네트워크에 분석을 적용하여 이전 연구보다 향상된 상한을 도출한다.
  • 신경 탄성 커널(NTK) 이론과 랜덤 매트릭스 이론 기법을 활용하여 학습 중 기울기 노름의 행동을 특성화한다.
  • 완전 연결형, 컨볼루션형, ResNet 아키텍처에서 다양한 넓이, 깊이, 초기화 조건에서 이론적 예측을 실험적으로 검증한다.

실험 결과

연구 질문

  • RQ1과소 매개변수화 대비 과다 매개변수화 영역에서 네트워크의 넓이는 평균 내성에 어떻게 영향을 미치는가?
  • RQ2깊이는 내성에 어떻게 영향을 미치며, 이는 초기화 방법에 따라 달라지는가?
  • RQ3학습 영역(레이지 대비 비레이지)이 딥 네트워크의 내성에 미치는 영향은 무엇인가?
  • RQ4다른 초기화 방법—레이시안, 헤이, NTK—은 딥 네트워크의 편미네이션 안정성에 어떻게 영향을 미치는가?
  • RQ5두 층의 네트워크를 초월한 비레이지 학습 영역에서 편미네이션 안정성에 대한 이론적 상한을 확장할 수 있는가?

주요 결과

  • 과다 매개변수화 영역에서는 넓이를 늘일수록 내성이 향상되지만, 과소 매개변수화 영역에서는 처음에는 내성이 악화되었다가 이후에 향상되는 것으로 나타나, 단서 전이 현상이 존재함을 시사한다.
  • 레이시안 초기화와 레이지 학습 조건에서는 깊이가 기하급수적으로 내성을 향상시키며, 이는 상한이 (√2/2)^{L−2}로 스케일링됨으로써 입증된다.
  • 헤이 초기화 및 NTK 초기화 조건에서는 깊이가 다항식적으로 내성을 떨어뜨리며, 헤이 초기화의 경우 상한이 √(L³m/d)로 증가하고, NTK 초기화의 경우 √(L³m/o)e^{−m/L³}로 증가한다.
  • 비레이지 학습 영역에서 두 층의 ReLU 네트워크에서는 넓이가 내성을 향상시키며, Huang 등(2021) 및 Wu 등(2021)의 연구보다 향상된 이론적 상한과 일치한다.
  • 완전 연결형, 컨볼루션형, ResNet 아키텍처에서의 실험 결과는 이론적 경향을 확인한다: 비레이지 설정에서는 넓이가 증가할수록 내성이 향상되고, 헤이 및 NTK 초기화 조건에서는 깊이에 따라 내성이 크게 달라진다.
  • 비레이지 영역의 이론적 상한은 다소 느슨한 편이므로, 두 층을 초월한 딥 네트워크 분석 향상 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.