Skip to main content
QUICK REVIEW

[논문 리뷰] Function Norms and Regularization in Deep Networks

Amal Rannen Triki, Maxim Berman|arXiv (Cornell University)|2017. 10. 18.
Neural Networks and Applications참고 문헌 41인용 수 5
한 줄 요약

이 논문은 깊이 있는 신경망의 새로운 정규화 방법으로 가중 함수 노름의 확률적 근사를 제안하며, 함수 복잡도를 직접 페널라이징하는 데 어려움을 해결한다. 함수 노름을 계산하는 것이 ReLU 네트워크에서 NP-난이도임을 증명하여 근사화가 필요한 이유를 정당화하고, 이미지 분류 및 분할 작업에서 기존의 가중치 감소, 드롭아웃, 배치 정규화와 비교해 일반화 성능 향상이 실제로 이루어지는 것으로 실험적으로 보여준다.

ABSTRACT

Deep neural networks (DNNs) have become increasingly important due to their excellent empirical performance on a wide range of problems. However, regularization is generally achieved by indirect means, largely due to the complex set of functions defined by a network and the difficulty in measuring function complexity. There exists no method in the literature for additive regularization based on a norm of the function, as is classically considered in statistical learning theory. In this work, we propose sampling-based approximations to weighted function norms as regularizers for deep neural networks. We provide, to the best of our knowledge, the first proof in the literature of the NP-hardness of computing function norms of DNNs, motivating the necessity of an approximate approach. We then derive a generalization bound for functions trained with weighted norms and prove that a natural stochastic optimization strategy minimizes the bound. Finally, we empirically validate the improved performance of the proposed regularization strategies for both convex function sets as well as DNNs on real-world classification and image segmentation tasks demonstrating improved performance over weight decay, dropout, and batch normalization. Source code will be released at the time of publication.

연구 동기 및 목표

  • 깊이 있는 신경망에서 일반적으로 가중치 감소와 같은 간접적 방법으로 정규화되는 바, 직접적인 함수 노름 정규화의 부족을 해결하기 위해.
  • ReLU 기반의 깊이 있는 네트워크에서 함수 노름을 계산하는 것이 NP-난이도임을 입증하여 근사 기반 접근법의 필요성을 정당화하기 위해.
  • 원칙적인 정규화를 위해 가중 함수 노름을 근사하는 확률적 최적화 프레임워크를 개발하기 위해.
  • 실제 비전 작업에서 표준 기준 대비 함수 노름 정규화가 일반화 성능 향상에 기여하는지 실험적으로 검증하기 위해.
  • 함수 노름 정규화에 기반한 고전적 학습 이론과 이러한 정규화가 없는 딥러닝 간의 격차를 메우기 위해.

제안 방법

  • 샘플링 기반의 가중 $L_2$ 함수 노름 근사를 정규화자로 제안하여 확률적 최적화를 가능하게 한다.
  • ReLU 기반의 깊이 있는 네트워크에서 함수 노름을 계산하는 것이 NP-난이도임을 증명하여 근사화의 이론적 동기를 확립한다.
  • 기대 오차를 제어하는 직접적인 함수 노름 정규화의 효과를 보여주는 일반화 경계를 유도한다. 이는 라데마처 복잡도 경계와 유사하다.
  • 함수 노름을 근사하기 위해 입력을 샘플링하는 방식으로 일반화 경계를 최소화하는 확률적 최적화 전략을 도입한다.
  • 역전파 알고리즘을 사용해 근사된 함수 노름의 기울기를 계산하여 엔드 투 엔드 학습을 가능하게 한다.
  • 분리된 데이터 세트에서의 비라벨 데이터를 사용해 입력을 샘플링하여 함수 노름 근사를 위한 근거를 마련함으로써, 반감독 정규화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1가중치 감소와 같은 간접적 측정 대신 함수의 노름을 직접 사용해 깊이 있는 신경망을 정규화하는 것이 가능한가?
  • RQ2ReLU 기반의 깊이 있는 신경망에서 함수 노름을 계산하는 데 필요한 계산 복잡도는 무엇인가?
  • RQ3함수 노름의 확률적 근사를 확률적 경사 하강법에 효과적으로 적용할 수 있는가?
  • RQ4실제로 드롭아웃, 배치 정규화, 가중치 감소와 같은 기존 방법들과 비교해 함수 노름 정규화는 어떻게 성능을 내는가?
  • RQ5낮은 데이터 환경에서, 특히 이미지 분할 작업에서 함수 노름 정규화는 더 나은 성능을 내는가?

주요 결과

  • ReLU 기반의 깊이 있는 신경망에서 함수 노름 계산이 NP-난이도임을 증명하여 근사 방법의 사용이 타당하다고 밝혀졌다.
  • 가중 $L_2$ 함수 노름의 확률적 근사는 MNIST 및 옥스포드 플라워 데이터셋에서 가중치 감소, 드롭아웃, 배치 정규화와 비교해 일관된 일반화 성능 향상을 이끌어냈다.
  • 단지 500개의 훈련 이미지만 있는 Cityscapes 데이터셋에서, 함수 노름 정규화는 평균 IoU를 기준선의 47.15%에서 더 높은 성능으로 끌어올렸으며, 낮은 데이터 환경에서의 효과를 입증했다.
  • 실증적 평가에서 Kawaguchi 등(2017)의 정규화자보다 본 방법이 수렴성과 일반화 성능 면에서 뛰어나게 나타났다.
  • 실험 결과에 따르면, 확률적 노름 근사에서 사용된 샘플링 절차가 검증 정확도와 분할 품질 향상으로 이어져 더 나은 일반화를 이끌어냈다.
  • 기본적인 훈련 프로토콜, 예를 들어 ENet의 이단계 훈련과도 함께 사용되었을 때에도 본 방법은 복잡한 반감독 아키텍처가 필요 없이도 측정 가능한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.