Skip to main content
QUICK REVIEW

[논문 리뷰] On the Approximation Properties of Random ReLU Features

Yitong Sun, Anna C. Gilbert|arXiv (Cornell University)|2018. 10. 10.
Machine Learning and ELM참고 문헌 17인용 수 19
한 줄 요약

이 논문은 랜덤 ReLU 특징에 의해 유도되는 재생 핵 힐버트 공간(RKHS)의 보편성을 확립하며, 이들이 보편적으로 일致하는 학습 방법을 형성함을 증명한다. 또한 얕은 모델(랜덤 ReLU 특징 포함)이 특정 복합 함수를 근사하는 데 어려움을 겪는 반면, 유한한 가중치를 가진 더 깊은 ReLU 네트워크는 이러한 함수를 효율적으로 근사할 수 있음을 보여주며, 이는 얕은 랜덤 특징 모델의 근본적인 한계를 드러낸다.

ABSTRACT

We study the approximation properties of random ReLU features through their reproducing kernel Hilbert space (RKHS). We first prove a universality theorem for the RKHS induced by random features whose feature maps are of the form of nodes in neural networks. The universality result implies that the random ReLU features method is a universally consistent learning algorithm. We prove that despite the universality of the RKHS induced by the random ReLU features, composition of functions in it generates substantially more complicated functions that are harder to approximate than those functions simply in the RKHS. We also prove that such composite functions can be efficiently approximated by multi-layer ReLU networks with bounded weights. This depth separation result shows that the random ReLU features models suffer from the same weakness as that of shallow models. We show in experiments that the performance of random ReLU features is comparable to that of random Fourier features and, in general, has a lower computational cost. We also demonstrate that when the target function is the composite function as described in the depth separation theorem, 3-layer neural networks indeed outperform both random ReLU features and 2-layer neural networks.

연구 동기 및 목표

  • 랜덤 ReLU 특징에 의해 유도되는 RKHS의 보편성을 확립하여, 어떤 연속 함수라도 근사할 수 있는 능력을 보장한다.
  • RKHS 내의 함수보다 본질적으로 더 복잡한 복합 함수를 모델링할 때 랜덤 ReLU 특징의 근사 제약 조건을 분석한다.
  • 유한한 가중치를 가진 다층 ReLU 네트워크가 이러한 복합 함수를 효율적으로 근사할 수 있음을 보여주며, 깊이에 따른 성능 우월성을 강조한다.
  • 랜덤 ReLU 특징이 계산적으로 효율적임을 실증적으로 검증하고, 랜덤 푸리에 특징과 유사한 성능을 내지만 더 낮은 계산 비용을 갖는다는 것을 보여준다.
  • 깊이가 필요한 정확한 근사가 요구되는 목표 함수에서 3층 ReLU 네트워크가 2층 네트워크와 랜덤 ReLU 특징 모두를 능가함을 보여준다.

제안 방법

  • 활성화 함수 σ와 매개변수 분포에 대해 광범위한 충분 조건을 만족할 경우, 기능 분석 도구를 사용하여 랜덤 ReLU 특징에 의해 유도되는 RKHS의 보편성을 증명한다.
  • Bach(2017b)의 결과를 활용하여 Huang 등(2006)의 유한한 특징 맵 결과를 유한하지만 허용 가능한 랜덤 특징으로 확장한다.
  • 얕은 모델이 효율적으로 근사할 수 없는 복합 함수를 근사하기 위해 유한한 가중치를 가진 깊은 ReLU 네트워크를 구축한다.
  • 중간층의 가중치를 유지하면서 함수 근사 성능을 보존하기 위해 스케일링 기법을 적용하여 안정성과 일반화 성능을 확보한다.
  • 제약 조건을 포함한 경험 리스크 최소화를 적용하여, 랜덤 ReLU 특징 공간 내에서 양호한 근사자 존재를 보장한다.
  • 합성 데이터셋(사인, 스트립, 정사각형, 칸막이 분포 포함)에서 랜덤 ReLU 특징과 랜덤 푸리에 특징을 비교하는 실험을 수행한다.

실험 결과

연구 질문

  • RQ1랜덤 ReLU 특징에 의해 유도되는 RKHS가 보편적인가? 즉, 어떤 연속 함수라도 근사할 수 있는가?
  • RQ2랜덤 ReLU 특징은 그들의 RKHS보다 더 복잡한 복합 함수를 효율적으로 근사할 수 있는가?
  • RQ3유한한 가중치를 가진 더 깊은 ReLU 네트워크는 얕은 모델(랜덤 ReLU 특징 포함)보다 이러한 복합 함수를 근사하는 데 더 우수한 성능을 보이는가?
  • RQ4정확도와 계산 비용 측면에서 랜덤 ReLU 특징은 랜덤 푸리에 특징보다 어떻게 비교되는가?
  • RQ5랜덤 ReLU 특징 공간에서 경험 리스크 최소화가 좋은 일반화 및 근사 성능을 보장할 수 있는가?

주요 결과

  • 활성화 함수와 매개변수 분포에 대해 광범위한 조건을 만족할 경우, 랜덤 ReLU 특징에 의해 유도되는 RKHS는 보편적이며, 이는 학습 방법의 보편적 일致성을 보장한다.
  • RKHS의 보편성에도 불구하고, RKHS 요소들의 복합 함수로 구성된 함수는 RKHS 내의 함수보다 훨씬 더 복잡하고 근사하기 어려운 편이다.
  • 유한한 가중치를 가진 다층 ReLU 네트워크는 이러한 복합 함수를 효율적으로 근사할 수 있으며, 더 깊은 모델이 얕은 모델보다 우월한 깊이에 따른 성능 우위를 보여주는 깊이 분리 효과를 입증한다.
  • 깊이 분리 정리에 따라 구성된 목표 함수에서 3층 ReLU 네트워크는 2층 네트워크와 랜덤 ReLU 특징 모두를 능가하며, 깊이의 이론적 우월성을 확인한다.
  • 랜덤 ReLU 특징은 랜덤 푸리에 특징과 유사한 성능을 내지만, ReLU의 0 또는 항등 함수 출력 특성으로 인해 더 희소한 특징 벡터를 만들어 계산 비용이 더 낮다.
  • 합성 데이터셋에 대한 실증 결과는 랜덤 ReLU 특징이 효과적이고 효율적임을 확인하며, 복잡한 복합 목표 함수에서는 깊이가 결정적인 우위를 제공함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.