Skip to main content
QUICK REVIEW

[논문 리뷰] Minimal Width for Universal Property of Deep RNN

Changhoon Song, Geonho Hwang|arXiv (Cornell University)|2022. 11. 25.
Stochastic Gradient Optimization Techniques인용 수 9
한 줄 요약

이 논문은 깊이가 나비형인 순환 신경망(RNN)이 ReLU 활성화 함수를 사용할 때, 유한한 길이의 $\mathbb{R}^{d_x}$에서 $\mathbb{R}^{d_y}$로의 연속 함수나 $L^p$ 함수를 보편적으로 근사할 수 있음을 증명한다. 연속 함수의 경우 최소 너비는 $d_x + d_y + 3$이며, $L^p$ 함수의 경우 $\max\{d_x+1, d_y\}$이며, 이는 시퀀스 길이에 관계없이 성립한다. 이 결과는 깊이가 나비형인 RNN에서 보편 근사의 최소 너비에 대한 날카로운 상한을 확립한다.

ABSTRACT

A recurrent neural network (RNN) is a widely used deep-learning network for dealing with sequential data. Imitating a dynamical system, an infinite-width RNN can approximate any open dynamical system in a compact domain. In general, deep networks with bounded widths are more effective than wide networks in practice; however, the universal approximation theorem for deep narrow structures has yet to be extensively studied. In this study, we prove the universality of deep narrow RNNs and show that the upper bound of the minimum width for universality can be independent of the length of the data. Specifically, we show that a deep RNN with ReLU activation can approximate any continuous function or $L^p$ function with the widths $d_x+d_y+2$ and $\max\{d_x+1,d_y\}$, respectively, where the target function maps a finite sequence of vectors in $\mathbb{R}^{d_x}$ to a finite sequence of vectors in $\mathbb{R}^{d_y}$. We also compute the additional width required if the activation function is $ anh$ or more. In addition, we prove the universality of other recurrent networks, such as bidirectional RNNs. Bridging a multi-layer perceptron and an RNN, our theory and proof technique can be an initial step toward further research on deep RNNs.

연구 동기 및 목표

  • 깊이가 나비형인 RNN이 순차적 함수를 보편적으로 근사하기 위해 필요한 최소 너비를 규명하는 것.
  • 최소 너비의 상한이 시퀀스 길이에 독립적임을 증명하여 효율적인 깊이가 나비형 아키텍처를 가능하게 하는 것.
  • 이중 방향 RNN, GRU, LSTM과 같은 다양한 RNN 변형으로 보편성 결과를 확장하는 것.
  • 연속 함수 및 $L^p$ 함수와 같은 다양한 함수 클래스에 대해 최소 너비의 날카로운 상한을 제공하는 것.
  • 명시적인 RNN 아키텍처를 구성함으로써 깊이가 나비형인 네트워크와 보편 근사 간의 이론적 격차를 메우는 것.

제안 방법

  • 입력 시퀀스의 임의의 선형 조합을 시뮬레이션하기 위해 토큰 단위의 리프팅 맵과 수정된 TRNN 셀의 반복적 조합을 사용하는 ReLU 활성화를 가진 깊이 있는 RNN을 구축한다.
  • 두 단계 아키텍처를 활용: 과거 입력의 가중치 합을 계산하기 위한 전진 전파, 이후 목적 함수를 매트릭스 역행렬 기법을 통해 재구성하기 위한 역방향 전파.
  • 이항 계수 행렬과 하삼각형 선형 시스템을 사용하여 각 시간 단계에서 원하는 함수 출력을 복구하기 위한 가중치를 구한다.
  • 수식 (26)의推론를 적용하여, 원하는 함수 근사에서 유도된 선형 시스템을 만족하는 역방향 전파 가중치 $\bar{b}_i[t]$를 구한다.
  • 0에서의 미분 가능성 조건을 부여함으로써 시그모이드나 탄젠트와 같은 비-ReLU 활성화 함수를 다룰 수 있도록 구조를 변형한다.
  • 과거와 미래의 의존성을 모두 포착하기 위해 전방 및 역방향 RNN을 조합하여 이중 방향 RNN으로 프레임워크를 확장한다.

실험 결과

연구 질문

  • RQ1깊이가 나비형인 RNN이 ReLU 활성화 함수를 사용할 때, 컴acts 도메인에서 연속 함수를 보편적으로 근사하기 위해 필요한 최소 너비는 무엇인가요?
  • RQ2깊이 있는 RNN에서 보편 근사의 최소 너비 상한이 시퀀스 길이에 독립적인가요?
  • RQ3연속 함수 근사와 비교할 때 $L^p$ 함수 근사의 경우 최소 너비 요구사항은 어떻게 변화합니까?
  • RQ4시그모이드나 탄젠트와 같은 비-ReLU 활성화 함수를 사용할 경우 추가로 필요한 너비는 얼마입니까?
  • RQ5이중 방향 RNN 및 GRU, LSTM과 같은 다른 RNN 변형으로 보편 근사 성질을 확장할 수 있습니까?

주요 결과

  • ReLU 활성화 함수를 가진 깊이 있는 RNN은 $\mathcal{K}$가 $\mathbb{R}^{d_x}$의 컴팩트 부분집합인 경우, 임의의 연속 함수 $f: \mathcal{K} \to \mathbb{R}^{d_y}$를 너비 $d_x + d_y + 3$로 보편적으로 근사할 수 있다.
  • $\mathcal{K}$에서의 $L^p$ 함수 근사의 경우, 최소 너비는 $\max\{d_x+1, d_y\} + 1$ 이하로 제한된다.
  • $\mathbb{R}^{d_x}$에서의 $L^p$ 함수 근사의 경우, ReLU 활성화 함수를 사용할 때 최소 너비는 정확히 $\max\{d_x+1, d_y\}$이다.
  • 시그모이드나 탄젠트와 같은 비-ReLU 활성화 함수(0에서 미분 가능하고 도함수가 0이 아닌 조건을 만족)를 사용할 경우, 최소 너비는 연속 함수의 경우 $d_x + d_y + 4$로 증가한다.
  • 이 구조는 이중 방향 RNN, GRU, LSTM으로 일반화되며, 표준 RNN과 동일한 최소 너비 상한을 유지한다.
  • 최소 너비는 시퀀스 길이 $N$에 독립적이므로, 깊이가 나비형인 RNN이 시퀀스 길이가 증가함에 따라 너비를 늘리지 않고도 보편 근사를 달성할 수 있음을 증명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.