Skip to main content
QUICK REVIEW

[논문 리뷰] Noisy Recurrent Neural Networks

Soon Hoe Lim, N. Benjamin Erichson|arXiv (Cornell University)|2021. 02. 09.
Model Reduction and Neural Networks참고 문헌 88인용 수 6
한 줄 요약

이 논문은 훈련 중 은닉 상태에 노이즈를 주입하여 모델을 암묵적으로 정규화하는 Noisy Recurrent Neural Networks (NRNNs)를 소개한다. 저자들은 NRNNs를 이산화된 확률적 미분방정식으로 모델링하여, 노이즈 주입이 더 평탄한 최소값을 촉진하고, 역학적 안정성을 향상시키며, 분류 마진을 증가시켜 입력의 변형에 대한 강건성을 향상시키는 것으로 밝혀냈다. 이는 깨끗한 데이터에서 최신 기술 수준의 성능을 유지하면서도 성능 향상을 이룬다.

ABSTRACT

We provide a general framework for studying recurrent neural networks (RNNs) trained by injecting noise into hidden states. Specifically, we consider RNNs that can be viewed as discretizations of stochastic differential equations driven by input data. This framework allows us to study the implicit regularization effect of general noise injection schemes by deriving an approximate explicit regularizer in the small noise regime. We find that, under reasonable assumptions, this implicit regularization promotes flatter minima; it biases towards models with more stable dynamics; and, in classification tasks, it favors models with larger classification margin. Sufficient conditions for global stability are obtained, highlighting the phenomenon of stochastic stabilization, where noise injection can improve stability during training. Our theory is supported by empirical results which demonstrate that the RNNs have improved robustness with respect to various input perturbations.

연구 동기 및 목표

  • 노이즈 주입이 RNN의 일반화와 강건성에 미치는 영향을 이해하기 위한 이론적 프레임워크를 개발하는 것.
  • 작은 노이즈 영역에서의 노이즈 주입이 유도하는 암묵적 정규화 효과를 명시적인 정규화자로 유도하는 것.
  • RNN에서 노이즈 유도 안정성, 평탄한 최소값, 큰 분류 마진 간의 관계를 규명하는 것.
  • NRNN이 깨끗한 데이터에서 높은 정확도를 유지하면서도 입력 변형에 더 강건한지 경험적으로 검증하는 것.
  • 노이즈 주입이 훈련 동역학을 향상시키는 스토케스틱 안정화를 이끌 수 있음을 보여주는 것.

제안 방법

  • 입력 데이터와 노이즈에 의해 구동되는 확률적 미분방정식(SDEs)의 이산화로 RNN을 모델링하는 것.
  • 작은 노이즈 영역에서 암묵적 정규화 효과를 특성화하기 위해 명시적인 정규화자를 유도하는 것.
  • 리아푸노프 안정성 분석을 사용하여 노이즈 주입 하에서의 전역 안정성에 대한 충분조건을 증명하는 것.
  • RNN 동역학과 노이즈 유도 정규화를 바탕으로 분류 마진을 함수로 공식화하는 것.
  • 덧셈적 및 곱셈적 노이즈를 모두 사용하여 NRNN을 훈련하고, 깨끗한 데이터에서의 성능을 최적화하기 위해 노이즈 수준을 튜닝하는 것.
  • 기준 테스트 작업에서 깨끗한 입력과 변형된 입력 모두에 대해 NRNN을 최신 기술 수준의 RNN 변종들(예: CoRNN, Lipschitz RNN, Exponential RNN)과 비교하는 것.

실험 결과

연구 질문

  • RQ1RNN에서의 노이즈 주입은 훈련 과정의 암묵적 정규화에 어떻게 영향을 미치는가?
  • RQ2작은 노이즈 영역에서 노이즈 주입이 유도하는 정규화자의 명시적 형태는 무엇인가?
  • RQ3노이즈 주입은 RNN 훈련에서 개선된 안정성과 더 평탄한 최소값을 유도할 수 있는가?
  • RQ4노이즈 주입은 RNN의 분류 마진을 향상시키는가? 만약 그렇다면, 이는 역학적 안정성과 어떻게 연결되는가?
  • RQ5NRNN은 결정론적 RNN에 비해 입력 변형에 대해 어느 정도 더 강건한가?

주요 결과

  • NRNNs는 깨끗한 MNIST 및 퍼미uted MNIST 벤치마크에서 최신 기술 수준의 성능를 달성했으며, 깨끗한 데이터에서 테스트 정확도가 94.9%였다.
  • 화이트 노이즈 변형(σ=0.3) 하에서 NRNNs는 94.3%의 정확도를 유지했으며, CoRNN(29.1%)과 Exponential RNN(61.6%)에 비해 뚜렷한 승리를 거두었다.
  • 소금-후추 노이즈(α=0.1) 하에서 NRNNs는 88.6%의 정확도를 기록했으며, Antisymmetric RNN(72.6%)과 CoRNN(52.6%)에 비해 뛰어난 성능을 보였다.
  • NRNNs의 헤시안 지형은 결정론적 RNN보다 더 매끄럽게 나타나 평탄한 최소값을 나타낸다.
  • 노이즈 주입은 스토케스틱 안정성을 유도하며, 연속 시간 NRNN에서 전역 안정성이 향상됨을 이론적으로 입증한 조건이 존재한다.
  • 노이즈에서 유도되는 암묵적 정규화는 더 큰 분류 마진을 가진 모델을 선호하며, 이는 더 나은 일반화와 강건성과 관련이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.