Skip to main content
QUICK REVIEW

[논문 리뷰] Auto-Sizing Neural Networks: With Applications to n-gram Language Models

Kenton Murray, David Chiang|arXiv (Cornell University)|2015. 08. 20.
Topic Modeling참고 문헌 19인용 수 16
한 줄 요약

이 논문은 히든 유닛의 여분을 자동으로 제거할 수 있도록 ∞,1 및 2,1 정규화를 사용하는 피드포워드 신경망을 위한 자동 크기 조정 방법을 제안한다. 그룹 스파arsity를 통해 전체 유닛이 비활성화되도록 유도함으로써, 다양한 설정에서 단일 정규화 하이퍼파rameter를 사용하여 모델 크기를 줄이고 퍼플렉서티 손실을 최소화하면서도 기계 번역 성능에 일관된 향상을 이끌어내며, 고성능의 언어 모델을 생성한다.

ABSTRACT

Neural networks have been shown to improve performance across a range of natural-language tasks. However, designing and training them can be complicated. Frequently, researchers resort to repeated experimentation to pick optimal settings. In this paper, we address the issue of choosing the correct number of units in hidden layers. We introduce a method for automatically adjusting network size by pruning out hidden units through $\ell_{\infty,1}$ and $\ell_{2,1}$ regularization. We apply this method to language modeling and demonstrate its ability to correctly choose the number of hidden units while maintaining perplexity. We also include these models in a machine translation decoder and show that these smaller neural models maintain the significant improvements of their unpruned versions.

연구 동기 및 목표

  • 신경망의 히든 레이어 크기를 수동으로 튜닝하는 데 드는 시간과 실수의 위험을 해결하기 위해.
  • 훈련 과정에서 최적의 네트워크 크기를 자동으로 결정할 수 있는 방법을 개발하여, 광범위한 그리드 서치가 필요 없도록 하기 위해.
  • 모델 복잡성과 추론 비용을 줄이면서도 언어 모델링과 기계 번역에서 높은 성능을 유지하기 위해.
  • 정규화 기반의 프루닝이 정확도를 희생시키지 않고 더 작고 효율적인 모델을 생성할 수 있음을 보여주기 위해.

제안 방법

  • 모든 입력 가중치를 0으로 이끌어 전체 히든 유닛을 비활성화하도록 유도하기 위해 목적 함수에 ∞,1 및 2,1 정규화를 적용한다.
  • 각 유닛의 가중치 그룹에 작용하는 볼록 정규화를 사용하여 개별 파라미터가 아닌 유닛 수준에서의 스파arsity를 촉진한다.
  • 초기 과다 크기의 아키텍처로 네트워크를 훈련한 후, 비활성화된 유닛을 제거하여 컴act하고 최적화된 모델을 도출한다.
  • 정규화된 손실 함수를 최소화하기 위해 확률적 경사 하강법을 사용하며, 프루닝을 훈련 과정에 통합한다.
  • 모든 입력이 0일 때 출력이 0이 되는 활성화 함수(예: ReLU 또는 tanh)를 활용하여 프루닝된 유닛을 안전하게 제거할 수 있다.
  • 다양한 네트워크 크기, 어휘 크기, n-gram 순서, 훈련 데이터 크기에서 동일한 정규화 계수(λ = 0.1)를 조정한다.

실험 결과

연구 질문

  • RQ1수동 튜닝 없이 정규화 기반의 프루닝이 신경망의 최적의 히든 유닛 수를 자동으로 결정할 수 있는가?
  • RQ2∞,1 및 2,1 노름이 유닛 수준에서 그룹 스파arsity를 효과적으로 유도하여 여분의 뉴런을 깔끔하게 제거할 수 있는가?
  • RQ3크기가 줄어든 모델이라도 언어 모델링 작업에서 낮은 퍼플렉서티를 유지할 수 있는가?
  • RQ4단일 하이퍼파rameter 설정으로 다양한 데이터 크기, 어휘 크기, n-gram 순서에 대해 일반화 가능한가?
  • RQ5자동 크기 조정된 신경망 언어 모델이 디코더에 통합되었을 때 기계 번역 성능을 향상시킬 수 있는가?

주요 결과

  • 이 방법은 여분의 히든 유닛을 성공적으로 제거하여, 정규화되지 않은 모델에 비해 퍼플렉서티 증가가 최소화된 더 작은 모델을 생성한다.
  • 단일 정규화 계수(λ = 0.1)가 어휘 크기, 훈련 데이터 크기, n-gram 순서가 다른 다양한 구성에서 일관된 성능을 달성한다.
  • 자동 크기 조정된 모델은 전체 모델과 거의 동일한 퍼플렉서티를 유지하며, 통계적으로 유의미한 작은 증가가 있다.
  • 기계 번역 디코더에 통합되었을 때, 프루닝된 모델은 전체 크기의 모델과 동일한 성능 향상을 이끌어내며 큰 BLEU 점수 향상을 기록한다.
  • 레이어 크기 하이퍼파ram터 튜닝을 단일 정규화 파rameter로 대체함으로써, 고비용의 다차원 그리드 서치가 필요 없어진다.
  • 가중치 행렬의 시각화 결과에서 전체 행(유닛)이 명확하게 0으로 수렴하는 것을 확인하여, 효과적인 유닛 수준의 프루닝이 이루어졌음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.