Skip to main content
QUICK REVIEW

[논문 리뷰] Subregular Complexity and Deep Learning

Enes Avcu, Chihiro Shibata|arXiv (Cornell University)|2017. 05. 16.
Machine Learning and Algorithms참고 문헌 30인용 수 21
한 줄 요약

이 논문은 단순 RNN(s-RNN)과 LSTMs가 국소적 및 장기적 의존성을 각각 나타내는 하위정규 형식 언어—엄격 국소(SL) 및 엄격 조각별(SP)—를 학습할 수 있는지 조사한다. 장기적 의존성을 다룰 때 LSTMs가 s-RNN보다 뛰어나다는 일반적인 주장과는 달리, 실험 결과 복잡한 SP 언어에서 s-RNN이 자주 LSTMs를 능가하거나 이를 상회함으로써, LSTMs가 순차 학습에서 우월하다는 가정에 도전한다.

ABSTRACT

This paper argues that the judicial use of formal language theory and grammatical inference are invaluable tools in understanding how deep neural networks can and cannot represent and learn long-term dependencies in temporal sequences. Learning experiments were conducted with two types of Recurrent Neural Networks (RNNs) on six formal languages drawn from the Strictly Local (SL) and Strictly Piecewise (SP) classes. The networks were Simple RNNs (s-RNNs) and Long Short-Term Memory RNNs (LSTMs) of varying sizes. The SL and SP classes are among the simplest in a mathematically well-understood hierarchy of subregular classes. They encode local and long-term dependencies, respectively. The grammatical inference algorithm Regular Positive and Negative Inference (RPNI) provided a baseline. According to earlier research, the LSTM architecture should be capable of learning long-term dependencies and should outperform s-RNNs. The results of these experiments challenge this narrative. First, the LSTMs' performance was generally worse in the SP experiments than in the SL ones. Second, the s-RNNs out-performed the LSTMs on the most complex SP experiment and performed comparably to them on the others.

연구 동기 및 목표

  • 딥러닝 문헌에서 주장하는 linem, LSTMs가 장기적 의존성을 학습할 때 실제로 s-RNN보다 뛰어나다는지 평가하기 위해.
  • 형식 언어 이론과 문법 유추를 적용하여 신경망의 학습 능력을 평가하기 위한 통제된 체계적 벤치마크를 제작하기 위해.
  • 학습 데이터보다 더 긴 길이의 시퀀스에서 RNN의 일반화 행동을 조사하기 위해, 통제된 단어 길이를 가진 테스트 세트를 사용하기 위해.
  • LSTMs가 기울기 소실 문제를 해결하고 장기적 의존성을 학습하는 데 본질적으로 더 낫다는 주류 서사의 한계를 평가하기 위해.
  • Adam과 같은 최적화 기법이 s-RNN의 장기적 의존성 학습 곤경을 완화시킬 수 있는지 탐색하기 위해.

제안 방법

  • 연구는 국소적 의존성과 장기적 의존성을 각각 나타내는 엄격 국소(SL) 클래스에서 3개, 엄격 조각별(SP) 클래스에서 3개의 형식 언어를 사용한다.
  • 각 언어에 대해 학습 및 테스트 데이터 세트를 구성하였으며, 학습 시퀀스를 초월한 일반화 능력을 평가하기 위해 통제된 단어 길이를 적용하였다.
  • 단순 RNN(s-RNN)과 장기 순환 신경망(LSTM) 두 가지 유형의 RNN을 사용하여, 다양한 은닉층 크기를 가진 경우에 대해 양성 및 부정성 예제를 기반으로 학습하였다.
  • 정규 양성 및 부정성 유추(RPNI) 알고리즘이 정규 언어에 대한 학습 가능성과 데이터 품질을 평가하기 위한 기준으로 사용되었다.
  • 실험은 네트워크 크기를 체계적으로 변화시키고, Adam 최적화 알고리즘의 영향을 평가하기 위해 적용하였다.
  • 성능는 테스트 세트에서의 정확도로 측정되었으며, 학습 시퀀스보다 긴 길이의 시퀀스로의 일반화를 평가하기 위해 별도의 Test1 및 Test2 평가를 실시하였다.

실험 결과

연구 질문

  • RQ1엄격 조각별(SP) 언어에 의해 표현된 장기적 의존성을 학습할 때 LSTMs가 항상 s-RNN보다 뛰어나게 성능을 내는가?
  • RQ2s-RNN과 LSTMs는 하위정규 언어 작업에서 학습 중에 관찰된 시퀀스보다 긴 시퀀스로 일반화할 때 어떻게 행동하는가?
  • RQ3문법 유추 알고리즘인 RPNI가 신경망이 형식 언어를 학습할 수 있는지 평가하기 위해 신뢰할 수 있는 기준으로 기능할 수 있는 정도는 어느 정도인가?
  • RQ4Adam과 같은 최적화 기법이 s-RNN과 LSTMs 사이의 장기적 의존성 작업 성능 격차를 완화시킬 수 있는가?
  • RQ5LSTMs가 s-RNN보다 뚜렷하게 뛰어난 성능을 보이는, SP 클래스를 초월한 종류의 장기적 의존성은 존재하는가?

주요 결과

  • 가장 복잡한 SP 언어인 SP8에서 s-RNN이 LSTM을 능가하였다. 1,000개의 은닉 유닛을 사용할 경우, Test1과 Test2에서 각각 0.8160과 0.7702의 정확도를 기록하였고, LSTM은 각각 0.6520과 0.6201의 정확도를 기록하였다.
  • SP2에서 s-RNN은 10,000개의 은닉 유닛을 사용할 경우 Test1과 Test2에서 각각 0.8371과 0.8449의 정확도를 기록하였고, LSTM은 각각 0.8400과 0.8264의 정확도를 기록하였다. 이는 s-RNN의 우월성을 시사한다.
  • SP4에서 s-RNN은 1,000개의 은닉 유닛을 사용할 경우 각각 0.8160과 0.7702의 정확도를 기록하였고, LSTM은 각각 0.7270과 0.6808의 정확도를 기록하였다. 이는 복잡한 SP 작업에서 s-RNN의 일관된 우월성을 보여준다.
  • 100,000개의 은닉 유닛을 사용한 SP8에서 s-RNN은 각각 0.8251과 0.7505의 정확도를 기록하였고, LSTM은 각각 0.8117과 0.7645의 정확도를 기록하였다. 이는 유사한 성능를 보였지만 s-RNN이 뛰어나지는 않았음을 의미한다.
  • LSTM은 SP 언어에서의 성능가 SL 언어에서의 성능보다 일반적으로 열 劣하였으며, 이는 LSTMs의 아키텍처가 장기적 의존성을 학습하는 데 유리하다는 기대와는 정반대였다.
  • RPNI 기준은 모든 언어에서 완벽한 정확도(1.0000)를 기록하였으며, 이는 데이터가 정규 언어 학습자에 의해 학습 가능했음을 확인하였고, 신경망의 실패 원인이 데이터 품질 때문이 아니라는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.