Skip to main content
QUICK REVIEW

[논문 리뷰] Character-Level Language Modeling with Hierarchical Recurrent Neural Networks

Kyuyeon Hwang, Wonyong Sung|arXiv (Cornell University)|2016. 09. 13.
Natural Language Processing Techniques참고 문헌 29인용 수 7
한 줄 요약

이 논문은 장기적 의존성을 포착하기 위해 캐릭터 수준의 입력/출력과 다중 시간스케일 RNN 모듈을 결합한 계층적 순환 신경망(HRNNs)을 제안한다. 이 모델은 파arameter의 2%만을 사용하여 Kneser-Ney 5-그램 언어 모델보다 낮은 퍼플렉서티를 달성하며, 표준 RNN보다 30% 적은 파arameter로 엔드 투 엔드 음성 인식 정확도를 향상시킨다.

ABSTRACT

Recurrent neural network (RNN) based character-level language models (CLMs) are extremely useful for modeling out-of-vocabulary words by nature. However, their performance is generally much worse than the word-level language models (WLMs), since CLMs need to consider longer history of tokens to properly predict the next one. We address this problem by proposing hierarchical RNN architectures, which consist of multiple modules with different timescales. Despite the multi-timescale structures, the input and output layers operate with the character-level clock, which allows the existing RNN CLM training approaches to be directly applicable without any modifications. Our CLM models show better perplexity than Kneser-Ney (KN) 5-gram WLMs on the One Billion Word Benchmark with only 2% of parameters. Also, we present real-time character-level end-to-end speech recognition examples on the Wall Street Journal (WSJ) corpus, where replacing traditional mono-clock RNN CLMs with the proposed models results in better recognition accuracies even though the number of parameters are reduced to 30%.

연구 동기 및 목표

  • 캐릭터 수준의 언어 모델(CLMs)이 단어 수준의 모델(WLMs)보다 성능이 열 劣한 이유는 더 긴 컨텍스트 요구 때문이므로 이를 해결하기 위해.
  • 모델 크기 증가 없이도 표준 학습 절차를 벗어나지 않고 장기적 의존성을 모델링할 수 있도록 하기 위해.
  • 더 나은 일반화 및 OOV(어휘 외 단어) 처리를 위해 캐릭터 수준 프레임워크 내에서 단어 수준 모델링 능력을 통합하기 위해.
  • 기준 작업에서 성능을 유지하거나 향상시키면서도 파arameter를 크게 줄이기 위해.
  • 엔드 투 엔드 음성 인식에 적합한 실시간, 저자원 캐릭터 수준 언어 모델링을 가능하게 하기 위해.

제안 방법

  • 캐릭터 수준에서 작동하는 저수준 RNN과 단어/문장 경계 수준에서 작동하는 고수준 RNN을 포함한 계층적 RNN 아키텍처를 제안하며, 서로 다른 시계열 속도를 사용한다.
  • 전체 모델에 캐릭터 수준의 입력과 출력을 사용하여 기존 RNN CLM 학습 방법과의 호환성을 유지한다.
  • 장기적 의존성을 포착하기 위해 저수준 및 고수준 모듈 모두에 장기 기억 단위(LSTM)를 사용한다.
  • 저수준 RNN에서 압축된 임베딩을 고수준 RNN이 수신하도록, 캐릭터 시퀀스에서 표준 교차 엔트로피 손실을 사용해 모델을 학습한다.
  • 프리픽스 트리와 함께 비트 시퀀스 디코딩을 사용하여 엔드 투 엔드 음성 인식에 모델을 적용하며, 실시간 추론 능력을 유지한다.
  • 고수준 RNN의 동기화 신호로 단어 경계 토큰(<w>)과 문장 경계 토큰(<s>)을 사용한다.

실험 결과

연구 질문

  • RQ1다중 시간스케일 처리를 가능하게 하는 계층적 RNN 아키텍처가 캐릭터 수준 언어 모델링 성능을 향상시킬 수 있는가?
  • RQ2이러한 모델이 전통적인 n-그램 모델보다 훨씬 적은 파arameter로 더 낮은 퍼플렉서티를 달성할 수 있는가?
  • RQ3계층적 아키텍처를 가짐에도 불구하고 표준 RNN 학습 절차와 호환성을 유지할 수 있는가?
  • RQ4낮은 파arameter 수로 실시간 엔드 투 엔드 음성 인식에 효과적으로 적용될 수 있는가?
  • RQ5캐릭터 수준 프레임워크 내에서 단어 수준 추상화를 통합하면 장거리 의존성을 더 잘 모델링할 수 있는가?

주요 결과

  • 4x1024 유닛을 가진 HLSTM-B 모델은 온 빌리언 워드 벤치마크에서 퍼플렉서티 60.7을 기록하며, Kneser-Ney 5-그램 모델의 2% 파arameter만을 사용함에도 불구하고 이를 뛰어넘는 성능을 보였다.
  • HLSTM-B (4x1024) 모델은 단어 수준 퍼플렉서티 60.7을 기록했으며, 이는 11억 개의 n-그램을 사용하는 통합 Kneser-Ney 5-그램 모델의 67.6보다 우수한 성능이다.
  • WSJ Nov’92 20K 평가 세트에서 4x1024 딥 LSTM LM를 제안된 HLSTM-B (4x512)로 교체함으로써 파aram터를 30%로 줄였고, WER을 7.85%에서 7.78%로 향상시켰다.
  • HLSTM-B (4x512) 모델은 단어 수준 퍼플렉서티 73.6과 WER 7.79%를 기록하며, 단지 848만 개의 파aram터로도 뛰어난 성능을 보였다.
  • 엔드 투 엔드 ASR에서 언어 모델 퍼플렉서티와 단어 오류율(WER) 간에 강한 상관관계를 보였으며, 실용적 응용에서의 효과성을 검증했다.
  • 모델는 표준 RNN CLM 학습과 호환성을 유지하여, 수정 없이도 기존 학습 레시피를 그대로 사용할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.