Skip to main content
QUICK REVIEW

[논문 리뷰] Independent language modeling architecture for end-to-end ASR

Van Tung Pham, Haihua Xu|arXiv (Cornell University)|2019. 11. 25.
Speech Recognition and Synthesis참고 문헌 26인용 수 6
한 줄 요약

이 논문은 엔드 투 엔드 음성 인식(ASR)을 위한 분리된 언어 모델링 아키텍처를 제안하며, 디코더 서브넷을 인코더 출력에서 분리하여 외부 텍스트 데이터를 사용한 독립적 사전 훈련이 가능하도록 한다. 언어 모델을 분리함으로써 중국어 HKUST에서 9.3% 상대적 문자 오류률 감소와 영어 NSC에서 22.8% 상대적 단어 오류률 감소를 달성하였으며, 라벨이 부여된 데이터의 양에 관계없이 일반화 능력이 향상되고 외부 언어 모델과의 호환성도 확보하였다.

ABSTRACT

The attention-based end-to-end (E2E) automatic speech recognition (ASR) architecture allows for joint optimization of acoustic and language models within a single network. However, in a vanilla E2E ASR architecture, the decoder sub-network (subnet), which incorporates the role of the language model (LM), is conditioned on the encoder output. This means that the acoustic encoder and the language model are entangled that doesn't allow language model to be trained separately from external text data. To address this problem, in this work, we propose a new architecture that separates the decoder subnet from the encoder output. In this way, the decoupled subnet becomes an independently trainable LM subnet, which can easily be updated using the external text data. We study two strategies for updating the new architecture. Experimental results show that, 1) the independent LM architecture benefits from external text data, achieving 9.3% and 22.8% relative character and word error rate reduction on Mandarin HKUST and English NSC datasets respectively; 2)the proposed architecture works well with external LM and can be generalized to different amount of labelled data.

연구 동기 및 목표

  • 기본적인 엔드 투 엔드 ASR에서 언어 모델이 음성 인코더와 결합되어 있어 외부 텍스트 데이터를 독립적으로 훈련할 수 없는 한계를 해결하기 위해.
  • 번역된 음성 데이터가 필요 없이 대규모 외부 텍스트 코퍼스를 사용하여 언어 모델 구성 요소를 효과적으로 사전 훈련할 수 있도록 하기 위해.
  • 언어 모델 사전 훈련 이후 공동 미세조정 과정에서 치명적인 잊음 현상을 완화하기 위해.
  • 라벨이 부여된 데이터의 양이 다양한 경우와 외부 언어 모델 통합 시 제안된 아키텍처의 일반화 능력을 평가하기 위해.

제안 방법

  • 디코더 서브넷을 인코더 출력에서 분리하여 디코더가 독립적인 언어 모델로 기능할 수 있도록 하는 새로운 아키텍처(A2)를 제안한다.
  • 어텐션 메커니즘을 수정하여 커텍스트 벡터를 인코더 출력과 현재 디코더 은닉 상태에서 계산하도록 하여, 디코더가 커텍스트 벡터에 조건부로 의존하지 않도록 한다.
  • 두 가지 훈련 전략을 도입한다: 전략 1은 공동 미세조정 이전에 외부 텍스트 데이터로 디코더 서브넷을 사전 훈련하는 방식이며, 전략 2는 ASR 및 언어 모델링 목표를 조합한 가중 손실 함수를 사용해 사전 훈련과 공동 미세조정을 번갈아 수행하는 방식이다.
  • 라벨이 부여된 ASR 데이터와 외부 텍스트 데이터의 기여도를 균형 잡기 위해 하이퍼파라미터 α를 사용한 가중 손실 함수를 적용한다.
  • 특히 치명적인 잊음 현상 완화를 위해 기울기 클리핑과 AdaDelta 최적화를 적용하여 훈련을 안정화시킨다.
  • 추론 단계에서 외부 RNN-LM을 통합하여 독립된 언어 모델과 사전 훈련된 외부 언어 모델 간의 상호보완성 평가를 수행한다.

실험 결과

연구 질문

  • RQ1인코더 출력에서 언어 모델을 분리함으로써 엔드 투 엔드 ASR에서 외부 텍스트 데이터만을 사용해 효과적인 사전 훈련이 가능한가?
  • RQ2라벨이 부여된 데이터만을 사용할 경우, 제안된 아키텍처는 기존의 A1 아키텍처와 비교해 성능에서 어떻게 다를까?
  • RQ3외부 텍스트 데이터를 활용해 언어 모델을 향상시키는 동안 치명적인 잊음 현상을 최소화하는 데 가장 효과적인 훈련 전략은 무엇인가?
  • RQ4제안된 아키텍처는 라벨이 부여된 데이터의 양이 다양한 경우에도 일반화되는가?
  • RQ5독립된 언어 모델은 사전 훈련된 외부 언어 모델을 통합함으로써 추가로 향상시킬 수 있는가?

주요 결과

  • 라벨이 부여된 데이터로만 훈련했을 때, 제안된 A2 아키텍처는 HKUST 및 NSC 데이터셋에서 기존 A1 아키텍처보다 1.8% 상대적 문자 오류률 감소(49.2%에서 48.3%)와 4.3% 상대적 단어 오류률 감소(39.9%에서 38.2%)를 달성한다.
  • 전략 2(α=0.7에서 사전 훈련 후 공동 미세조정)를 사용해 외부 텍스트 데이터를 활용할 경우, A2 모델은 HKUST에서 9.3% 상대적 문자 오류률 감소와 NSC에서 22.8% 상대적 단어 오류률 감소를 달성한다.
  • 외부 텍스트 데이터를 사용할 경우, 전략 2를 사용한 A2 아키텍처가 전략 1을 사용한 A2 및 A1 아키텍처보다 모든 설정에서 최고의 성능을 기록한다.
  • 외부 RNN-LM을 통합함으로써 A2-Strategy2-0.7 모델은 20시간의 라벨이 부여된 데이터를 가진 NSC 코퍼스에서 0.2% 절대적 CER 감소와 4.5% 절대적 WER 감소를 추가로 달성한다.
  • 제안된 아키텍처는 라벨이 부여된 데이터의 양이 다양할 경우에도 잘 일반화되며, NSC 데이터셋에서 20시간에서 60시간의 훈련 데이터에 이르기까지 일관된 성능 향상을 보인다.
  • 철저한 훈련 스케줄링을 통해 치명적인 잊음 현상을 성공적으로 완화하여, 외부 텍스트 데이터로 사전 훈련 후 효과적인 공동 최적화가 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.