Skip to main content
QUICK REVIEW

[논문 리뷰] Language model fusion for streaming end to end speech recognition

Rodrigo Cabrera, Xiaofeng Liu|arXiv (Cornell University)|2021. 04. 09.
Speech Recognition and Synthesis참고 문헌 15인용 수 8
한 줄 요약

이 논문은 순환 신경망 트랜스듀서(RNNT)를 사용한 스트리밍 엔드 투 엔드 음성 인식에서, 얕은 융합과 냉각 융합을 확장하고, 초기 융합 변형을 도입하는 새로운 언어 모델 융합 기법을 제안한다. 냉각 융합이 스트리밍 RNNT 성능을 크게 향상시켜, 사전 학습된 언어 모델을 통해 쌍방향 텍스트 데이터를 통합함으로써 최대 8.5%의 상대적 WER 감소를 달성하며, 특히 자원이 적고 긴 꼬리 분포를 보이는 언어 현상(예: 고유명사, 숫자 등)에 유리하다고 밝힌다.

ABSTRACT

Streaming processing of speech audio is required for many contemporary practical speech recognition tasks. Even with the large corpora of manually transcribed speech data available today, it is impossible for such corpora to cover adequately the long tail of linguistic content that's important for tasks such as open-ended dictation and voice search. We seek to address both the streaming and the tail recognition challenges by using a language model (LM) trained on unpaired text data to enhance the end-to-end (E2E) model. We extend shallow fusion and cold fusion approaches to streaming Recurrent Neural Network Transducer (RNNT), and also propose two new competitive fusion approaches that further enhance the RNNT architecture. Our results on multiple languages with varying training set sizes show that these fusion methods improve streaming RNNT performance through introducing extra linguistic features. Cold fusion works consistently better on streaming RNNT with up to a 8.5% WER improvement.

연구 동기 및 목표

  • 스트리밍 엔드 투 엔드 ASR 시스템에서 희귀하거나 OOV(out-of-vocabulary)인 언어 현상(예: 고유명사, 숫자 등)을 인식하는 데 도전하는 것.
  • 원래 비스트리밍 모델에서 개발된 언어 모델 융합 기법을 스트리밍 RNNT 환경으로 확장하는 것.
  • 비스트리밍 어텐션 기반 모델(LAS 등)에서 관찰된 융합 성능 향상이 스트리밍 RNNT 모델에서도 재현 가능한지 조사하는 것.
  • 융합 위치(조인트 네트워크 이전 또는 이후)와 모델 용량이 여러 저자원 및 중간자원 언어에서 성능에 미치는 영향을 평가하는 것.

제안 방법

  • 추론 중에 RNNT 점수와 언어 모델 점수를 로그 확률의 가중합으로 조합하여 얕은 융합을 적용한다.
  • 공동 손실을 사용해 RNNT와 언어 모델을 함께 미세 조정함으로써 파라미터 상호 적응을 가능하게 하여 냉각 융합을 구현한다.
  • 언어 모델을 조인트 네트워크 이전에 융합하여 조기에 언어적 맥락을 통합할 수 있도록, 초기 얕은 융합과 초기 냉각 융합을 도입한다.
  • 융합 과정에서 전달 과정의 일관성을 유지하기 위해, 빈도 기호(blank symbol)에 대한 언어 모델의 확률을 RNNT의 빈도 확률과 동일하게 정의한다.
  • 쌍방향 음성-텍스트 데이터가 필요 없이, 단지 분리된 텍스트 데이터에서만 학습된 RNN 기반 언어 모델을 사용하여 언어적 사전 지식을 제공한다.
  • 워드피ece 토크나이저를 사용하고, 디코딩 중에 빈도 페널티를 최적화하여 정렬과 출력 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1비스트리밍 ASR 모델에서 개발된 언어 모델 융합 기법이 스트리밍 RNNT 아키텍처에 효과적으로 적용될 수 있는가?
  • RQ2특히 저자원 환경에서, 냉각 융합이 얕은 융합보다 우수한 성능을 보일 수 있는가?
  • RQ3융합 위치(조인트 네트워크 이전 또는 이후)가 인식 성능과 모델 유연성에 어떤 영향을 미치는가?
  • RQ4학습 데이터 크기가 스트리밍 RNNT 시스템에서 언어 모델 융합의 효과성에 어느 정도 기여하는가?
  • RQ5쌍방향 텍스트 데이터 없이도, 희귀하거나 긴 꼬리 분포를 보이는 언어 현상(예: 고유명사, 숫자 등)의 인식 성능을 향상시킬 수 있는가?

주요 결과

  • 냉각 융합은 노르웨이어에서 최대 8.5%의 상대적 WER 감소를 달성하여, 얕은 융합 및 기준 모델을 크게 능가했다.
  • 냉각 융합은 시험한 세 언어(Norwegian, Greek, Sinhala) 전반에서 일관되게 성능 향상을 보였지만, 얕은 융합은 그리스어와僧伽라어에서 성능 향상이 없었다.
  • 냉각 융합의 가장 큰 WER 감소는 저자원 환경(예: 노르웨이어)에서 발생했으며, 이는 ASR 모델이 데이터 부족에 처할수록 융합이 가장 효과적임을 시사한다.
  • 초기 융합 변형(초기 얕은 융합 및 초기 냉각 융합)은 표준 융합과 유사한 성능을 달성하여, 융합 지점이 조인트 네트워크 이전 또는 이후에 유연하게 배치될 수 있음을 보여주었다.
  • 예시 분석 결과, 냉각 융합은 훈련 데이터에 없었지만 언어 모델의 텍스트 코퍼스에 포함된 OOV 단어인 'Range Rover'와 'Andrianopolis'를 정확히 인식하는 데 성공했다.
  • 모델 간 성능 격차는 저자원 언어에서의 데이터 부족 때문이며, Sinhala의 경우 언어 모델의 도메인 불일치와 과적합으로 인해 성능 향상이 미미했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.