Skip to main content
QUICK REVIEW

[논문 리뷰] Contextualizing ASR Lattice Rescoring with Hybrid Pointer Network Language Model

Da-Rong Liu, Chunxi Liu|arXiv (Cornell University)|2020. 05. 15.
Speech Recognition and Synthesis참고 문헌 21인용 수 5
한 줄 요약

이 논문은 비디오 메타데이터를 활용하여 관련 텍스트적 맥락에 대해 선택적으로 주의를 기울임으로써 ASR 레이스 리스크로링을 향상시키는 하이브리드 포인터 네트워크 언어 모델을 제안한다. 비디오 설명에 조건화된 언어 모델과 희귀어 빈도를 높이는 포인터 메커니즘을 사용함으로써, 특히 메타데이터와 번역문이 공통어를 공유할 경우 기준 모델 대비 상대적 개선률 최대 2%에 이르는 의미 있는 WER 감소를 달성한다.

ABSTRACT

Videos uploaded on social media are often accompanied with textual descriptions. In building automatic speech recognition (ASR) systems for videos, we can exploit the contextual information provided by such video metadata. In this paper, we explore ASR lattice rescoring by selectively attending to the video descriptions. We first use an attention based method to extract contextual vector representations of video metadata, and use these representations as part of the inputs to a neural language model during lattice rescoring. Secondly, we propose a hybrid pointer network approach to explicitly interpolate the word probabilities of the word occurrences in metadata. We perform experimental evaluations on both language modeling and ASR tasks, and demonstrate that both proposed methods provide performance improvements by selectively leveraging the video metadata.

연구 동기 및 목표

  • 제목 및 설명과 같은 비디오 메타데이터의 맥락 정보를 통합하여 ASR 정확도를 향상시키기 위해.
  • 무관하거나 노이즈가 많은 메타데이터 문제를 해결하기 위해 관련 내용에만 선택적으로 주의를 기울이는 방법을 개발하기 위해.
  • 하이브리드 포인터 메커니즘을 사용하여 희귀어 및 OOV(Out-of-Vocabulary) 어휘를 효과적으로 처리할 수 있는 신경망 언어 모델을 설계하기 위해.
  • 맥락 기반 언어 모델을 음성 모델 학습에서 분리하여 모듈러하고 독립적인 언어 모델 성능 향상이 가능하도록 하기 위해.
  • 메타데이터 품질이 ASR 성능에 미치는 영향을 평가하고, 맥락 모델링이 최대 성과를 내는 조건을 규명하기 위해.

제안 방법

  • 비디오 메타데이터에 조건화된 신경망 언어 모델을 인코더-디코더 아키텍처에 주의 메커니즘을 적용하여 메타데이터를 맥락 벡터로 요약한다.
  • 기존 어휘 기반 생성 헤드와 메타데이터 시퀀스에서 토큰을 직접 선택하는 포인터 메커니즘을 조합한 하이브리드 포인터 네트워크를 사용한다.
  • 각 디코딩 단계에서 어휘에서 생성할지 또는 메타데이터의 단어를 가리킬지 동적으로 선택하기 위해 소프트 게이트 메커니즘을 적용한다.
  • n-그램 근사화를 사용한 자르기 기반 레이스 리스크로링을 통해 첫 번째 단계의 하이브리드 HMM 기반 시스템에서 생성된 ASR 레이스를 재평가한다.
  • 검증 세트에서 튜닝된 가중치를 사용하여 신경망 언어 모델 점수와 n-그램 언어 모델 점수를 혼합하여 언어 모델링과 디코딩 정확도를 균형 잡는다.
  • 메타데이터와 기준 번역문 간의 공통어 분석을 수행하여 메타데이터 관련성의 영향을 평가한다.

실험 결과

연구 질문

  • RQ1비디오 메타데이터에 조건화된 신경망 언어 모델이 표준 언어 모델 대비 ASR 레이스 리스크로링 성능을 향상시킬 수 있는가?
  • RQ2하이브리드 포인터 네트워크 메커니즘이 흔한 RNN, 캐시-LSTM, 주의 기반 모델 대비 퍼플렉서티 및 WER 측면에서 어떻게 비교되는가?
  • RQ3메타데이터 품질(번역문과의 어휘 공통어 수)을 측정함으로써 제안된 방법의 효과성에 어떤 영향을 미치는가?
  • RQ4포인터 네트워크 메커니즘이 ASR 디코딩에서 희귀어 또는 OOV 단어를 다루는 데 있어 측정 가능한 이점을 제공하는가?
  • RQ5맥락 기반 언어 모델을 음성 모델 학습과 별도로 훈련시킬 수 있으며, 이는 재학습 없이도 ASR 시스템을 모듈러하게 개선할 수 있도록 하는가?

주요 결과

  • 하이브리드 포인터 네트워크는 모든 언어 모델 변종 중에서 가장 낮은 퍼플렉서티를 기록했으며, LSTM, 캐시-LSTM, 주의 기반 모델을 모두 앞섰다.
  • 영어 테스트 세트에서 하이브리드 포인터 네트워크는 클린 조건에서 14.5%, 노이즈 조건에서 21.3%, 극단적 노이즈 조건에서 27.6%의 WER 감소를 기록했으며, 이는 첫 번째 단계 디코딩 대비 최대 2%의 상대적 개선을 의미한다.
  • 스페인어의 경우, 클린 조건에서 WER 12.6%, 노이즈 조건에서 14.5%, 극단적 노이즈 조건에서 20.8%를 기록하여 언어 및 노이즈 조건에 관계없이 일관된 성능 향상을 보였다.
  • 하이브리드 포인터 네트워크의 상대적 WER 감소율(WERR)은 메타데이터와 번역문 간의 공통어 수가 증가할수록 가장 뚜렷하게 나타났으며, 이는 더 높은 품질의 메타데이터에서 성능 향상이 더 크게 나타남을 시사한다.
  • 주의 기반 모델과 LSTM 변종은 기준 모델 대비 약간의 향상을 보였지만, 하이브리드 포인터 네트워크는 특히 공통어 수가 많은 상황에서 일관되게 뛰어난 성능을 보였다.
  • 메타데이터가 테스트 데이터의 대부분(예: 영어 클린 테스트 세트의 78/1203)에서 누락된 경우에도 이 방법은 효과적이었으며, 부분적인 메타데이터 가용성에 대해 강건함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.