Skip to main content
QUICK REVIEW

[논문 리뷰] Internal Language Model Estimation based Language Model Fusion for Cross-Domain Code-Switching Speech Recognition

Yizhou Peng, Yufei Liu|arXiv (Cornell University)|2022. 07. 09.
Speech Recognition and Synthesis인용 수 5
한 줄 요약

이 논문은 다국어 엔드 투 엔드 ASR 모델을 훈련하기 위해 단일 언어 데이터를 활용하여 교차 도메인 코드 스위칭 음성 인식(CSSR)을 위한 내부 언어 모델 추정(ILME)-기반 언어 모델 융합 방법을 제안한다. Transformer 디코더에서 내부 언어 모델을 추정하고 외부 언어 모델과 융합함으로써 인식 성능을 크게 향상시켜, 상대 오차율 감소율이 최대 32.1%에 이르며, 내부 및 외부 도메인 설정 모두에서 기존 얕은 융합보다 뛰어난 성능을 보인다.

ABSTRACT

Internal Language Model Estimation (ILME) based language model (LM) fusion has been shown significantly improved recognition results over conventional shallow fusion in both intra-domain and cross-domain speech recognition tasks. In this paper, we attempt to apply our ILME method to cross-domain code-switching speech recognition (CSSR) work. Specifically, our curiosity comes from several aspects. First, we are curious about how effective the ILME-based LM fusion is for both intra-domain and cross-domain CSSR tasks. We verify this with or without merging two code-switching domains. More importantly, we train an end-to-end (E2E) speech recognition model by means of merging two monolingual data sets and observe the efficacy of the proposed ILME-based LM fusion for CSSR. Experimental results on SEAME that is from Southeast Asian and another Chinese Mainland CS data set demonstrate the effectiveness of the proposed ILME-based LM fusion method.

연구 동기 및 목표

  • ILME 기반 언어 모델 융합이 내부 도메인 및 교차 도메인 코드 스위칭 음성 인식 작업에서 효과적인지 평가하기.
  • 단일 언어 데이터가 코드 스위칭 인식을 위한 다국어 ASR 모델을 효과적으로 훈련하는 데 활용될 수 있는지 조사하기.
  • ILME 기반 융합이 교차 도메인 CSSR에서 기존 얕은 융합을 능가하는지, 특히 훈련 데이터가 제한된 경우에 대해 입증하기.
  • 통합 CTC-주목력 훈련이 다국어 ASR 모델이 코드 스위칭 발화에 일반화하는 데 기여하는지 탐구하기.

제안 방법

  • 코드 스위칭 음성을 처리하기 위해 CTC-주목력 훈련을 통한 Conformer 기반 엔드 투 엔드 ASR 모델을 사용한다.
  • 내부 언어 모델(ILM)은 단일 언어 텍스트 데이터로 훈련된 Transformer 디코더를 사용하여 추정되며, 언어별 통계를 반영한다.
  • ILME 기반 언어 모델 융합은 ASR 모델의 출력 확률과 추정된 ILM 확률을 가중합으로 융합한다: argmax_Y (log P(Y|X) + λ log P_ILM(Y)).
  • 성능 비교를 위해 얕은 융합(SF)과 LSCL 기반 융합(LSCL)을 모두 적용하였으며, LSCL이 더 우수한 성능을 보였다.
  • SEAME 및 ASRU 코퍼스의 단일 언어 데이터를 융합하여 다국어 ASR 모델을 훈련시켜, 제로샷 교차 도메인 일반화를 가능하게 하였다.
  • 모델은 코드 스위칭 인식 및 단일 언어 훈련 모델 모두에서 평가되었으며, 다양한 데이터 환경에서의 강건성을 입증하였다.

실험 결과

연구 질문

  • RQ1ILME 기반 언어 모델 융합이 교차 도메인 코드 스위칭 음성 인식에서 성능 향상에 기여할 수 있는가?
  • RQ2훈련 데이터가 제한적이거나 단일 언어 데이터로만 구성된 경우 ILME 기반 융합은 얼마나 효과적인가?
  • RQ3통합 CTC-주목력 훈련이 코드 스위칭 데이터를 명시적으로 포함하지 않은 다국어 ASR 모델이 코드 스위칭 발화에 일반화하는 데 기여하는가?
  • RQ4내부 및 교차 도메인 CSSR 작업에서 ILME 기반 융합이 기존 얕은 융합과 비교해 어떻게 성능을 냈는가?
  • RQ5단일 언어 데이터가 코드 스위칭 시나리오에 일반화되는 다국어 ASR 모델을 훈련하는 데 효과적으로 활용될 수 있는가?

주요 결과

  • 단일 언어 데이터만으로 훈련했을 때, ILME 기반 언어 모델 융합 방법은 ASRU 테스트 세트에서 얕은 융합 대비 최대 32.1%의 상대 오차율 감소를 달성했다.
  • SEAME 코퍼스에서는 내부 도메인 테스트에서 단어 오류율이 15.7%에서 15.4%로 1.4个百分点 감소했으며, 교차 도메인 설정에서도 일관된 향상이 관찰되었다.
  • LSCL 기반 융합 변종은 모든 테스트 세트에서 얕은 융합을 능가했으며, ASRU dev2 세트에서 단어 오류율이 49.7%에서 46.5%로 3.3% 절대 감소했다.
  • 융합된 단일 언어 데이터로 훈련된 다국어 ASR 모델은 최고의 베이스라인 성능을 보였으며, SEAME 테스트 세트에서 63.9%의 WER를 기록했고, ILME 융합을 통해 추가로 향상되었다.
  • CTC 전용 모델은 단일 언어 및 코드 스위칭 데이터에서 안정적인 수렴을 보였지만, 주목력 전용 모델은 검증 데이터에서 발산했으며, 이는 주목력이 새로운 코드 스위칭 패턴에 일반화하기 어려운 점을 시사한다.
  • 결과는 ILME 기반 융합이 코드 스위칭 레이블이 없는 훈련 데이터에서도 효과적이며, 자원이 제한된 코드 스위칭 시나리오에 적합함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.