Skip to main content
QUICK REVIEW

[논문 리뷰] The ASRU 2019 Mandarin-English Code-Switching Speech Recognition Challenge: Open Datasets, Tracks, Methods and Results

Xian Shi, Qiangze Feng|arXiv (Cornell University)|2020. 07. 12.
Speech Recognition and Synthesis참고 문헌 20인용 수 20
한 줄 요약

이 논문은 ASRU 2019 중국어-영어 혼합어 말하기 인식 챌린지를 제시하며, 세 가지 트랙으로 나뉘어 500시간의 중국어 전용 및 240시간의 문장 내 중국어-영어 혼합어 음성 데이터를 공개한다: 고정된 3-gram 언어모델(LM)을 사용하는 전통적인 DNN-HMM ASR, 제약이 없는 언어모델을 사용하는 전통적인 DNN-HMM ASR, 그리고 엔드 투 엔드(E2E) ASR. 주요 발견은 데이터 증강, 발음 어휘사전, 언어 식별이 성능 향상에 기여했으며, E2E 모델이 특히 spec-augment와 다중 작업 학습에서 가장 큰 이점을 얻었지만, 이 설정에서는 여전히 전통적 시스템이 E2E 모델보다 성능이 뛰어났다.

ABSTRACT

Code-switching (CS) is a common phenomenon and recognizing CS speech is challenging. But CS speech data is scarce and there' s no common testbed in relevant research. This paper describes the design and main outcomes of the ASRU 2019 Mandarin-English code-switching speech recognition challenge, which aims to improve the ASR performance in Mandarin-English code-switching situation. 500 hours Mandarin speech data and 240 hours Mandarin-English intra-sentencial CS data are released to the participants. Three tracks were set for advancing the AM and LM part in traditional DNN-HMM ASR system, as well as exploring the E2E models' performance. The paper then presents an overview of the results and system performance in the three tracks. It turns out that traditional ASR system benefits from pronunciation lexicon, CS text generating and data augmentation. In E2E track, however, the results highlight the importance of using language identification, building-up a rational set of modeling units and spec-augment. The other details in model training and method comparsion are discussed.

연구 동기 및 목표

  • 중국어-영어 ASR 연구를 위한 개방형 표준 혼합어 음성 데이터셋의 부족 문제를 해결하기 위해.
  • 다양한 학습 철학에 따라 혼합어 ASR 시스템을 평가하고 비교할 수 있는 공통 테스트베드를 마련하기 위해.
  • 문장 내 중국어-영어 혼합어를 다루는 데 있어 전통적 DNN-HMM과 엔드 투 엔드(E2E) ASR 모델의 효과성을 조사하기 위해.
  • 데이터 증강, 언어 모델링, 모델링 단위 설계가 혼합어 ASR 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • 3-gram 혼합어 언어모델(LM)을 ARPA 형식으로 포함한, 중국어 전용 500시간과 문장 내 중국어-영어 혼합어 240시간의 음성 데이터, 해당 전사본을 공개하였다.
  • 세 가지 평가 트랙을 설계하였다: (1) 고정된 3-gram LM를 사용하는 전통적 ASR, (2) 제약이 없는 언어모델을 사용하는 전통적 ASR, (3) 순서-순서 시퀀스 모델을 사용하는 엔드 투 엔드(이하 E2E) ASR.
  • 학습 데이터 확장을 위해 병렬 번역 및 포인터-생성기 네트워크를 통한 텍스트 생성과 같은 데이터 증강 기법의 사용을 권장하였다.
  • E2E 모델에서 언어 식별(LID)을 감독 신호로 활용하여 프레임 수준의 언어 경계 식별 성능 향상을 유도하였다.
  • 전통적 및 E2E 시스템 모두에서 데이터 증강을 위해 spec-augment를 적용하여 시스템의 강인성을 향상시켰다.
  • 트랙 1의 기준 3-gram LM 대비 혼합 오류율(MERR)을 사용하여 시스템 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1제한된 언어모델 대비 제약이 없는 언어모델을 사용할 경우, 전통적 DNN-HMM ASR 시스템이 중국어-영어 혼합어 음성 데이터에서 어떻게 성능을 내는가?
  • RQ2텍스트 생성 및 발음 어휘사전 확장을 포함한 데이터 증강 기법이 혼합어 ASR 성능 향상에 얼마나 기여하는가?
  • RQ3엔드 투 엔드(이하 E2E) ASR 모델은 문장 내 혼합어 발화를 인식하는 데 전통적 하이브리드 시스템과 비교해 어떻게 성능을 내는가?
  • RQ4언어 식별(LID)은 엔드 투 엔드 혼합어 ASR 모델의 성능 향상에 어떤 역할을 하는가?
  • RQ5문자, 워드피ece, 자음절 중 어떤 모델링 단위 설계가 多어휘 혼합어 ASR에서 최적의 성능을 낼 수 있는가?

주요 결과

  • 전통적 DNN-HMM 시스템은 중국어 부분 오류율을 5% 이하로 유지하고 영어 오류율을 20% 이하로 낮혀 강력한 기준 성능을 보였다.
  • 특히 병렬 번역 및 포인터-생성기 네트워크를 활용한 텍스트 생성을 통한 데이터 증강이 언어 모델링에서 2%~4%의 인식 성능 향상을 이끌어냈다.
  • E2E 모델에서 언어 식별 손실이 성능 향상에 크게 기여하여, 모델이 프레임 수준에서 언어 경계를 더 정확히 식별하도록 도왔다.
  • Spec-augment는 전통적 및 E2E 시스템 모두에서 일관되고 강인한 성능 향상을 제공하였다.
  • E2E 트랙의 우승자는 다중 작업 학습, 레이블 스무딩, 체크포인트 평균화를 적용한 Transformer 모델을 사용하여 E2E 시스템 중 최고의 성능을 기록하였다.
  • 다만 진전이 있었음에도 불구하고, 이 챌린지에서는 여전히 E2E 모델이 전통적 DNN-HMM 시스템을 앞서지 못했으며, 성능 격차는 점차 좁아지고 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.