Skip to main content
QUICK REVIEW

[논문 리뷰] Towards End-to-end Automatic Code-Switching Speech Recognition

Genta Indra Winata, Andrea Madotto|arXiv (Cornell University)|2018. 10. 30.
Speech Recognition and Synthesis참고 문헌 14인용 수 12
한 줄 요약

이 논문은 별도의 언어 식별자 없이 언어 전환 패턴에 적응할 수 있는 CTC 기반 엔드 투 엔드 음성 인식 모델을 제안한다. 먼저 단일 언어의 영어 및 중국어 데이터셋을 공동으로 훈련한 후 혼합 언어 코퍼스에서 미세조정을 수행한다. 이 방법은 전이 학습을 활용하여 문자 오류율(CER)을 5% 상대적으로 감소시키며, n-gram 언어 모델을 사용한 재평가를 통해 디코딩 성능을 향상시킨다.

ABSTRACT

Speech recognition in mixed language has difficulties to adapt end-to-end framework due to the lack of data and overlapping phone sets, for example in words such as "one" in English and "wàn" in Chinese. We propose a CTC-based end-to-end automatic speech recognition model for intra-sentential English-Mandarin code-switching. The model is trained by joint training on monolingual datasets, and fine-tuning with the mixed-language corpus. During the decoding process, we apply a beam search and combine CTC predictions and language model score. The proposed method is effective in leveraging monolingual corpus and detecting language transitions and it improves the CER by 5%.

연구 동기 및 목표

  • 언어 전환이 예측 불가능하고 데이터가 제한된 코드 스위칭 음성에서 자동 음성 인식의 과제를 해결한다.
  • 음성, 발음, 언어 모델링을 별도로 다루는 전통적인 파ip라인 ASR 시스템의 한계를 극복한다.
  • 언어 식별을 명시적으로 의존하지 않고도 단일 언어 데이터에서 공동으로 학습하고 코드 스위칭 패턴에 적응할 수 있는 엔드 투 엔드 프레임워크를 개발한다.
  • 단일 언어 코퍼스에서의 전이 학습을 통해 혼합 언어 발화의 일반화 및 강인성을 향상시킨다.
  • 공동 훈련과 미세조정이 코드 스위칭 인식에서 문자 오류율(CER)을 감소시키는 데 효과적인지 입증한다.

제안 방법

  • 혼합 언어 코퍼스에서의 미세조정 이전에 별도의 단일 언어 영어 및 간체 중국어 데이터셋을 공동으로 훈련한 CTC 기반 엔드 투 엔드 ASR 모델을 훈련한다.
  • 특징 추출 및 시퀀스 모델링을 위해 배치 정규화와 ReLU 활성화 함수를 적용한 CNN-BiGRU 아키텍처를 사용한다.
  • 영어와 간체 중국어 문자 집합을 결합하여 단일 출력 어휘로 통합한다.
  • 비트 사이즈 100의 빔 서치 디코딩을 수행하며, CTC 예측과 언어 모델 점수를 가중 조합(α=0.2, β=1)하여 통합한다.
  • 단일 언어 데이터에서 사전 훈련한 후 혼합 언어 데이터에서의 미세조정을 통해 언어 전환에 적응한다.
  • 문법성 향상과 오류 수정을 위해 3-그램, 4-그램, 5-그램 n-그램 언어 모델을 사용해 최종 가설을 재평가한다.

실험 결과

연구 질문

  • RQ1혼합 언어 데이터에서만 훈련하는 것에 비해, 단일 언어 데이터에서의 공동 훈련이 엔드 투 엔드 코드 스위칭 ASR 성능을 향상시키는가?
  • RQ2명시적인 언어 식별자 없이 CTC 기반 모델이 내문장 코드 스위칭에서 언어 전환을 얼마나 정확하게 탐지하고 음성으로 변환할 수 있는가?
  • RQ3공동 사전 훈련 후에 더 작은 코드 스위칭 코퍼스에서의 미세조정이 문자 오류율(CER)을 얼마나 감소시키는가?
  • RQ4외부 n-그램 언어 모델을 사용한 재평가가 디코딩 정확도에 얼마나 기여하는가?
  • RQ5유사한 발음의 단어, 예를 들어 'one'과 'wàn'을 코드 스위칭 맥락에서 올바르게 인식할 수 있는가?

주요 결과

  • 단일 언어 데이터에서의 공동 훈련 후 코드 스위칭 데이터에서의 미세조정으로 인해, 혼합 언어 코퍼스에서만 훈련한 경우 대비 문자 오류율(CER)이 5% 감소했다.
  • 모델은 언어 전환을 성공적으로 탐지하고 복잡한 내문장 코드 스위칭 패턴에서도 영어 및 중국어 문자를 정확하게 변환했다.
  • 코드 스위칭 데이터의 50%만으로도 전체 데이터셋을 사용한 경우와 유사한 성능을 달성하여 높은 데이터 효율성을 보였다.
  • 5-그램 언어 모델을 사용한 재평가로 CER가 추가로 1% 감소했으며, 기준 출력에서 철자 및 문법 오류를 수정했다.
  • 모델는 'before'와 'for'처럼 청각적으로 유사한 단어를 코드 스위칭 맥락에서 올바르게 매핑함으로써 일반화 능력이 향상되었다.
  • 개선된 성능에도 불구하고 모델는 여전히 양 언어의 균형 임베딩 유지를 어려워하며, 향후 연구에서 치명적인 잊힘 문제를 해결할 필요가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.