Skip to main content
QUICK REVIEW

[논문 리뷰] A comparable study of modeling units for end-to-end Mandarin speech recognition

Wei Zou, Dongwei Jiang|arXiv (Cornell University)|2018. 05. 10.
Speech Recognition and Synthesis참고 문헌 24인용 수 5
한 줄 요약

이 연구는 CTC 및 주의 기반 인코더-디코더 모델을 사용한 엔드 투 엔드 중국어 말하기 인식에서 맥락에 의존하는 음소, 음절(음조 포함), 중국자(한자)를 모델링 단위로 비교한다. 결과적으로 문자 기반 주의 모델이 가장 뛰어난 성능을 보였으며, DidiCallcenter에서 5.68%의 CER, DidiReading에서 4.89%의 CER를 기록하여 CTC 및 음절 기반 모델을 모두 앞서며, 중국어 문자가 중국어 음성 인식에 매우 적합한 단위임을 시사한다.

ABSTRACT

End-To-End speech recognition have become increasingly popular in mandarin speech recognition and achieved delightful performance. Mandarin is a tonal language which is different from English and requires special treatment for the acoustic modeling units. There have been several different kinds of modeling units for mandarin such as phoneme, syllable and Chinese character. In this work, we explore two major end-to-end models: connectionist temporal classification (CTC) model and attention based encoder-decoder model for mandarin speech recognition. We compare the performance of three different scaled modeling units: context dependent phoneme(CDP), syllable with tone and Chinese character. We find that all types of modeling units can achieve approximate character error rate (CER) in CTC model and the performance of Chinese character attention model is better than syllable attention model. Furthermore, we find that Chinese character is a reasonable unit for mandarin speech recognition. On DidiCallcenter task, Chinese character attention model achieves a CER of 5.68% and CTC model gets a CER of 7.29%, on the other DidiReading task, CER are 4.89% and 5.79%, respectively. Moreover, attention model achieves a better performance than CTC model on both datasets.

연구 동기 및 목표

  • 다양한 모델링 단위—맥락에 의존하는 음소, 음절(음조 포함), 중국자—의 엔드 투 엔드 중국어 음성 인식에서의 효과성을 평가하기 위해.
  • 연결주의 시간 분류(CTC) 및 주의 기반 인코더-디코더 모델이라는 두 가지 주요 엔드 투 엔드 아키텍처의 성능을 비교하기 위해.
  • 저자원 및 도메인 특화 환경에서 중국어 음성 인식을 위한 최적의 모델링 단위와 아키텍처 조합을 규명하기 위해.
  • 외부 언어 모델 및 모델 크기가 인식 정확도에 미치는 영향을 평가하기 위해.

제안 방법

  • 동일한 데이터와 학습 절차를 사용하여 CTC 및 주의 기반 인코더-디코더 모델을 학습하였으며, 유일한 차이점은 모델링 단위(CDP, 음절, 문자)뿐이었다.
  • 주의 모델의 경우 인코더에 양방향 LSTMs, 디코더에 단방향 LSTMs를 사용하였으며, 정렬을 위해 주의 메커니즘을 적용하였다.
  • 학습 중 스케줄드 샘플링과 유니그램 레이블 스무딩을 적용하였으며, Adam 최적화 및 기울기 클리핑을 사용하였다.
  • 향상된 성능을 위해 왼쪽에서 오른쪽으로의 빔 서치 디코딩과 외부 언어 모델을 활용하였다.
  • CTC에서는 빈도 토큰을 사용하여 프레임-라벨 정렬을 처리하였으며, 강제 정렬이 필요하지 않았다.
  • 두 중국어 음성 인식 데이터셋인 DidiCallcenter와 DidiReading에서 문자 오류율(CER)을 사용하여 모델 성능을 비교하였다.

실험 결과

연구 질문

  • RQ1CTC 기반 중국어 음성 인식에서 맥락에 의존하는 음소, 음절(음조 포함), 중국자 중 어느 모델링 단위가 가장 낮은 문자 오류율(CER)을 낼 수 있는가?
  • RQ2다양한 모델링 단위를 사용할 때, 주의 기반 인코더-디코더 모델의 성능은 중국어 음성 인식에서 CTC 모델과 어떻게 비교되는가?
  • RQ3외부 언어 모델의 사용이 인식 성능을 향상시키는가? 이 효과는 데이터셋 또는 모델링 단위에 따라 달라지는가?
  • RQ4모델 크기를 동일하게 유지할 경우, CTC 모델과 주의 모델 간에 유의미한 성능 격차가 존재하는가?
  • RQ5자기 언어 모델이나 어휘집을 별도로 필요로 하지 않고도 중국어 문자가 엔드 투 엔드 중국어 음성 인식에서 타당하고 효과적인 모델링 단위로 활용될 수 있는가?

주요 결과

  • DidiCallcenter 데이터셋에서 문자 기반 주의 모델은 CER 5.68%를 기록하여 CTC 모델(7.29%)과 음절 기반 모델보다 유의미하게 뛰어났다.
  • DidiReading 데이터셋에서 문자 기반 주의 모델은 CER 4.89%를 기록하여 음절 기반 CTC 모델의 5.62%에서 향상되었다.
  • 모든 모델링 단위가 CTC 모델에서 유사한 CER를 기록하였으며, 음절 기반 CTC 모델가 가장 우수한 성능(5.62%의 CER)을 기록했고, 파rameter 수가 적었다.
  • 주의 기반 모델은 파rameter 수가 크게 적은(12.54M 대비 CTC의 86.05M)에도 불구하고, 두 데이터셋에서 모두 CTC 모델을 앞섰다.
  • 외부 언어 모델은 두 데이터셋 모두에서 성능 향상을 가져왔으며, 도메인 특화된 DidiReading 작업에서 더 두드러진 효과를 보였다.
  • 문자 기반 주의 모델의 뛰어난 성능은 RNN 디코더의 암묵적 언어 모델링 능력과 중국어에 적합한 단위로서의 문자의 적합성 덕분이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.