[논문 리뷰] A Comparison of Modeling Units in Sequence-to-Sequence Speech Recognition with the Transformer on Mandarin Chinese
이 논문은 HKUST 데이터셋을 대상으로 Transformer 기반의 시퀀스-투-시퀀스 모델을 사용하여 CI-phonemes, 음절, 단어, 서브-워드, 문자의 다섯 가지 모델링 유닛을 평가한다. 문자 기반 모델은 수작업으로 설계된 어휘나 외부 언어 모델 없이도 새로운 최고 성능 CER 26.64%를 달성하였으며, 이는 이전 방법들보다 상대적으로 4.8%의 오류 감소를 기록하였다.
The choice of modeling units is critical to automatic speech recognition (ASR) tasks. Conventional ASR systems typically choose context-dependent states (CD-states) or context-dependent phonemes (CD-phonemes) as their modeling units. However, it has been challenged by sequence-to-sequence attention-based models, which integrate an acoustic, pronunciation and language model into a single neural network. On English ASR tasks, previous attempts have already shown that the modeling unit of graphemes can outperform that of phonemes by sequence-to-sequence attention-based model. In this paper, we are concerned with modeling units on Mandarin Chinese ASR tasks using sequence-to-sequence attention-based models with the Transformer. Five modeling units are explored including context-independent phonemes (CI-phonemes), syllables, words, sub-words and characters. Experiments on HKUST datasets demonstrate that the lexicon free modeling units can outperform lexicon related modeling units in terms of character error rate (CER). Among five modeling units, character based model performs best and establishes a new state-of-the-art CER of $26.64\%$ on HKUST datasets without a hand-designed lexicon and an extra language model integration, which corresponds to a $4.8\%$ relative improvement over the existing best CER of $28.0\%$ by the joint CTC-attention based encoder-decoder network.
연구 동기 및 목표
- 시퀀스-투-시퀀스 모델을 사용하여 다양한 모델링 유닛이 중국어 말하기 인식에 미치는 영향을 조사하는 것.
- 수작업 어휘에 의존하지 않는 모델링 유닛(예: 문자, 서브-워드)이 수작업 어휘에 의존하는 유닛(예: CI-phonemes, 음절)보다 엔드 투 엔드 말하기 인식에서 더 우수한 성능을 내는지 확인하는 것.
- HKUST 중국어 말하기 인식 데이터셋에서 Transformer 아키텍처를 사용한 문자 수준 모델링의 성능을 평가하는 것.
- 수작업으로 구성된 어휘나 외부 언어 모델에 의존하지 않고도 문자 오류율(CER)에서 새로운 최고 성능 기록을 달성하는 것.
제안 방법
- 엔드 투 엔드 시퀀스-투-시퀀스 음성 인식을 위해 다중 헤드 어텐션을 사용하는 Transformer 기반 인코더-디코더 아키텍처를 사용한다.
- 다섯 가지 모델링 유닛을 평가한다: 맥락 독립적 음소(CI-phonemes), 음절(Pinyin와 음조 포함), 단어, 서브-워드(바이트 쌍 인코딩을 통해 생성), 문자.
- 서브-워드 유닛은 OOV(외부 어휘) 문제를 줄이고 일반화 능력을 향상시키기 위해 바이트 쌍 인코딩(BPE)을 사용해 생성된다.
- 속도 왜곡을 통한 데이터 증강 기법을 사용해 HKUST 중국어 음성 인식 데이터셋에서 모델을 엔드 투 엔드로 훈련한다.
- 성능 평가에는 문자 오류율(CER)을 사용하며, 모든 다섯 가지 모델링 유닛 간 성능을 비교한다.
- 최고의 성능을 보인 모델은 문자 수준의 유닛을 사용하며, 외부 언어 모델이나 어휘 통합 없이 최고 성능을 달성한다.
실험 결과
연구 질문
- RQ1Transformer 기반의 시퀀스-투-시퀀스 모델을 사용할 때, 수작업 어휘에 의존하지 않는 모델링 유닛(예: 문자, 서브-워드, 단어)이 수작업 어휘에 의존하는 유닛(예: CI-phonemes, 음절)보다 중국어 말하기 인식에서 더 우수한 성능을 내는가?
- RQ2HKUST 중국어 말하기 인식 데이터셋에서 문자 수준 모델링이 평가된 모든 모델링 유닛 중 최고의 성능을 내는가?
- RQ3특히 CTC-어텐션 병합 및 별도의 언어 모델을 사용하는 기존 최고 성능 시스템과 비교해, 문자 기반 모델의 상대적 성능 향상은 어느 정도인가?
- RQ4CER 및 일반화 능력 측면에서 서브-워드 유닛(BPE)의 성능은 문자 수준 모델링과 어떻게 비교되는가?
- RQ5수작업으로 설계된 발음 어휘가 필요 없이도 Transformer 기반 모델이 중국어 말하기 인식에서 최고 성능을 달성할 수 있는가?
주요 결과
- 문자 기반의 Transformer 모델은 HKUST 데이터셋에서 새로운 최고 성능 CER 26.64%를 달성하여, 다른 모든 모델링 유닛을 압도한다.
- 문자 수준 모델은 외부 RNN-LM를 사용하는 CTC-어텐션 모델이 이전에 달성한 최고 성능 28.0% 대비 상대적으로 4.8%의 오류 감소를 기록하였다.
- 서브-워드 모델(BPE)은 CER 27.26%를 기록하였으며, 단어 수준 모델링(27.42%)보다 우수하지만 문자 수준 모델링보다는 약간 열등하다.
- 수작업 어휘에 의존하지 않는 모델링 유닛(문자, 서브-워드, 단어)은 항상 수작업 어휘에 의존하는 유닛(CI-phonemes, 음절)보다 뛰어난 성능을 보였으며, 수작업으로 구성된 어휘를 제거하는 것이 가능함을 입증한다.
- 문자 기반 모델은 CD 상태를 사용하는 하이브리드 LSTM-HMM 시스템 대비 상대적으로 13.4%의 CER 감소를 기록하였으며, 엔드 투 엔드 Transformer 접근 방식의 우수성을 보여준다.
- 결과는 문자 수준 모델링이 Transformer 기반 모델을 사용할 때 중국어 말하기 인식에 특히 적합하며, 외부 언어 모델이나 어휘 없이도 높은 성능을 달성할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.