[논문 리뷰] Integrating Knowledge in End-to-End Automatic Speech Recognition for Mandarin-English Code-Switching
이 논문은 비어 있는 언어적 기호 통합, 계층적 언어 식별, 서브워드 모델링, 말하기 속도 조절, 데이터 증강을 통해 언어 지식을 통합함으로써 중국어-영어 혼합어 말에 대한 엔드 투 엔드 자동 음성 인식 시스템을 제안한다. 최고의 병합 시스템은 기준 모델 대비 혼합 오류율을 최대 35% 상대적으로 감소시키며, SEAME 코퍼스에서 최신 하이브리드 TDNN-HMM 시스템을 능가한다.
Code-Switching (CS) is a common linguistic phenomenon in multilingual communities that consists of switching between languages while speaking. This paper presents our investigations on end-to-end speech recognition for Mandarin-English CS speech. We analyse different CS specific issues such as the properties mismatches between languages in a CS language pair, the unpredictable nature of switching points, and the data scarcity problem. We exploit and improve the state-of-the-art end-to-end system by merging nonlinguistic symbols, by integrating language identification using hierarchical softmax, by modeling sub-word units, by artificially lowering the speaking rate, and by augmenting data using speed perturbed technique and several monolingual datasets to improve the final performance not only on CS speech but also on monolingual benchmarks in order to make the system more applicable on real life settings. Finally, we explore the effect of different language model integration methods on the performance of the proposed model. Our experimental results reveal that all the proposed techniques improve the recognition performance. The best combined system improves the baseline system by up to 35% relatively in terms of mixed error rate and delivers acceptable performance on monolingual benchmarks.
연구 동기 및 목표
- 중국어와 영어 간 언어 특성 불일치, 예측할 수 없는 전환 지점, 데이터 부족 등의 문제를 해결하기 위해 중국어-영어 혼합어 말의 인식 과제를 다루기 위해.
- 모델 아키텍처와 학습 과정에 언어 지식을 통합하여 엔드 투 엔드 ASR 성능을 향상시키기 위해.
- 다양한 지식 통합 기법과 그 조합이 혼합어 및 단어어 기준 테스트 세트에서 효과적으로 작용하는지 평가하기 위해.
- 최종 인식 정확도에 미치는 다양한 언어 모델 융합 전략의 영향을 조사하기 위해.
- 자연스럽고 다국어를 다룰 수 있는 실용적인 ASR 시스템을 개발하기 위해.
제안 방법
- 의사소통 입자, 망설임 등의 비어 있는 언어적 기호를 ASR 어휘에 통합하여 맥락적 및 억양적 특징의 인식을 향상시키기 위해.
- 해결 과정에서 언어별 예측을 안내하기 위해 계층적 소프트맥스를 사용한 언어 식별을 통합하기 위해.
- 영어 단어를 서브워드 유닛(예: BPE)으로 모델링하여 어휘 외 단어를 처리하고 일반화 능력을 향상시키기 위해.
- 학습 중 말하기 속도를 인위적으로 낮춰 정렬을 개선하고 빠른 말하기에서의 오류를 줄이기 위해.
- 속도 왜곡을 적용하고 단어어 데이터셋과 조합하여 데이터 증강을 수행함으로써 강인성과 커버리지 향상시키기 위해.
- 얕은 융합과 냉각 융합을 사용해 외부 언어 모델을 융합하여 언어 경계 오류를 수정하고 유창성을 향상시키기 위해.
실험 결과
연구 질문
- RQ1중국어와 영어 간 언어 특성 불일치가 혼합어 상황에서 엔드 투 엔드 ASR 성능에 어떤 영향을 미치는가?
- RQ2예측 헤드에 통합된 언어 식별이 전환 지점 인식에 얼마나 기여하는가?
- RQ3서브워드 모델링이 혼합어 문장에서 희귀하거나 어휘 외 영어 단어의 인식에 어떤 영향을 미치는가?
- RQ4속도 왜곡 및 단어어 데이터 혼합을 포함한 데이터 증강 기법의 효과가 모델 일반화에 어떤 영향을 미치는가?
- RQ5얕은 융합과 냉각 융합 중 어느 언어 모델 융합 방법이 언어 경계 오류 수정에 더 나은 성능을 내는가?
주요 결과
- 최고의 병합 시스템인 E2ESW+3W+F3는 SEAME 평가 세트에서 25.0%의 혼합 오류율을 기록하여 기준 모델 대비 35% 상대적 향상을 달성했다.
- 라벨 2 데이터(추가적인 언어학적 주석이 포함됨)를 사용하면 동일한 평가 세트에서 오류율이 23.7%로 추가로 감소했다.
- 얕은 융합(SF)과 냉각 융합(CF)을 통한 언어 모델 융합은 성능 향상에 크게 기여했으며, 일부 경우에서 자동 평가 지표는 다소 열 劣하더라도 인간 평가 결과에서는 CF가 더 우수한 성과를 보였다.
- 서브워드 모델링, 말하기 속도 조절, 데이터 증강의 조합은 모든 테스트 세트, 포함 단어어 기준 테스트 세트에서 일관되게 인식 성능 향상을 이끌었다.
- 제안된 시스템은 최신의 TDNN-HMM 하이브리드 시스템을 능가했으며, 언어 모델 융합을 적용한 결과 22.0%의 MER를 기록한 반면 하이브리드 기준 모델은 29.7%의 MER를 기록했다.
- 외부 언어 모델은 'take'에 대해 '带'를 잘못 인식하거나 'apply'에 대해 'ply'를 잘못 인식하는 등의 잘못된 예측를 효과적으로 수정하여, 모호하거나 청각적으로 유사한 혼합어 토큰을 처리하는 데서 그 가치를 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.