[논문 리뷰] OC16-CE80: A Chinese-English Mixlingual Database and A Speech Recognition Baseline
이 논문은 MixASR-CHEN 2016 도전대회를 위해 설계된 80시간 분량의 중국어-영어 혼성어 음성 데이터베이스인 OC16-CE80을 제시한다. 이 데이터베이스는 1,400명 이상의 화자로부터 수집되었으며, DNN-HMM 하이브리드 시스템과 THCHS30 및 OC16-CE80에서 학습한 언어모델을 사용한 베이스라인은 총 단어오류율(WER)이 20.09%를 기록하여, 다국어 음성인식 연구에 있어 데이터베이스의 타당성을 입증한다. 다만 음성모델과 언어모델 간의 언어 경쟁으로 인해 영어 단어에 대해 높은 오류율을 보이며, 이는 한계점으로 지적된다.
We present the OC16-CE80 Chinese-English mixlingual speech database which was released as a main resource for training, development and test for the Chinese-English mixlingual speech recognition (MixASR-CHEN) challenge on O-COCOSDA 2016. This database consists of 80 hours of speech signals recorded from more than 1,400 speakers, where the utterances are in Chinese but each involves one or several English words. Based on the database and another two free data resources (THCHS30 and the CMU dictionary), a speech recognition (ASR) baseline was constructed with the deep neural network-hidden Markov model (DNN-HMM) hybrid system. We then report the baseline results following the MixASR-CHEN evaluation rules and demonstrate that OC16-CE80 is a reasonable data resource for mixlingual research.
연구 동기 및 목표
- 코드스위칭 음성인식 연구를 지원하기 위해 공개 가능한 대규모 중국어-영어 혼성어 음성 데이터베이스를 개발하기 위해.
- 저자원 다국어 음성인식 문제를 해결하기 위해, 코드스위칭 문장에 대한 시스템 평가를 위한 표준화된 벤치마크를 제공하기 위해.
- MixASR-CHEN 2016 도전대회 참가자들을 안내하기 위해 OC16-CE80 데이터베이스와 보조 데이터셋(THCHS30, CMU 사전)을 활용한 음성인식 베이스라인 시스템을 수립하기 위해.
- 중국어 문장 내에 통합된 영어 단어를 인식하는 데 있어 발생하는 곤란함, 특히 음성모델과 언어모델 간의 언어 경쟁으로 인한 문제를 분석하기 위해.
제안 방법
- OC16-CE80 데이터베이스는 스마트폰을 이용해 1,400명 이상의 화자로부터 수집되었으며, 16kHz, 16비트 해상도로 촬영된 80시간 분량의 음성자료와 독서 스타일의 텍스트(transcription)를 포함한다.
- 데이터베이스는 학습(63.8시간, 1,163명의 화자), 개발(7.76시간, 140명의 화자), 테스트(7.93시간, 142명의 화자)로 나뉘었으며, 모든 세트는 중국어를 매트릭스 언어로 사용하고 영어 단어를 내장한 문장을 포함한다.
- THCHS30 중국어 코퍼스와 OC16-CE80 데이터베이스를 기반으로 DNN-HMM 하이브리드 음성인식 시스템을 구축하였으며, CMU 사전과 OC16-CE80의 텍스트 전사로부터 어휘를 유도하였다.
- 네 종류의 언어모델을 학습하였다: THLM(THCHS30에서 유도), OCLM(OC16-CE80에서 유도), MIX(THLM과 OCLM의 선형 통합), JOIN(두 데이터셋을 동시에 학습한 모델)이며, 가중치 통합 비율은 2,000문장의 검증 세트에서 최적화되었다.
- 시스템은 언어모델 가중치와 단어 삽입 펜alties의 선형 통합을 통해 중국어와 영어 단어 간의 인식 성능 균형을 맞추었다.
- MIX 언어모델 설정에서 오류 분석을 수행하여, 특히 영어 단어에 대한 비율이 높은 오류율을 보이는 교체, 삭제, 삽입 오류를 식별하였다.
실험 결과
연구 질문
- RQ1OC16-CE80 데이터베이스는 중국어-영어 코드스위칭 음성인식에 있어 학습 및 평가 자료로 얼마나 효과적인가?
- RQ2중국어 문장 내에 통합된 영어 단어를 인식하는 데 있어 주요한 음성적 및 언어학적 과제는 무엇인가?
- RQ3언어모델 도메인 불일치가 혼성어 음성인식 성능에 미치는 영향은 어느 정도이며, 특히 THCHS30과 같은 외부 코퍼스를 사용할 경우 어떻게 되는가?
- RQ4중국어와 영어 언어모델 및 음성모델 간의 경쟁이 단어오류율에 미치는 영향은 무엇이며, 특히 영어 단어에 대해 어떻게 나타나는가?
- RQ5공개 자원만을 사용할 경우 표준 DNN-HMM 시스템이 혼성어 데이터에서 합리적인 성능을 달성할 수 있는가?
주요 결과
- MIX 언어모델을 사용한 베이스라인 시스템은 테스트 세트에서 총 단어오류율(WER)이 20.09%를 기록하였다.
- OC16-CE80에서 단독으로 학습된 OCLM 언어모델은 중국어 단어에 대해 WER 19.00%를 기록했고, 영어 단어에 대해서는 43.67%를 기록하여, 단일 언어 중국어 코퍼스에서 학습된 THLM 모델(영어 단어에 대해 100% WER 기록)을 초월하였다.
- THCHS30 단일 언어 중국어 코퍼스에서 학습된 THLM 모델은 영어 단어에 대해 빈약한 성능을 보였으며, 이는 도메인 불일치가 심각하고 코드스위칭 데이터에 대한 일반화 능력이 떨어짐을 시사한다.
- 영어 단어에 대한 교체 및 삭제 오류 비율이 중국어 단어보다 뚜렷이 높았으며, 영어 단어의 총 오류 중 22.11%가 교체 오류에 해당하였다.
- 영어 단어에 대한 높은 오류율은 영어 음소의 약한 음성모델링과 특히 영어 단어를 포함하는 전이에 대한 낮은 언어모델 확률로 인해 발생하며, 이는 복구 과정에서 중국어 단어만 포함된 시퀀스로의 디코딩 편향을 유도한다.
- 오류 분석 결과, 많은 영어 단어의 교체 오류는 중국어 단어와의 음운적 유사성으로 인해 발생함을 확인하였으며, 이는 혼성어 음성인식에서 언어 간 음성 혼동이 주요 과제임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.