[논문 리뷰] Combined Acoustic and Pronunciation Modelling for Non-Native Speech Recognition
이 논문은 비모국어 영어 발음 인식 성능을 향상시키기 위해 발음 모델링과 음향 적응의 병합 접근법을 제안한다. L1과 L2 발음 간 유사성을 기반으로 한 발음 혼동 행렬을 사용하고, 음향 모델에 MLLR/MAP 적응 또는 모델 재추정을 적용함으로써, HIWIRE 데이터베이스에서 상대적 단어 오류율을 46%에서 71%까지 감소시켰다. 특히 모델 재추정과 발음 모델링을 결합한 방법이 가장 우수한 성능을 보였다.
In this paper, we present several adaptation methods for non-native speech recognition. We have tested pronunciation modelling, MLLR and MAP non-native pronunciation adaptation and HMM models retraining on the HIWIRE foreign accented English speech database. The ``phonetic confusion'' scheme we have developed consists in associating to each spoken phone several sequences of confused phones. In our experiments, we have used different combinations of acoustic models representing the canonical and the foreign pronunciations: spoken and native models, models adapted to the non-native accent with MAP and MLLR. The joint use of pronunciation modelling and acoustic adaptation led to further improvements in recognition accuracy. The best combination of the above mentioned techniques resulted in a relative word error reduction ranging from 46% to 71%.
연구 동기 및 목표
- 표준 ASR 시스템이 모국어 음성 데이터로 훈련될 경우 비모국어 영어 사용자에 대해 잘 처리되지 않는 문제를 해결하기 위해 자동 음성 인식 성능을 향상시키는 것.
- 비모국어 사용자가 영어를 사용하는 실제 응용 분야(예: 항공 교통 관제)에서의 외국어 발음 문제를 해결하기 위한 것.
- 각 L1/L2 쌍에 대해 대규모 전용 비모국어 음성 코퍼스가 필요하지 않은 확장 가능한 방법을 개발하는 것.
- MLLR, MAP 및 모델 재추정과 같은 음향 적응 기법과 발음 모델링을 결합하는 것이 효과적인지 조사하는 것.
- 음향적으로 적응된 모국어 모델을 발음 모델링에 사용할 경우 인식 정확도가 향상되는지 평가하는 것.
제안 방법
- 각 말하는 언어(비모국어 언어, SL)의 음소를 발음 유사성 기반으로 다수의 혼동된 모국어 언어(NL) 음소 시퀀스로 매핑하는 '발음 혼동' 기법을 사용한다.
- 비모국어 음성 데이터를 기반으로 MLLR(최대가능도선형회귀) 및 MAP(최대사후확률) 기법을 사용하여 음향 모델을 비모국어 발음 스타일에 적응시킨다.
- 혼동 행렬에 표준 SL 모델과 (표준 또는 적응된) NL 모델을 모두 사용하여 음향 적응과 발음 모델링을 결합한다.
- 비모국어 특성에 더 잘 대응하기 위해 소규모 적응 코퍼스를 사용하여 SL 모델에 대해 모델 재추정을 적용한다.
- 혼동 행렬에서 유도된 보조 발음 방식을 포함하도록 사전을 수정하여 비모국어 변형어의 인식을 가능하게 한다.
- HIWIRE 데이터베이스에서 제약 있는 어휘 루프 및 자유 어휘 루프 문법을 사용하여, 표준, 적응, 또는 재추정된 HMM 모델 세트의 다양한 조합을 비교하는 실험을 수행한다.
실험 결과
연구 질문
- RQ1발음 모델링과 음향 적응을 병합하면 비모국어 음성 인식에서 단어 오류율을 상당히 감소시킬 수 있는가?
- RQ2발음 모델링에 음향적으로 적응된 모국어 모델을 사용할 경우 표준 모델을 사용하는 것보다 성능이 향상되는가?
- RQ3MLLR, MAP 및 모델 재추정과 같은 다양한 적응 기법이 비모국어 발음에 대한 인식 정확도에 어떤 영향을 미치는가?
- RQ4성능 향상은 사용된 문법 유형(제약 있는 문법 대비 자유 어휘 루프 문법)에 따라 달라지는가?
- RQ5혼동 행렬 내 모델 변동성의 인식 정확도에 대한 영향은 무엇인가?
주요 결과
- 발음 모델링과 음향 적응을 병합한 결과, 기준 시스템 대비 상대적 단어 오류율이 46%에서 71%까지 감소하였다.
- 가장 우수한 성능은 'Confusion7' 설정에서 달성되었으며, 이는 표준 영어 모델의 모델 재추정과 표준 영어 모델 및 재추정 모델 간 혼동 행렬을 사용한 발음 모델링을 조합한 것이다.
- 모델 재추정이 MLLR 및 MAP 적응보다 우수했으며, 특히 제약 있는 문법 조건에서 뚜렷한 성능 향상을 보였다. 자유 문법 조건에서는 1.4% WER 및 3.2% SER를 기록하였다.
- 혼동 행렬에 동일한 모델(예: 표준 대 표준)을 사용할 경우, 다양한 모델을 사용한 경우보다 성능이 열 劣하므로, 모델의 다양성이 인식 성능 향상에 기여함을 시사한다.
- 'Confusion6' 시스템은 두 혼동 집합 모두에 MAP 적응된 영어 모델을 사용했으며, 'Confusion5' 시스템(맵 적응된 모국어 모델 사용)보다 우수했다. 이는 영어 모델 적응이 감독된 성격을 띠기 때문일 것이다.
- 'Confusion1' 및 'Confusion2' 시스템은 MAP 적응을 사용했음에도 기준 시스템보다 성능이 열 劣했으며, 이는 동일하거나 매우 유사한 모델 간 혼동이 시스템의 강건성을 저하시키기 때문임을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.