Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Modeling of Accents and Acoustics for Multi-Accent Speech Recognition

Xuesong Yang, Kartik Audhkhasi|arXiv (Cornell University)|2018. 02. 07.
Speech Recognition and Synthesis참고 문헌 20인용 수 5
한 줄 요약

이 논문은 양방향 LSTM와 연결주의 시간 분류(CTC) 손실을 사용하여 음성 모델과 발음 식별(AID) 모델을 동시에 훈련하는 종단간(end-to-end) 학습 프레임워크를 제안한다. 훈련 중에 AID를 보조 작업으로 사용하고 예측된 발음을 기반으로 하드 스위칭 메커니즘을 적용함으로써, 강력한 다중 작업 기반 모델 대비 영국 영어에서 5.94%의 상대적 WER 향상과 미국 영어에서 9.47%의 향상을 달성하며, 명시적인 발음 감시가 ASR 및 AID 성능 향상에 기여함을 입증한다.

ABSTRACT

The performance of automatic speech recognition systems degrades with increasing mismatch between the training and testing scenarios. Differences in speaker accents are a significant source of such mismatch. The traditional approach to deal with multiple accents involves pooling data from several accents during training and building a single model in multi-task fashion, where tasks correspond to individual accents. In this paper, we explore an alternate model where we jointly learn an accent classifier and a multi-task acoustic model. Experiments on the American English Wall Street Journal and British English Cambridge corpora demonstrate that our joint model outperforms the strong multi-task acoustic model baseline. We obtain a 5.94% relative improvement in word error rate on British English, and 9.47% relative improvement on American English. This illustrates that jointly modeling with accent information improves acoustic model performance.

연구 동기 및 목표

  • 훈련 데이터와 테스트 데이터 간의 발음 불일치로 인한 자동 음성 인식(ASR) 성능 저하 문제를 해결하기 위해.
  • 공통 음성 모델 훈련 중에 발음 정보를 명시적으로 모델링하면 다중 발음 간 인식 정확도 향상이 가능한지 탐구하기 위해.
  • 다중 발음 ASR과 발음 식별(AID)에 대한 공동 훈련의 상호 이점을 탐색하기 위해.
  • 예측된 발음에 기반해 발음별로 특화된 출력 레이어를 선택하는 하드 스위칭 전략을 개발하여 발음 변동에 대한 내성 향상시키기 위해.
  • 보조 AID 훈련이 다중 발음 환경에서 공유 음성 특징의 표현력을 향상시킴을 입증하기 위해.

제안 방법

  • 음성 특징을 음소 시퀀스로 매핑하기 위해 CTC 손실을 사용하는 양방향 LSTM(BLSTM) 음성 모델을 훈련한다.
  • 보조 AID 네트워크는 BLSTM 출력에 평균 풀링을 적용하여 발음 식별을 위한 문장 수준의 발음 임베딩을 생성한다.
  • 공동 모델은 하부 레이어를 CTC 손실(주 작업)과 AID 손실(보조 작업)으로 동시에 훈련하며, 초파rameter α를 사용해 손실의 가중 합을 계산한다.
  • 추론 중에 AID 네트워크에서 예측된 발음에 기반해 CTC 모델의 발음별 특화된 출력 레이어를 하드 스위칭 메커니즘을 통해 선택한다.
  • 모델은 월스트리트 저널(미국 영어)과 캐번지(영국 영어) 코퍼스를 기반으로 훈련되며, 발음 레이블은 두 작업 모두의 감독 신호로 사용된다.
  • ASR과 AID 간 최적의 트레이드오프는 α = 0.001에서 도출되며, 이는 단어 오류율(WER)을 최소화하고 AID 정확도를 극대화한다.

실험 결과

연구 질문

  • RQ1표준 다중 작업 학습 대비 음성 모델링과 발음 식별의 공동 훈련이 다중 발음 ASR 성능 향상에 기여하는가?
  • RQ2발음 예측을 보조 작업으로 사용할 경우, 공유 네트워크 레이어에서 발음에 강인한 특징과 발음별 특화된 특징 학습이 향상되는가?
  • RQ3예측된 발음에 기반한 하드 스위칭 전략을 사용할 경우, 공동 모델의 성능이 기준 모델 대비 어떻게 비교되는가?
  • RQ4공동 훈련이 발음 식별 시스템 자체의 정확도 향상에 어느 정도 기여하는가?
  • RQ5공동 훈련 중 음성 모델링과 발음 식별 손실 간 최적의 균형은 무엇인가?

주요 결과

  • 강력한 다중 작업 기반 음성 모델 대비 공동 모델은 영국 영어에서 5.94%의 상대적 단어 오류율(WER) 향상과 미국 영어에서 9.47%의 향상을 달성한다.
  • 오라클 성능 결과, 공동 모델은 발음별 특화 모델(ASpec)보다 평균 17.97%의 상대적 WER 향상을 보였으며, 다중 작업 모델(MTLP)보다 6.81% 향상되었다.
  • 독립된 AID 모델을 사용해 하드 스위칭을 수행할 경우, 공동 모델은 미국 영어에서 ASpec 대비 22.52%의 상대적 WER 향상을 달성했으며, MTLP 기준 기반 모델(14.41% 향상)을 초월했다.
  • 최적의 AID 손실 가중치 α = 0.001에서는 최소 WER 8.9%와 AID 정확도 97.77%를 기록했으며, 다양한 α 값 범위에서 높은 정확도(>92%)를 유지했다.
  • 공동 모델은 AID 성능을 크게 향상시켜 α = 0.005일 때 97.77%의 정확도를 달성했으며, 이는 공동 훈련이 ASR 및 AID 작업 모두를 향상시킴을 보여준다.
  • 결과는 훈련 중 명시적인 발음 감시가 특징 학습을 향상시키며, 공유 레이어가 표현력 있는 발음에 강인한 표현을 캡처하고 발음별 모델을 정교화함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.