Skip to main content
QUICK REVIEW

[논문 리뷰] Domain Adversarial Training for Accented Speech Recognition

Sining Sun, Ching-Feng Yeh|arXiv (Cornell University)|2018. 06. 07.
Speech Recognition and Synthesis참고 문헌 11인용 수 15
한 줄 요약

이 논문은 번역된 음성 데이터가 필요 없이 강세에 영향을 받지 않는 특징을 학습하여 번역된 음성 인식 성능을 햖थ기 위해 도메인 적대적 훈련(DAT)을 제안한다. 강세별 변형을 최소화하기 위해 TDNN 음성 모델을 적대적 도메인 분류기와 함께 훈련함으로써 DAT는 중국어 강세에서 최대 7.45%의 상대적 문자 오류율 감소를 달성하며, 다중 작업 학습을 능가하고 자동 번역과도 조합될 수 있다.

ABSTRACT

In this paper, we propose a domain adversarial training (DAT) algorithm to alleviate the accented speech recognition problem. In order to reduce the mismatch between labeled source domain data ("standard" accent) and unlabeled target domain data (with heavy accents), we augment the learning objective for a Kaldi TDNN network with a domain adversarial training (DAT) objective to encourage the model to learn accent-invariant features. In experiments with three Mandarin accents, we show that DAT yields up to 7.45% relative character error rate reduction when we do not have transcriptions of the accented speech, compared with the baseline trained on standard accent data only. We also find a benefit from DAT when used in combination with training from automatic transcriptions on the accented data. Furthermore, we find that DAT is superior to multi-task learning for accented speech recognition.

연구 동기 및 목표

  • 제한된 번역된 데이터로 인해 저자원 음성 인식 문제를 해결하기 위해.
  • 엔드 투 엔드 ASR 시스템에서 표준어와 강세어 간의 도메인 불일치를 줄이기 위해.
  • 대량의 레이블이 없는 강세어 음성을 활용하는 비지도 적응 방법을 개발하기 위해.
  • 저자원 환경에서 DAT를 다중 작업 학습 및 지도적 적응과 비교하기 위해.
  • 다양한 수준의 심각도를 가진 여러 중국어 강세에서 DAT의 효과를 평가하기 위해.

제안 방법

  • 표준어와 강세어를 구분할 수 있는 도메인 분류기를 갖춘 Kaldi 기반 TDNN 음성 모델을 확장한다.
  • 표준 ASR 손실(Cross-Entropy 및 MMI)과 도메인 적대적 손실을 조합한 목적함수를 사용하여 모델을 훈련한다.
  • 기울기 반전을 사용하여 도메인 분류기에서 공유 특징 추출기로 적대적 신호를 역전파함으로써 도메인 불변 표현을 유도한다.
  • 공유 네트워크에서 추출한 특징 표현을 사용하여 도메인 분류기를 강세 유형(표준 vs. 강세)을 예측하도록 훈련한다.
  • 600시간의 레이블이 없는 중국어 강세 음성을 사용하여 다강세 및 강세별 적응 설정 모두에서 방법을 적용한다.
  • ASR와 도메인 적대적 목적함수 간의 최적의 트레이드오프 하이퍼파rameter로 λ = 0.03을 사용한다.

실험 결과

연구 질문

  • RQ1번역된 강세어 음성 데이터가 없을 때 도메인 적대적 훈련이 강세어 음성 인식의 문자 오류율을 감소시킬 수 있는가?
  • RQ2표준 ASR 모델을 강세어 음성에 적응시키는 데 있어 DAT는 다중 작업 학습보다 어떻게 비교되는가?
  • RQ3강세어 음성의 자동 번역과 DAT를 조합했을 때의 영향은 무엇인가?
  • RQ4DAT를 사용한 강세별 적응이 다강세 적응보다 더 높은 성능을 낼 수 있는가?
  • RQ5다양한 수준의 강세를 가진 중국어 강세에서 DAT의 성능은 어떻게 변하는가?

주요 결과

  • 번역된 강세어 음성 데이터가 없을 경우 DAT는 중국어 강세에서 최대 7.45%의 상대적 문자 오류율 감소를 달성했다.
  • 강세별 적응 설정에서 DAT는 SC, HN, FJ 강세에 대해 각각 5.8%, 7.4%, 3.1%의 CER 감소를 기록하여 표준 모델을 초월했다.
  • DAT는 다중 작업 학습을 항상 능가했으며, 일부 경우에서 강세를 구분하는 특징을 학습함으로써 성능 저하가 발생할 수 있었다.
  • 자신의 번역과 조합했을 때 DAT는 전체 CER을 추가로 20% 감소시켰으며, 상호보완적인 이점이 있음을 시사했다.
  • 인간의 번역이 제공될 경우 DAT의 성능 향상 폭이 감소했으며, 이는 DAT의 주요 가치가 비지도 적응에 있음을 보여주었다.
  • 최적의 트레이드오프 하이퍼파rameter λ는 0.03로 확인되었으며, 이는 ASR 정확도와 도메인 불변성 간의 균형을 맞추는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.