Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Staged Cross-Lingual Acoustic Model Adaption for Robust Speech Recognition in Real-World Applications - A Case Study on German Oral History Interviews

Michael Gref, Oliver Walter|arXiv (Cornell University)|2020. 05. 26.
Speech Recognition and Synthesis참고 문헌 6인용 수 1
한 줄 요약

이 논문은 저자원, 실세계 환경에서의 음성 인식 정확도 향상을 위해 다단계, 다국어 음성 모델 적응 방법을 제안한다. 특히 독일 구술 역사 인터뷰에 초점을 맞추었다. 단계별 전이 학습을 통해 대규모 다국어 및 외부 도메인 데이터를 활용함으로써, 모델을 처음부터 훈련하는 것에 비해 상대적으로 30%의 단어 오류율(WER) 감소를 달성하였고, 동일 언어 데이터로 1,000시간 훈련된 강력한 기준 모델에 비해 6–7%의 상대적 향상을 이룩하였다.

ABSTRACT

While recent automatic speech recognition systems achieve remarkable performance when large amounts of adequate, high quality annotated speech data is used for training, the same systems often only achieve an unsatisfactory result for tasks in domains that greatly deviate from the conditions represented by the training data. For many real-world applications, there is a lack of sufficient data that can be directly used for training robust speech recognition systems. To address this issue, we propose and investigate an approach that performs a robust acoustic model adaption to a target domain in a cross-lingual, multi-staged manner. Our approach enables the exploitation of large-scale training data from other domains in both the same and other languages. We evaluate our approach using the challenging task of German oral history interviews, where we achieve a relative reduction of the word error rate by more than 30% compared to a model trained from scratch only on the target domain, and 6-7% relative compared to a model trained robustly on 1000 hours of same-language out-of-domain training data.

연구 동기 및 목표

  • 저자원, 실세계 도메인(예: 독일 구술 역사 인터뷰)에서 자동 음성 인식 성능이 열 劣한 문제를 해결한다.
  • 강건한 ASR 시스템을 훈련하기 위한 도메인 내 고품질 음성 텍스트 데이터 부족 문제를 해결한다.
  • 저자원 음성 인식에서 음성 모델 적응을 위한 다국어 및 다단계 전이 학습의 효과성을 조사한다.
  • 적응된 모델이 관련 도메인과 기록 조건에 걸쳐 일반화되고 강건한지 시험한다.

제안 방법

  • 다단계 적응 파이프라인을 적용한다: 먼저 외부 도메인, 동일 언어 데이터에서 미세조정된 사전 훈련된 음성 모델을 사용하고, 그 다음에 고자원 언어(예: 영어)를 통해 다국어 적응을 수행한다.
  • 엔드 투 엔드 훈련을 위한 최신 기술인 LF-MMI(통합 최적화 음성 모델링)를 기반 모델 아키텍처로 사용한다.
  • 목표 언어(독일어)와 다른 언어(예: 영어)의 풍부한 자원 도메인에서의 대규모 고품질 훈련 데이터를 활용하여 강건성을 향상시킨다.
  • 속도 변형 및 반향 모델링과 같은 데이터 증강 기법을 적용하여 실제 기록 조건의 변동성에 대한 강건성을 향상시킨다.
  • 순차적 적응을 수행한다: 다양한 외부 도메인 데이터에서의 초기 모델 훈련 후, 제한된 도메인 내 독일어 구술 역사 데이터에서의 도메인 특화 미세조정을 수행한다.
  • 두 단계 전이 학습 전략을 활용한다: 먼저 다국어 데이터에서, 그 다음 동일 언어의 외부 도메인 데이터에서 전이한 후, 최종적으로 목표 도메인 데이터에서의 미세조정을 수행한다.

실험 결과

연구 질문

  • RQ1다국어 전이 학습이 독일어 구술 역사 인터뷰와 같은 저자원, 실세계 도메인에서 ASR 성능을 상당히 향상시킬 수 있는가?
  • RQ2다국어 → 동일 언어 외부 도메인 → 도메인 내 데이터로의 다단계 적응은 단일 단계 미세조정과 비교해 어떻게 다른가?
  • RQ3제안된 방법이 유사한 음향적 및 언어적 과제를 가진 다른 도메인으로 일반화되는 정도는 어느 정도인가?
  • RQ4다국어 및 다단계 전이 학습과 결합했을 때, 제한된 도메인 내 데이터만을 사용했을 경우의 영향은 무엇인가?

주요 결과

  • 제안된 방법은 목표 도메인 독일어 구술 역사 인터뷰 데이터만으로 모델을 처음부터 훈련하는 것에 비해 상대적으로 30% 이상의 단어 오류율(WER) 감소를 달성한다.
  • 1,000시간의 동일 언어, 외부 도메인 독일어 데이터로 훈련된 강력한 기준 모델에 비해 WER가 6–7% 상대적으로 향상된다.
  • 영어 데이터를 활용한 다국어 적응은 조그만 도메인 내 데이터조차도 성능을 크게 향상시키며, 다국어 전이의 가치를 입증한다.
  • 제거 실험 결과에서 다단계 및 다국어 구성 요소가 모두 필수적임을 확인하였고, 각 단계가 최종 강건성에 기여한다.
  • 적응된 모델은 다른 독일어 ASR 테스트 세트로도 잘 일반화되며, 다양한 기록 조건과 발화 특성에 걸쳐 강건함을 보여준다.
  • 결과적으로 다국어 및 외부 도메인 데이터에서의 전이 학습이 저자원 음성 인식 작업에 매우 효과적임을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.