Skip to main content
QUICK REVIEW

[논문 리뷰] Lattice-Based Unsupervised Test-Time Adaptation of Neural Network Acoustic Models

Ondřej Klejch, Joachim Fainberg|arXiv (Cornell University)|2019. 06. 27.
Speech Recognition and Synthesis참고 문헌 39인용 수 6
한 줄 요약

이 논문은 라티스 기반 비지도 테스트 시점 적응 기법을 제안하며, 라티스 없는 최대 상호정보량(LF-MMI) 학습을 통해 신경망 음성 모델을 적응시킨다. 단일 최상의 경로가 아닌, 여러 가설과 신뢰도 점수를 포함한 라티스를 활용함으로써, 번역 오류에 대한 과적합을 줄이고, 초기 WER가 50% 이상일 경우에도 전체 모델 적응이 효과적으로 가능하게 하여, 다양한 음성 인식(ASR) 작업에서 최상의 경로 지도보다 일관된 성능 향상을 이룬다.

ABSTRACT

Acoustic model adaptation to unseen test recordings aims to reduce the mismatch between training and testing conditions. Most adaptation schemes for neural network models require the use of an initial one-best transcription for the test data, generated by an unadapted model, in order to estimate the adaptation transform. It has been found that adaptation methods using discriminative objective functions - such as cross-entropy loss - often require careful regularisation to avoid over-fitting to errors in the one-best transcriptions. In this paper we solve this problem by performing discriminative adaptation using lattices obtained from a first pass decoding, an approach that can be readily integrated into the lattice-free maximum mutual information (LF-MMI) framework. We investigate this approach on three transcription tasks of varying difficulty: TED talks, multi-genre broadcast (MGB) and a low-resource language (Somali). We find that our proposed approach enables many more parameters to be adapted without over-fitting being observed, and is successful even when the initial transcription has a WER in excess of 50%.

연구 동기 및 목표

  • 오류가 많은 첫 번째 단계 번역 결과를 사용할 때 신경망 음성 모델의 비지도 테스트 시점 적응에서 과적합 문제를 해결한다.
  • 신뢰도 및 혼동 정보가 부족한 최상의 경로 지도의 한계를 극복하여, 초기 WER이 높을 경우 성능 저하를 방지한다.
  • 라티스 기반 지도 학습이 사전에 파라미터 차단 또는 정규화 없이 모든 모델 파라미터의 신뢰할 수 있는 적응을 가능하게 하는지 탐구한다.
  • 기존 방법이 실패하는 저자원 및 높은 불일치가 발생하는 ASR 환경에서 라티스 기반 지도 학습의 효과성을 입증한다.
  • 초기 모델 성능이 열악할 경우 기존 방법과 비교해 라티스 기반 적응이 LHUC와 같은 방법을 뛰어넘는 성능을 보이는지 조사한다.

제안 방법

  • 단일 최상의 경로가 아닌 첫 번째 단계 디코딩에서 생성된 라티스를 전체 지도 학습으로 활용하여 분류적 적응을 수행한다.
  • 모든 라티스 내 가설을 활용해 라티스 없는 최대 상호정보량(LF-MMI) 목적함수를 적용함으로써, 번역 오류에 대한 강건성을 향상시킨다.
  • 모든 신경망 음성 모델 파라미터를 라티스 지도 학습을 통해 적응시켜, 파라미터 차단 또는 낮은 랭크 제약 조건이 필요 없도록 한다.
  • 단어 신뢰도 및 발음 혼동 정보와 같은 라티스 정보를 활용해 적응 과정을 안내하고 과적합을 줄인다.
  • 라티스 기반 적응을 LF-MMI 프레임워크에 통합하여 불확실성 인식 지도 학습이 가능한 종단간 분류적 훈련을 가능하게 한다.
  • 기준 비교를 위해 신뢰도 기반 필터링을 적용하지만, 라티스 지도 학습이 이러한 필터링에 의존도를 낮춘다는 것을 보여준다.

실험 결과

연구 질문

  • RQ1초기 첫 번째 단계 번역 결과의 WER이 높을 경우(예: >50%), 라티스 기반 지도 학습이 비지도 테스트 시점 적응 성능 향상에 기여할 수 있는가?
  • RQ2최상의 경로가 아닌 라티스를 사용할 경우, 전체 신경망 모델의 적응 과정에서 일반화 성능 향상과 과적합 감소에 기여하는가?
  • RQ3파라미터 제약이 있는 방법(예: LHUC)과 비교했을 때, 라티스 기반 적응은 성능 및 강건성 측면에서 뛰어나게 되는가?
  • RQ4초기 모델이 잘 적응되어 있지 않은 저자원 환경(예: 소말리어 ASR)에서도 라티스 기반 적응이 효과적인가?
  • RQ5최상의 경로 방법과 비교했을 때, 라티스 지도 학습은 보다 적은 신뢰도 기반 필터링에 의존하는가?

주요 결과

  • 초기 WER이 50%를 초과하더라도, 라티스 기반 적응은 최상의 경로 지도 학습보다 0.7–0.8% 절대적 WER 향상을 달성한다.
  • 특히 높은 WER 환경에서, 라티스 기반 적응은 최상의 경로 지도 학습(신뢰도 기반 필터링 적용)보다도 우수한 성능을 보인다.
  • 초기 WER이 57.3%에 이르는 소말리어 모델은 라티스 기반 적응 시 성능 저하가 없었지만, 최상의 경로 기반 적응은 성능 악화를 보였다.
  • 라티스 기반 전체 모델 적응은 LHUC 기반 적응보다도 더 좋은 결과를 얻었으며, 이는 파라미터 효율적 적응의 강력한 기준이 되는 대안이다.
  • 라티스 지도 학습에서는 보다 적은 보조적인 필터링이 필요하며, 이는 라티스가 단순히 신뢰도 점수만 제공하는 것보다 더 강건한 지도 학습을 제공한다는 것을 시사한다.
  • 저자원 및 높은 불일치 환경에서도 과적합 없이 모든 모델 파라미터의 신뢰할 수 있는 적응이 가능하며, 이는 라티스 기반 지도 학습의 우수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.