Skip to main content
QUICK REVIEW

[논문 리뷰] Adapting GPT, GPT-2 and BERT Language Models for Speech Recognition

Xianrui Zheng, Chao Zhang|arXiv (Cornell University)|2021. 07. 29.
Speech Recognition and Synthesis참고 문헌 44인용 수 5
한 줄 요약

이 논문은 자동 음성 인식(ASR)에서 양방향 언어 모델(BERT 등)의 출력을 수학적으로 정확한 문장 사전 확률로 변환하는 새로운 방법을 제안한다. 이를 통해 GPT 및 GPT-2와 같은 단방향 모델과의 효과적인 통합이 가능해진다. 최적의 문맥 처리 및 확률 변환을 적용한 하이브리드 모델을 사용함으로써, AMI 데이터셋에서 최대 12% 상대적 WER 감소 및 3% 상대적 WER 감소를 달성한다.

ABSTRACT

Language models (LMs) pre-trained on massive amounts of text, in particular bidirectional encoder representations from Transformers (BERT), generative pre-training (GPT), and GPT-2, have become a key technology for many natural language processing tasks. In this paper, we present results using fine-tuned GPT, GPT-2, and their combination for automatic speech recognition (ASR). Unlike unidirectional LM GPT and GPT-2, BERT is bidirectional whose direct product of the output probabilities is no longer a valid language prior probability. A conversion method is proposed to compute the correct language prior probability based on bidirectional LM outputs in a mathematically exact way. Experimental results on the widely used AMI and Switchboard ASR tasks showed that the combination of the fine-tuned GPT and GPT-2 outperformed the combination of three neural LMs with different architectures trained from scratch on the in-domain text by up to a 12% relative word error rate reduction (WERR). Furthermore, on the AMI corpus, the proposed conversion for language prior probabilities enables BERT to obtain an extra 3% relative WERR, and the combination of BERT, GPT and GPT-2 results in further improvements.

연구 동기 및 목표

  • 도메인 내 데이터에서 미세조정된 자동 음성 인식(ASR)을 위한 사전 훈련된 단방향 언어 모델(GPT, GPT-2)과 양방향 모델(BERT)을 적응시키는 것.
  • BERT의 출력 확률을 직접 곱할 경우 양방향 문맥으로 인해 유효한 문장 사전 확률가 도출되지 않는다는 문제를 해결하는 것.
  • 양방향 언어 모델 출력을 ASR 디코딩을 위한 유효한 언어 사전 확률로 변환하는 수학적으로 정확한 방법을 개발하는 것.
  • 통합된 단방향 및 양방향 언어 모델이 ASR 추론 결과를 재평가하고 단어 오류률(WER)을 향상시키는 성능을 평가하는 것.
  • 사전 훈련된 모델을 미세조정한 것이 도메인 내 데이터만으로 훈련된 신경망 언어 모델보다 우수한 성능을 낼 수 있음을 입증하는 것.

제안 방법

  • Eq. (7)에 기반한 새로운 확률 변환 방법을 제안하여 BERT의 양방향 출력에서 정확한 문장 사전 확률를 계산함으로써 수학적 정확성을 보장한다.
  • 이 변환 방법을 미세조정된 BERT에 적용하여 ASR 디코딩 파이프라인 내 언어 사전 확률로 통합할 수 있도록 한다.
  • 100개의 최상위 가설 목록에서 왼쪽 및 오른쪽 문맥(LC 및 RC)을 사용하며, 필요에 따라 참조 번역문을 활용하여 BERT의 확률 추정에 대한 문맥을 풍부하게 한다.
  • 미세조정된 GPT, GPT-2, BERT를 조합하는 다중 모델 재평가 전략을 사용하며, 선형 보간(α = 0.7)을 통해 모델 가중치를 조정한다.
  • 1-best 가설 캐시를 사용해 BERT의 왼쪽 문맥을 제공하고, 향후 문맥은 1-best 또는 참조 번역문을 사용하여 모델링한다.
  • 단방향 모델(GPT, GPT-2)의 디코더에서는 마스크된 자기주의 주의 메커니즘을 사용하고, BERT의 인코더에서는 전체 자기주의 주의 메커니즘을 사용한다.

실험 결과

연구 질문

  • RQ1미세조정된 GPT 및 GPT-2 모델이 도메인 내 데이터만으로 훈련된 신경망 언어 모델보다 ASR에서 더 우수한 성능을 낼 수 있는가?
  • RQ2BERT와 같은 양방향 언어 모델의 출력 확률을 ASR를 위한 수학적으로 유효한 문장 사전 확률로 변환할 수 있는가?
  • RQ3BERT에서 과거 및 미래의 양방향 문맥을 통합함으로써 단방향 모델 대비 ASR 성능 향상은 어떻게 이루어지는가?
  • RQ4ASR 재평가에서 단방향(GPT, GPT-2) 및 양방향(BERT) 언어 모델을 통합하는 데 최적의 조합 전략은 무엇인가?
  • RQ5향후 문맥으로 참조 번역문을 사용할 경우, BERT 기반 언어 사전 확률의 품질이 향상되는가?

주요 결과

  • 미세조정된 GPT 및 GPT-2 모델의 조합은 AMI 평가 세트에서 4-그램 기준 대비 최대 12% 상대적 WER 감소를 달성했다.
  • AMI 코퍼스에서 제안된 확률 변환 방법을 통해 BERT는 기준 방법 대비 3% 상대적 WER 감소를 달성했으며, 이는 그 효과성을 입증한다.
  • 왼쪽 문맥 50개 토큰과 오른쪽 문맥 20개 토큰(1-best 가설 기반)을 사용할 경우, 제안된 방법(M=2)으로 ADev에서 WER 17.0%, AEval에서 WER 16.9%를 기록하여 최고 성능를 달성했다.
  • 1-best 오른쪽 문맥을 참조 번역문(20개 향후 토큰)으로 대체함으로써 ADev에서 WER 16.8%, AEval에서 WER 16.7%로 추가로 감소시켜, 더 고품질의 향후 문맥이 유리함을 보여주었다.
  • 미세조정된 GPT, GPT-2, BERT의 조합은 ADev에서 WER 15.9%, AEval에서 WER 15.5%를 기록하여 단일 모델 또는 이중 모델 조합보다도 뛰어난 성능을 보였다.
  • M=2 및 최적의 문맥 길이를 사용한 제안된 방법은 최고의 MMLM 기준 대비 0.2% 절대적 WER 감소를 달성하여, 양방향 문맥을 더 효과적으로 처리할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.