Skip to main content
QUICK REVIEW

[논문 리뷰] A Further Study of Unsupervised Pre-training for Transformer Based Speech Recognition

Dongwei Jiang, Wubo Li|arXiv (Cornell University)|2020. 05. 20.
Speech Recognition and Synthesis참고 문헌 42인용 수 9
한 줄 요약

이 논문은 트랜스포머 기반 음성인식에서 비지도 사전학습을 위한 마스킹 예측 코드화(MPC)를 조사하며, 사전학습 데이터의 발화 스타일을 타겟 도메인과 일치시킬 경우 후행 작업 성능 향상이 가능하다는 것을 입증한다. MPC를 자동귀납 예측 코드화(APC)와 조합하면 HKUST에서 스트리밍 모델의 정확도가 상대적으로 8.46% 향상되며, 타겟 데이터 적응과 계층별 분류적 미세조정을 활용하면 AISHELL에서 상대적으로 3.99% 향상된다.

ABSTRACT

Building a good speech recognition system usually requires large amounts of transcribed data, which is expensive to collect. To tackle this problem, many unsupervised pre-training methods have been proposed. Among these methods, Masked Predictive Coding achieved significant improvements on various speech recognition datasets with BERT-like Masked Reconstruction loss and Transformer backbone. However, many aspects of MPC have not been fully investigated. In this paper, we conduct a further study on MPC and focus on three important aspects: the effect of pre-training data speaking style, its extension on streaming model, and how to better transfer learned knowledge from pre-training stage to downstream tasks. Experiments reveled that pre-training data with matching speaking style is more useful on downstream recognition tasks. A unified training objective with APC and MPC provided 8.46% relative error reduction on streaming model trained on HKUST. Also, the combination of target data adaption and layer-wise discriminative training helped the knowledge transfer of MPC, which achieved 3.99% relative error reduction on AISHELL over a strong baseline.

연구 동기 및 목표

  • 사전학습 데이터의 발화 스타일이 후행 작업 ASR 성능에 미치는 영향을 조사한다.
  • 기존에 자동귀납 또는 인과적 어텐션에 의존하는 스트리밍 음성인식 모델에 대해 MPC를 효과적으로 적용할 수 있는지 조사한다.
  • 효과적인 미세조정 전략을 통해 사전학습된 MPC 모델의 지식을 후행 ASR 작업으로 더 잘 전이할 수 있는 방법을 개선한다.
  • APC와 같은 다른 사전학습 목표와 MPC를 결합할 경우 스트리밍 및 비스트리밍 환경에서의 영향을 평가한다.
  • 지식 전이 향상을 위한 기법으로 타겟 데이터 적응 및 계층별 분류적 학습률 학습 전략을 탐색한다.

제안 방법

  • FBANK 특징에 대해 동적 마스킹을 적용한 마스킹 예측 코드화(MPC)를 사용해 트랜스포머 인코더를 사전학습하며, 4프레임 조각 중 15%를 마스킹하고 L1 손실을 통해 예측한다.
  • 인코더에서 시간적 다운샘플링을 적용하고 출력을 재구성하여 MPC 손실 계산에 입력 차원을 일치시킨다.
  • MPC와 APC(자동귀납 예측 코드화)를 통합된 사전학습 목표로 통합하며, 각각 50% 확률로 번갈아가며 적용한다.
  • 기본 학습률을 λ^||l−θ||로 곱하여 계층별 분류적 학습률 스케줄링을 구현하며, 여기서 λ=0.95, θ=5.5로 설정하여 중간 인코더 레이어의 지식 유지를 도모한다.
  • 타겟 도메인 데이터에서 사전학습된 모델을 미세조정한 후 전체 미세조정을 수행하는 타겟 데이터 적응을 적용하고, 이를 분류적 학습률 스케줄링과 조합한다.
  • 초기 손실 가중치 γ_mpc를 0.2로 시작하고 매 5 에포크마다 반으로 줄이며, 사전학습 신호와 후행 작업 신호의 균형을 유지하기 위해 감소하는 MPC 손실 가중치를 사용한 다중작업 학습을 구현한다.
Figure 1: Masked Predictive Coding with four-fold downsample
Figure 1: Masked Predictive Coding with four-fold downsample

실험 결과

연구 질문

  • RQ1사전학습 데이터의 발화 스타일이 후행 ASR 성능에 영향을 미치는가? 타겟 데이터 스타일과 일치시키는 것이 유리한가?
  • RQ2자동귀납 또는 인과적 어텐션을 요구하는 스트리밍 ASR 모델에 MPC를 효과적으로 적용할 수 있는가?
  • RQ3사전학습된 MPC 모델의 지식을 후행 ASR 작업으로 더 잘 전이할 수 있는 방법은 무엇인가?
  • RQ4사전학습 단계에서 MPC와 APC를 조합할 경우 스트리밍 모델에 어떤 영향을 미치는가?
  • RQ5타겟 데이터 적응과 계층별 분류적 학습률 학습 전략을 함께 적용하면 MPC 미세조정 시 지식 전이가 더욱 향상되는가?

주요 결과

  • 사전학습 데이터의 발화 스타일을 타겟 도메인과 일치시키면 후행 ASR 성능이 유의미하게 향상된다.
  • 사전학습 단계에서 MPC와 APC를 조합하면 강력한 베이스라인 대비 스트리밍 HKUST 모델에서 상대 오차 감소율이 8.46% 향상된다.
  • AISHELL 데이터셋에서는 타겟 데이터 적응과 계층별 분류적 학습률 학습 전략을 조합함으로써 강력한 베이스라인 대비 상대 오차 감소율이 3.99% 향상된다.
  • 계층별 분류적 학습률 스케줄링은 중간 인코더 레이어의 지식을 유지하는 데 도움이 되며, 미세조정의 안정성과 성능을 향상시킨다.
  • 감소하는 MPC 손실 가중치를 사용한 다중작업 학습은 약간의 성능 향상을 가져오지만, 타겟 데이터 적응과 계층별 스케줄링의 조합이 가장 일관된 성능 향상을 이룬다.
  • 지식 전이의 효과는 오직 타겟 데이터 적응과 계층별 학습률 스케줄링을 함께 적용했을 때에만 크게 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.