Skip to main content
QUICK REVIEW

[논문 리뷰] Distilling the Knowledge of BERT for CTC-based ASR

Hayato Futami, Hirofumi Inaguma|arXiv (Cornell University)|2022. 09. 05.
Speech Recognition and Synthesis인용 수 6
한 줄 요약

이 논문은 BERT에서 CTC 기반 음성 인식(ASR) 모델로의 지식 정련을 제안하며, 강제 정렬을 통해 BERT의 토큰 수준 예측과 CTC의 프레임 수준 출력을 정렬하여 빠른 추론을 유지한다. 이 방법은 런타임 비용을 추가하지 않고 CSJ 및 TED-LIUM2에서 ASR 정확도를 향상시켜 게임 이론적 추론을 사용할 때 최고 성능을 달성한다.

ABSTRACT

Connectionist temporal classification (CTC) -based models are attractive because of their fast inference in automatic speech recognition (ASR). Language model (LM) integration approaches such as shallow fusion and rescoring can improve the recognition accuracy of CTC-based ASR by taking advantage of the knowledge in text corpora. However, they significantly slow down the inference of CTC. In this study, we propose to distill the knowledge of BERT for CTC-based ASR, extending our previous study for attention-based ASR. CTC-based ASR learns the knowledge of BERT during training and does not use BERT during testing, which maintains the fast inference of CTC. Different from attention-based models, CTC-based models make frame-level predictions, so they need to be aligned with token-level predictions of BERT for distillation. We propose to obtain alignments by calculating the most plausible CTC paths. Experimental evaluations on the Corpus of Spontaneous Japanese (CSJ) and TED-LIUM2 show that our method improves the performance of CTC-based ASR without the cost of inference speed.

연구 동기 및 목표

  • CTC 기반 ASR 모델에 BERT의 문맥 언어 지식을 통합하면서도 빠른 비자율적 추론를 유지하기 위해.
  • 지식 정련 과정에서 BERT의 토큰 수준 예측과 CTC의 프레임 수준 예측을 정렬하는 데 도전하는 것.
  • 디코딩 중 BERT나 빔 서치에 대한 런타임 의존성을 피하여 추론 속도를 유지하기 위해.
  • 단지 표준 훈련 시간 정련을 사용하여 표준 벤치마크에서 ASR 성능을 향상시키기 위해.
  • BERT의 이중 방향 문맥이 CTC 기반 ASR에 단방향 언어 모델보다 더 나은 성능을 제공하는지 확인하기 위해.

제안 방법

  • 각 단어의 정답 전사에 대해 BERT를 교사 모델로 사용하여 토큰 수준의 소프트 레이블을 생성한다.
  • 프wd-backward 또는 비터비 알고리즘을 사용하여 가장 타당한 CTC 경로를 계산하여 BERT의 토큰 수준 예측과 CTC의 프레임 수준 출력을 정렬한다.
  • BERT의 토큰 수준 확률과 해당 시간 프레임에서의 CTC 모델의 프레임 수준 예측 간의 교차 엔트로피 손실을 최소화함으로써 지식 정련을 적용한다.
  • CTC 손실과 정련 손실을 동시에 최적화하여 CTC 모델이 BERT의 문맥 표현을 학습할 수 있도록 종합적으로 훈련한다.
  • 추론 시 빔 서치나 외부 언어 모델 추론을 피하기 위해 게임 이론적 디코딩을 사용하여 속도를 유지한다.
  • BERT의 이중 방향 어텐션을 활용하여 왼쪽과 오른쪽 문맥을 포괄하여 단어 수준의 의존성 모델링을 향상시킨다.

실험 결과

연구 질문

  • RQ1BERT에서의 지식 정련이 CTC 기반 ASR 모델의 성능을 향상시키면서도 빠른 추론 속도를 유지할 수 있는가?
  • RQ2BERT의 토큰 수준 예측을 CTC 기반 모델의 프레임 수준 예측과 효과적으로 정렬할 수 있는가?
  • RQ3BERT와 같은 이중 방향 언어 모델을 사용하면 CTC 모델의 정련에서 단방향 언어 모델보다 더 나은 ASR 성능을 얻을 수 있는가?
  • RQ4BERT에서의 정련이 표준 벤치마크에서 CTC 기반 ASR의 WER와 퍼플렉서티(PPL)를 모두 향상시킬 수 있는가?
  • RQ5기존의 언어 모델 통합 기법(예: 재정렬 또는 얕은 융합)과 결합했을 때 제안된 방법이 여전히 빠른 추론을 유지하는가?

주요 결과

  • CSJ 코퍼스에서 제안된 방법은 기준 CTC의 WER 9.34%를 BERT 정련을 통해 9.05%로 감소시켰으며, 추론 시간에 변화가 없었다.
  • TED-LIUM2에서 WER는 12.13%에서 11.40%로 감소하여 다양한 데이터셋에서 일관된 향상을 보였다.
  • BERT의 퍼플렉서티(PPL)는 TED-LIUM2에서 5.53에서 4.92로 향상되어 언어 모델링 정렬이 향상됨을 나타냈다.
  • 게임 이론적 디코딩을 사용함에도 불구하고, 이 방법은 WER 측면에서 n-best 재정렬 및 얕은 융합을 모두 초월했으며, 기준 CTC와 동일한 추론 속도를 유지했다.
  • 제안된 정련을 재정렬 또는 얕은 융합과 조합하면 WER가 더욱 감소하여 TED-LIUM2에서 n=50일 때 8.20%까지 도달했으며, 오라클 성능에 가까워졌다.
  • 시각화 결과, 정련 후 프레임 수준 예측이 더 의미적으로 타당해졌으며(예: 'ed', 'selves', 'kids'), 더 나은 문맥 모델링이 이루어졌음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.