Skip to main content
QUICK REVIEW

[논문 리뷰] Fast End-to-End Speech Recognition via Non-Autoregressive Models and Cross-Modal Knowledge Transferring from BERT

Ye Bai, Jiangyan Yi|arXiv (Cornell University)|2021. 02. 15.
Speech Recognition and Synthesis참고 문헌 60인용 수 8
한 줄 요약

이 논문은 자동회귀형 기반의 말하기 인식 모델보다 약 50배 빠른 추론 속도를 달성하면서도 정확도를 유지하는 비자동회귀형 엔드 투 엔드 음성 인식 모델인 LASO를 제안한다. 이 모델은 위치에 따라 달라지는 요약 모듈과 인코딩된 음성 특징에 대한 자기주도 어텐션을 사용해 모든 텍스트 토큰을 동시에 예측한다. 또한 사전에 학습된 BERT 언어 모델을 통해 다중모odal 지식 정련을 활용하여 의미 지식을 전이함으로써 정확도를 향상시킨다.

ABSTRACT

Attention-based encoder-decoder (AED) models have achieved promising performance in speech recognition. However, because the decoder predicts text tokens (such as characters or words) in an autoregressive manner, it is difficult for an AED model to predict all tokens in parallel. This makes the inference speed relatively slow. We believe that because the encoder already captures the whole speech utterance, which has the token-level relationship implicitly, we can predict a token without explicitly autoregressive language modeling. When the prediction of a token does not rely on other tokens, the parallel prediction of all tokens in the sequence is realizable. Based on this idea, we propose a non-autoregressive speech recognition model called LASO (Listen Attentively, and Spell Once). The model consists of an encoder, a decoder, and a position dependent summarizer (PDS). The three modules are based on basic attention blocks. The encoder extracts high-level representations from the speech. The PDS uses positional encodings corresponding to tokens to convert the acoustic representations into token-level representations. The decoder further captures token-level relationships with the self-attention mechanism. At last, the probability distribution on the vocabulary is computed for each token position. Therefore, speech recognition is re-formulated as a position-wise classification problem. Further, we propose a cross-modal transfer learning method to refine semantics from a large-scale pre-trained language model BERT for improving the performance.

연구 동기 및 목표

  • 순차적 토큰 생성으로 인해 느린 추론 속도를 보이는 자동회귀형 엔드 투 엔드 ASR 모델의 문제를 해결한다.
  • 빔 서치가 필요 없는 완전한 병렬화를 가능하게 하는 비자동회귀 아키텍처를 개발한다.
  • 사전에 학습된 텍스트 전용 언어 모델(BERT)에서 의미 지식을 전이하여 음성 인식의 의미 이해 능력을 향상시킨다.
  • 저자원 및 긴 문장 길이의 발화에 대해 고속 추론을 유지하면서도 경쟁 가능한 ASR 성능을 확보한다.
  • 전체 발화 모델에서 예측되지 않은 발화 길이에 대한 민감도를 줄이기 위해 다중모달 의미 정렬을 활용한다.

제안 방법

  • 인코더, 위치에 따라 달라지는 요약 모듈(PDS), 디코더를 갖춘 피드포워드형 비자동회귀 모델인 LASO를 제안한다.
  • PDS 모듈을 사용해 전체 인코딩된 음성 시퀀스에 대해 어텐션을 수행하고, 위치 기반으로 토큰 전용 표현을 생성한다.
  • 자동회귀 디코딩을 병렬 피드포워드 구조로 대체하여 빔 서치가 필요 없게 하고 실시간 추론을 가능하게 한다.
  • LASO 디코더의 의미 표현과 사전에 학습된 BERT 모델의 표현을 정렬함으로써 다중모달 지식 정련을 적용한다.
  • LASO 디코더의 은닉 상태를 해당 BERT 표현과 일치시키는 지식 정련 손실을 사용해 LASO를 미세조정한다.
  • ASR 손실과 의미 정렬 손실의 조합을 사용해 중국어 음성 데이터셋(AISHELL-1 및 AISHELL-2)에서 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1자동회귀형 트랜스포머 기반 ASR 모델보다 정확도를 희생시키지 않고도 비자동회귀형 엔드 투 엔드 ASR 모델이 현저히 더 빠른 추론 속도를 달성할 수 있는가?
  • RQ2사전에 학습된 BERT 모델에서의 다중모달 지식 정련이 음성 인식에서 의미 이해 능력을 얼마나 효과적으로 향상시키는가?
  • RQ3제안된 LASO 모델이 예측되지 않은 발화 길이에 대해 잘 일반화되는가? 특히 자동회귀형 모델과 비교해 볼 때 어떻게 되는가?
  • RQ4BERT에서 온 의미 보정이 유사 발음이지만 의미가 잘못된 단어로 인한 철자 오류를 수정할 수 있는가?
  • RQ5BERT 기반 의미 정렬이 OOV(외부 어휘) 또는 희귀어 처리에서 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • LASO는 토큰 예측의 완전한 병렬화 덕분에 자동회귀형 트랜스포머 기반 ASR 모델보다 약 50배 더 빠른 추론 속도를 달성한다.
  • 모델은 AISHELL-1 및 AISHELL-2 데이터셋에서 최신 자동회귀형 모델과 비교해 경쟁 가능한 ASR 성능을 유지한다.
  • BERT에서 온 다중모달 지식 정련은 의미 정확도를 크게 향상시키며, 유사 발음이지만 의미가 잘못된 단어에서 발생하는 철자 오류를 수정한다.
  • '一场' 대신 '骤', '爷泳' 대신 '爷爷', '受存' 대신 '瘦身'과 같은 예시에서, 발음은 정확했지만 의미가 어긋난 오류가 BERT 보정을 통해 수정되었다.
  • 모델는 자동회귀형 모델보다 예측되지 않은 발화 길이에 더 민감한 편이지만, 데이터 증강 또는 VAD 기반 분할을 통해 이 문제를 완화할 수 있다.
  • BERT 통합은 특히 문법적으로 올바르고 의미적으로 일관된 단어 선택 능력을 향상시키며, 기준 단어와 완벽하게 일치하지 않더라도 일반화 능력을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.