Skip to main content
QUICK REVIEW

[논문 리뷰] Non-autoregressive Transformer-based End-to-end ASR using BERT

Fu-Hao Yu, Kuan-Yu Chen|arXiv (Cornell University)|2021. 04. 10.
Speech Recognition and Synthesis참고 문헌 30인용 수 13
한 줄 요약

이 논문은 비자기적 Transformer 기반의 종단간 음성인식(ASR) 모델을 제안하며, BERT를 사전학습된 언어 모델로 활용하여 맥락 표현 학습을 향상시킨다. 음성 특징에 대해 BERT를 미세조정함으로써 이 방법은 AISHELL-1 데이터셋에서 경쟁력 있거나 우수한 성능을 달성하며, 빠른 추론과 높은 ASR 정확도를 동시에 구현한다.

ABSTRACT

Transformer-based models have led to significant innovation in classical and practical subjects as varied as speech processing, natural language processing, and computer vision. On top of the Transformer, attention-based end-to-end automatic speech recognition (ASR) models have recently become popular. Specifically, non-autoregressive modeling, which boasts fast inference and performance comparable to conventional autoregressive methods, is an emerging research topic. In the context of natural language processing, the bidirectional encoder representations from Transformers (BERT) model has received widespread attention, partially due to its ability to infer contextualized word representations and to enable superior performance for downstream tasks while needing only simple fine-tuning. Motivated by the success, we intend to view speech recognition as a downstream task of BERT, thus an ASR system is expected to be deduced by performing fine-tuning. Consequently, to not only inherit the advantages of non-autoregressive ASR models but also enjoy the benefits of a pre-trained language model (e.g., BERT), we propose a non-autoregressive Transformer-based end-to-end ASR model based on BERT. We conduct a series of experiments on the AISHELL-1 dataset that demonstrate competitive or superior results for the model when compared to state-of-the-art ASR systems.

연구 동기 및 목표

  • 비자기적 ASR 모델의 장점인 빠른 추론과 BERT의 맥락 표현 능력을 융합하기 위해.
  • 종단간 ASR를 BERT의 후행 작업으로 간주하여 음성 입력에 대한 효과적인 미세조정을 가능하게 하기 위해.
  • 자기적 디코딩이 필요 없이 사전학습된 BERT 표현을 활용하여 ASR 성능을 햖थ기 위해.
  • 최소한의 아키텍처 변경으로 BERT 기반 모델링이 음성 인식에 효과적으로 적용될 수 있는지 검증하기 위해.
  • AISHELL-1 벤치마크에서 최첨단 ASR 시스템과 비교해도 경쟁력 있거나 우수한 성능을 달성하기 위해.

제안 방법

  • 원시 또는 추출된 음성 특징을 입력 토큰으로 사용하는 비방향성 Transformer 인코더를 BERT에 적응시켜 음성 특징을 처리하도록 한다.
  • 비자기적 디코딩 전략을 사용하여 사전학습된 BERT 모델을 음성 인식 작업에 대해 미세조정한다.
  • 표준 마스크된 언어 모델 헤드를 ASR에 맞게 조정된 시퀀스 투 시퀀스 헤드로 대체한다.
  • 모든 출력 토큰을 동시에 생성하는 비자기적 Transformer 디코더를 사용하여 추론 속도를 향상시킨다.
  • 비자기적 설정에서의 훈련 안정성을 높이기 위해 지식 정복 또는 토큰 정렬 기법을 적용한다.
  • BERT의 깊은 레이어에서 유도된 맥락화된 표현을 활용하여 음성-단어 정렬 및 번역 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1자기적 디코딩 없이도 BERT의 사전학습된 맥락 표현을 종단간 ASR에 효과적으로 전이할 수 있는가?
  • RQ2자기적 및 비자기적 기준 모델과 비교했을 때, 비자기적 BERT 기반 ASR 모델은 정확도와 추론 속도 측면에서 어떻게 성능을 내는가?
  • RQ3음성 특징에 대해 BERT를 미세조정함으로써 시퀀스 투 시퀀스 모델링에서 ASR에 어떤 영향을 미치는가?
  • RQ4BERT의 양방향 맥락을 활용하면 AISHELL-1과 같은 저자원 음성 데이터셋에서 ASR 성능이 향상되는가?
  • RQ5비자기적 설계는 자기적 모델에 비해 추론 시간을 크게 줄이면서도 높은 정확도를 유지할 수 있는가?

주요 결과

  • 제안된 비자기적 BERT 기반 ASR 모델은 AISHELL-1 데이터셋에서 최첨단 시스템과 비교해도 경쟁력 있거나 뛰어난 단어 오류율(WER) 성능을 달성한다.
  • 병렬 디코딩 덕분에 추론 속도가 크게 향상되었으며, 번역 정확도에 손해를 보이지 않았다.
  • 음성 특징에 대해 BERT를 미세조정함으로써 맥락화된 언어 지식이 효과적으로 전이되어 정렬 정확도와 강인성이 향상된다.
  • BERT의 양방향 어텐션 메커니즘 통합으로 음성 시퀀스 내 장거리 의존성 모델링이 향상된다.
  • 미세조정 데이터가 제한된 상황에서도 강력한 일반화 능력을 보이며 뛰어난 성능을 달성한다.
  • 비자기적 설계 덕분에 추론 시간이 수개월에서 수십만 배로 감소했으며, WER 측면에서 자기적 기준 모델을 능가하거나 동등하게 성능을 내었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.