Skip to main content
QUICK REVIEW

[논문 리뷰] A Conformer Based Acoustic Model for Robust Automatic Speech Recognition

Yufeng Yang, Peidong Wang|arXiv (Cornell University)|2022. 03. 01.
Speech Recognition and Synthesis인용 수 6
한 줄 요약

이 논문은 최신 SOTA WRBN 시스템의 순환 BLSTM 구성 요소를 복합 및 주의 메커니즘을 융합한 인코더로 대체한 Conformer 기반 음성 모델을 제안한다. 이로 인해 CHiME-4 실재 테스트 세트에서 6.25% WER를 달성하였으며, 이는 이전 SOTA 대비 8.4% 상대적 개선이며, 모델 크기를 18.3% 줄이고 학습 시간을 79.6% 감소시켰다. 이는 문장 단위 정규화와 반복적 화자 적응을 통해 달성되었다.

ABSTRACT

This study addresses robust automatic speech recognition (ASR) by introducing a Conformer-based acoustic model. The proposed model builds on the wide residual bi-directional long short-term memory network (WRBN) with utterance-wise dropout and iterative speaker adaptation, but employs a Conformer encoder instead of the recurrent network. The Conformer encoder uses a convolution-augmented attention mechanism for acoustic modeling. The proposed system is evaluated on the monaural ASR task of the CHiME-4 corpus. Coupled with utterance-wise normalization and speaker adaptation, our model achieves $6.25\%$ word error rate, which outperforms WRBN by $8.4\%$ relatively. In addition, the proposed Conformer-based model is $18.3\%$ smaller in model size and reduces total training time by $79.6\%$.

연구 동기 및 목표

  • 노이즈가 많고 원거리에서의 자동 음성 인식(ASR)의 강건성을 향상시키기 위해 Conformer 기반 음성 모델을 사용한다.
  • 학습 시간과 모델 크기 측면에서 순환 BLSTM 모델의 비효율성을 해결한다.
  • 향상된 강건성과 신뢰성을 확보하기 위해 문장 단위 정규화와 반복적 화자 적응을 통합한다.
  • 제안된 모델을 CHiME-4 단일 귀로 ASR 벤치마크에서 평가하여 실제 세계의 노이즈 있는 음성 인식을 위한 표준 테스트베드로 활용한다.
  • 자기 지도적 사전 훈련 데이터를 사용하지 않고도 E2E 및 하이브리드 시스템을 모두 초월할 수 있음을 보여준다.

제안 방법

  • 더 나은 시퀀스 모델링을 위해 복합 및 자기주의 메커니즘을 융합한 Conformer 인코더로 이전 SOTA 시스템의 넓은 잔차 BLSTM 네트워크(WRBN)를 대체한다.
  • 모든 정규화 레이어에 문장 단위 LayerNorm(LN)을 적용하여 문장 간 간섭을 방지하고 각 문장의 신뢰성을 향상시킨다.
  • 추가로 인식 성능을 향상시키기 위해 반복적 화자 적응을 후처리 단계로 적용한다.
  • Conformer의 피드포워드 네트워크(FFN) 모듈에서 Swish 활성화 함수와 잔차 연결을 사용한 프리노름 아키텍처를 적용한다.
  • 원래 Transformer 설계를 따르며, 다중 헤드 자기주의(MHSA) 모듈의 입력에 스케일링된 절대적 위치 인코딩을 적용한다.
  • 단일 V100 GPU에서 5 에포크 학습 및 11 에포크 피니어 튜닝 스케줄을 사용하여 모델을 훈련시키며, 초기 WRCNN 프론트엔드에서 배치 정규화와 ELU 활성화 함수를 사용한다.

실험 결과

연구 질문

  • RQ1Conformer 기반 음성 모델이 CHiME-4 단일 귀로 ASR 작업에서 단어 오류율(WER) 측면에서 이전 SOTA 시스템인 WRBN 시스템을 능가할 수 있는가?
  • RQ2순환 BLSTM를 Conformer 인코더로 대체함으로써 학습 시간과 모델 크기를 줄일 수 있으며, 성능을 유지하거나 향상시킬 수 있는가?
  • RQ3문장 단위 정규화가 노이즈 조건 하에서 종단 간 ASR의 강건성과 신뢰성에 얼마나 기여하는가?
  • RQ4기존 시스템과 비교해 복잡한 노이즈 환경(예: 버스, 카페, 보행자, 거리)에서 제안된 모델의 성능은 어떠한가?
  • RQ5반복적 화자 적응이 추가 데이터나 모델 재학습 없이도 인식 정확도를 향상시킬 수 있는가?

주요 결과

  • 제안된 Conformer 기반 모델은 CHiME-4의 실재 테스트 세트에서 6.25% WER를 달성하였으며, 이는 이전 SOTA 시스템(Wang et al., 2019) 대비 8.4% 상대적 개선이다.
  • 모델은 이전 SOTA 대비 총 학습 시간을 79.6% 감소시키고 모델 크기를 18.3% 줄였으며, 이는 단지 2개의 Conformer 인코더 블록만을 사용한 상태에서도 가능했다.
  • 시스템은 ESPnet E2E Conformer 베이스라인과 Kaldi 기반 하이브리드 베이스라인을 모두 능가하여, 자기 지도적 사전 훈련 없이도 아키텍처적 개선이 E2E 시스템을 초월할 수 있음을 보여준다.
  • 버스, 카페, 보행자 환경에서 모델은 더 낮은 WER를 기록하며 이전 SOTA 시스템보다 우수한 강건성을 보였다. 이는 시뮬레이션 및 실재 데이터 모두에서 동일하게 적용되었다.
  • 거리 환경에서는 이전 SOTA 시스템이 略적으로 더 잘 성능을 내어, 특정 도메인의 제약이나 데이터 부족 효과가 존재할 수 있음을 시사한다.
  • 2개 이상의 Conformer 블록을 사용한 실험에서는 성능 향상이 없었으며, 이는 CHiME-4 데이터셋이 깊은 모델을 효과적으로 훈련시키기에 부족할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.