Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-end Audio-visual Speech Recognition with Conformers

Pingchuan Ma, Stavros Petridis|arXiv (Cornell University)|2021. 02. 12.
Speech and Audio Processing참고 문헌 36인용 수 4
한 줄 요약

이 논문은 원시 파형과 픽셀에서 동시 청각적 특징을 추출하기 위해 Conformers를 사용하는 엔드 투 엔드 음성-시각적 음성 인식 모델을 제안한다. 하이브리드 CTC/attention 디코더와 트랜스포머 기반 언어 모델을 사용하며, LRS2 및 LRS3에서 최신 기술 수준의 성능을 달성한다. 원시 음성 및 영상 입력을 사용함에도 불구하고 훈련 데이터가 훨씬 적은데도 불구하고 LRS3 v0.0에서 1.2% (청각적)의 단어 오류율(WER)을 기록하고, LRS3 v0.4에서는 2.3%를 기록하여 이전 방법들을 능가한다.

ABSTRACT

In this work, we present a hybrid CTC/Attention model based on a ResNet-18 and Convolution-augmented transformer (Conformer), that can be trained in an end-to-end manner. In particular, the audio and visual encoders learn to extract features directly from raw pixels and audio waveforms, respectively, which are then fed to conformers and then fusion takes place via a Multi-Layer Perceptron (MLP). The model learns to recognise characters using a combination of CTC and an attention mechanism. We show that end-to-end training, instead of using pre-computed visual features which is common in the literature, the use of a conformer, instead of a recurrent network, and the use of a transformer-based language model, significantly improve the performance of our model. We present results on the largest publicly available datasets for sentence-level speech recognition, Lip Reading Sentences 2 (LRS2) and Lip Reading Sentences 3 (LRS3), respectively. The results show that our proposed models raise the state-of-the-art performance by a large margin in audio-only, visual-only, and audio-visual experiments.

연구 동기 및 목표

  • 사전에 계산된 특징 없이 원시 음성 및 영상 입력을 직접 처리할 수 있는 엔드 투 엔드 청각적 음성 인식 모델을 개발하는 것.
  • 순환 네트워크를 Conformers로 교체하고 트랜스포머 기반 언어 모델을 사용하여 성능을 향상시키는 것.
  • 원시 입력에서의 공동 엔드 투 엔드 훈련이 사전 추출된 특징을 사용하는 모델보다 열등한 결과를 낳지 않음을 입증하는 것.
  • 청결한 조건과 노이즈가 있는 조건을 포함한 대규모 실외 환경 데이터셋인 LRS2 및 LRS3에서 모델을 평가하는 것.
  • 청각 융합이 고노이즈 환경에서 강건성을 크게 향상시킨다는 것을 보여주는 것.

제안 방법

  • 영상 입력에 대해 3D 컨볼루션을 사용하는 수정된 ResNet-18과 음성 입력에 대해 1D 컨볼루션을 사용하여 픽셀과 파형에서 원시 특징을 추출한다.
  • 시각적 및 음성 특징은 컨볼루션과 자기주의 기반 메커니즘을 조합한 시간 모델링을 위한 Conformer 인코더로 처리된다.
  • 두 모odal의 특징은 다층 퍼셉트론(MLP)을 통해 융합된 후 하이브리드 CTC/attention 디코더로 전달된다.
  • CTC 및 주의력 손실을 사용하여 엔드 투 엔드로 훈련되며, 향상된 디코딩을 위해 트랜스포머 기반 언어 모델이 사용된다.
  • 노이즈 환경에서의 강건성을 향상시키기 위해 로그-멜 필터뱅크 특징 대신 원시 음성 파형을 사용한다.
  • 아키텍처는 LRS2 및 LRS3에서 평가되며, 데이터 크기, 입력 모odal, 훈련 전략에 대한 분석 연구가 함께 수행된다.
Fig. 1 : End-to-end audio-visual speech recognition architecture. The inputs are pixels and raw audio waveforms.
Fig. 1 : End-to-end audio-visual speech recognition architecture. The inputs are pixels and raw audio waveforms.

실험 결과

연구 질문

  • RQ1사전에 계산된 특징을 사용하는 모델과 비교해 원시 음성 및 시각 입력에서의 엔드 투 엔드 훈련이 청각적 음성 인식 성능 향상에 기여하는가?
  • RQ2순환 네트워크를 Conformers로 교체하면 청각적 음성 인식에서 성능 향상이 눈에 띄게 발생하는가?
  • RQ3RNN 기반 모델과 비교해 트랜스포머 기반 언어 모델을 사용할 경우 인식 정확도에 어떤 영향을 미치는가?
  • RQ4더 작은 데이터셋에서 훈련된 모델이 훨씬 더 큰 데이터셋에서 훈련된 모델보다 성능이 뛰어날 수 있는가, 특히 노이즈가 많거나 도전적인 조건에서?
  • RQ5청각 융합이 고노이즈 환경에서 강건성을 어떻게 향상시키는가?

주요 결과

  • 제안된 모델은 LRS3 v0.0에서 청각적 인식에 대해 1.2%의 단어 오류율(WER)을 기록하여 새로운 최신 기술 수준을 달성한다.
  • LRS3 v0.4에서는 청각적 인식에 대해 2.3%의 WER를 기록하여 이전 방법들보다 2.2个百分点 높은 성능을 보였다.
  • 시각적 모달 전용 모델은 LRS3 v0.4에서 43.3%의 WER를 기록하였으며, 더 적은 훈련 데이터를 사용했음에도 불구하고 이전 방법들을 능가했다.
  • 음성 전용 모델은 LRS3 v0.0에서 1.3%의 WER를 기록하였고, v0.4에서는 2.3%로 증가하여 원시 음성 훈련의 강건성을 입증했다.
  • 31,000시간의 YT 데이터로 훈련된 방법과 비교해 438시간의 LRS3 데이터만으로도 성능이 뛰어나 데이터 효율성을 입증했다.
  • 청각 융합은 특히 고노이즈 환경에서 성능 향상에 크게 기여하여 두 모달 간 상보성의 존재를 확인했다.
Fig. 2 : Word Error Rate (WER) as a function of the noise level. A: End-to-End audio model. V: End-to-End visual model, AV: End-to-End audio-visual model. log-Mel filter-bank: A conformer model trained with log-Mel filter-bank features.
Fig. 2 : Word Error Rate (WER) as a function of the noise level. A: End-to-End audio model. V: End-to-End visual model, AV: End-to-End audio-visual model. log-Mel filter-bank: A conformer model trained with log-Mel filter-bank features.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.