Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer-Based Video Front-Ends for Audio-Visual Speech Recognition for Single and Multi-Person Video

Dmitriy Serdyuk, Otavio Braga|arXiv (Cornell University)|2022. 01. 25.
Speech and Audio Processing인용 수 6
한 줄 요약

이 논문은 음성-시각 음성 인식에서 3D 컨볼루션 신경망을 대체하기 위해 비디오 트랜스포머(ViT) 프론트엔드를 제안한다. 이는 비디오 클립을 3D 패치로 처리하고 자기주의(self-attention)를 적용하여 시각적 특징을 추출한다. ViT 기반 프론트엔드는 최신 기술 수준의 성능을 달성하여, LRS3-TED에서 컨볼루션 기반 베이스라인 대비 상대적으로 15% WER를 감소시키며, 파인튜닝 이후 1.6% WER에 도달한다.

ABSTRACT

Audio-visual automatic speech recognition (AV-ASR) extends speech recognition by introducing the video modality as an additional source of information. In this work, the information contained in the motion of the speaker's mouth is used to augment the audio features. The video modality is traditionally processed with a 3D convolutional neural network (e.g. 3D version of VGG). Recently, image transformer networks arXiv:2010.11929 demonstrated the ability to extract rich visual features for image classification tasks. Here, we propose to replace the 3D convolution with a video transformer to extract visual features. We train our baselines and the proposed model on a large scale corpus of YouTube videos. The performance of our approach is evaluated on a labeled subset of YouTube videos as well as on the LRS3-TED public corpus. Our best video-only model obtains 31.4% WER on YTDEV18 and 17.0% on LRS3-TED, a 10% and 15% relative improvements over our convolutional baseline. We achieve the state of the art performance of the audio-visual recognition on the LRS3-TED after fine-tuning our model (1.6% WER). In addition, in a series of experiments on multi-person AV-ASR, we obtained an average relative reduction of 2% over our convolutional video frontend.

연구 동기 및 목표

  • 비전 트랜스포머(ViT) 아키텍처가 음성-시각 음성 인식을 위한 비디오 프론트엔드에서 3D 컨볼루션 네트워크를 능가할 수 있는지 조사하는 것.
  • 특히 입술 읽기와 다인 시나리오에서 저자원 및 노이즈 조건에서 ViT 기반 비디오 인코딩의 효과성을 평가하는 것.
  • 대규모 유튜브 데이터셋에 대한 파인튜닝을 통해 LRS3-TED 벤치마크에서 최신 기술 수준의 성능을 달성하는 것.
  • 인위적으로 추가된 번잡한 소음이 있는 조건에서 ViT와 컨볼루션 프론트엔드의 강인성(robustness)을 비교하는 것.
  • 다양한 유튜브 영상에서 사전학습한 후 고품질 TED 데이터에서 파인튜닝할 때 도메인 스트레스(domain shift) 영향을 분석하는 것.

제안 방법

  • 비디오 프론트엔드는 입력 비디오를 크기 32×32×8인 3D 패치로 처리한 후, 각 패치를 임베딩하기 위해 학습 가능한 선형 투영을 수행한다.
  • 다중 헤드 자기주의와 피드포워드 레이어를 포함한 표준 트랜스포머 인코더가 임베딩된 패치를 처리하여 전역적인 공간-시간적 의존성을 추출한다.
  • 시각적 특징은 240차원의 로그-멜 음성 특징과 결합되어, 순차적-순차적 모델링을 위한 후행 AV 인코더(트랜스포머 또는 컨포머)로 입력된다.
  • 모델은 엔드 투 엔드 훈련을 위해 RNN-T 손실을 사용하여 대규모 유튜브 비디오 데이터셋에서 사전학습된 후, LRS3-TED 데이터셋에서 파인튜닝된다.
  • 간신히 강인성 평가를 위해, LRS3-TED 테스트 세트는 20dB, 10dB, 0dB SNR의 번잡한 소음으로 손상되어, 열악한 음성 조건에서의 성능을 평가한다.
  • 다인 음성-시각 ASR는 겹치는 발화가 있는 유튜브 영상의 일부에서 평가되며, ViT와 컨볼루션 프론트엔드 간의 성능을 비교한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머 기반 비디오 프론트엔드가 음성-시각 음성 인식에서 3D 컨볼루션 네트워크와 비교해 유사하거나 더 높은 성능을 달성할 수 있는가?
  • RQ2ViT 프론트엔드는 입술 읽기와 같은 저자원 설정, 예를 들어 비디오 전용 입력에서 성능 향상을 이끌 수 있는가?
  • RQ3특히 추가된 번잡한 소음이 있는 조건에서 ViT 프론트엔드는 어떤 성능을 보이는가?
  • RQ4고품질 TED 데이터에서의 파인튜닝이 LRS3-TED에서 최신 기술 수준의 성능을 달성할 수 있으며, ViT 프론트엔드가 컨볼루션 베이스라인보다 더 잘 일반화되는가?
  • RQ5ViT 프론트엔드는 겹치는 말과 시각 입력이 있는 다인 시나리오에서 어떻게 대처하는가?

주요 결과

  • ViT 기반 비디오 프론트엔드는 YTDEV18 데이터셋에서 31.4% WER를 기록하여, 3D 컨볼루션 베이스라인(40.5% WER) 대비 10% 상대적 향상률을 보였다.
  • LRS3-TED 데이터셋에서 비디오 전용 설정에서는 ViT 프론트엔드가 17.0% WER를 기록하여, 컨볼루션 베이스라인(28.2% WER) 대비 15% 상대적 향상률을 기록했다.
  • 유튜브와 LRS3-TED 데이터를 50-50 비율로 혼합하여 파인튜닝한 결과, ViT 기반 모델은 LRS3-TED에서 1.6% WER에 도달하여 이전 최신 기술 수준을 재현했다.
  • 노이즈 조건(0dB 번잡한 소음)에서 ViT 프론트엔드는 강력한 성능을 유지하여, 오디오 전용 모델 대비 2.9% WER를 기록했다.
  • 다인 AV-ASR 시나리오에서 ViT 프론트엔드는 평균적으로 컨볼루션 베이스라인 대비 2% 상대적 WER 향상을 기록했다.
  • LRS3-TED에서의 파인튜닝은 입술 읽기 성능 향상을 이끌지 못했으며, 이는 유튜브와 TED 데이터셋 간 음성 품질의 도메인 스트레스 때문일 가능성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.