Skip to main content
QUICK REVIEW

[논문 리뷰] Multiresolution and Multimodal Speech Recognition with Transformers

Georgios Paraskevopoulos, Srinivas Parthasarathy|arXiv (Cornell University)|2020. 04. 29.
Speech and Audio Processing참고 문헌 28인용 수 7
한 줄 요약

이 논문은 시각적 특징을 교차 모달 어텐션을 통해 융합하여 ASR 성능을 향상시키는 Transformer 기반의 음성-시각 음성 인식 시스템을 제안하며, 문자 및 서브워드 수준의 전사에 대해 다중 해상도 학습 기반을 도입한다. How2 데이터셋에서의 결과는 시각 입력이 있을 경우 상대적 WER 개선률 3.76%와 다중 해상도 학습에 의한 상대적 WER 감소 18.3%를 보이며, 단일 해상도 모델 대비 수렴 속도가 50% 빠르다.

ABSTRACT

This paper presents an audio visual automatic speech recognition (AV-ASR) system using a Transformer-based architecture. We particularly focus on the scene context provided by the visual information, to ground the ASR. We extract representations for audio features in the encoder layers of the transformer and fuse video features using an additional crossmodal multihead attention layer. Additionally, we incorporate a multitask training criterion for multiresolution ASR, where we train the model to generate both character and subword level transcriptions. Experimental results on the How2 dataset, indicate that multiresolution training can speed up convergence by around 50% and relatively improves word error rate (WER) performance by upto 18% over subword prediction models. Further, incorporating visual information improves performance with relative gains upto 3.76% over audio only models. Our results are comparable to state-of-the-art Listen, Attend and Spell-based architectures.

연구 동기 및 목표

  • 실제 환경에서의 시각적 맥락을 활용하여 음성 인식 성능을 향상시키는 엔드 투 엔드 Transformer 기반의 음성-시각 ASR 시스템을 개발하는 것.
  • 실제 환경에서의 음성 입력을 맥락화하기 위해 시각적 특징을 활용한 다중 모odal 기반의 효과성을 조사하는 것.
  • 모델의 일반화를 향상시키기 위해 문자 수준과 서브워드 수준의 전사를 동시에 최적화하는 다중 해상도 학습 기반을 평가하는 것.
  • 시각 입력이 누락되거나 열악한 경우 모델의 강인성을 평가하는 것.
  • WER 및 수렴 속도 측면에서 제안된 방법이 최신의 Listen, Attend and Spell 기반 아키텍처와 어떻게 비교되는지 평가하는 것.

제안 방법

  • 모델은 음성 특징을 처리하기 위해 Transformer 인코더를 사용하며, 교차 모달 스케일드 도트-프로덕트 어텐션 레이어를 적용하여 시각적 특징을 음성 특징 공간으로 매핑한다.
  • 시각적 특징과 음성 특징은 스칼라 덧셈 융합을 통해 융합된 후 디코더에 입력되어 시퀀스 생성을 수행한다.
  • 서브워드 수준과 문자 수준의 교차 엔트로피 손실을 병합하는 다중 작업 손실을 통해 모델을 정규화하고 일반화 성능을 향상시킨다.
  • 입력 음성 시퀀스는 프레임 스택킹을 통해 다운샘플링되어 시퀀스 길이를 단축하고 자기 어텐션의 이차적 메모리 복잡도 문제를 완화한다.
  • 시스템은 How2 데이터셋에서 음성 및 영상 입력을 동시에 사용해 엔드 투 엔드로 학습되며, 시각 입력이 누락된 경우의 성능을 평가하기 위한 추론 실험을 포함한다.
  • 시각적 특징 표현은 ResNeXt 기반의 백본 네트워크를 사용해 추출되며, 추론 시에는 시각 입력을 게이팅하거나 노이즈로 대체하여 강인성 테스트를 수행한다.

실험 결과

연구 질문

  • RQ1실제 제약 없는 환경에서 다중 모달 기반의 맥락화를 통해 시각적 특징이 ASR 성능 향상에 기여할 수 있는가?
  • RQ2서브워드 수준과 문자 수준의 전사를 동시에 최적화하는 다중 해상도 손실을 통한 공동 학습이 더 나은 일반화와 더 빠른 수렴을 이끌 수 있는가?
  • RQ3시각 입력이 없거나 열악한 경우 모델의 성능는 어떻게 되며, 재학습 없이도 강인성을 유지할 수 있는가?
  • RQ4제안된 교차 모달 어텐션 융합 메커니즘이 기존의 다중 모달 Transformer 아키텍처와 비교해 ASR 성능에서 어떤가?
  • RQ5다중 해상도 학습이 단일 해상도 서브워드 또는 문자 수준 모델 대비 WER를 얼마나 줄이는가?

주요 결과

  • 교차 모달 어텐션을 통한 시각적 특징 융합은 How2 데이터셋에서 음성 전용 모델 대비 상대적 WER 개선률 3.76%를 기록한다.
  • 다중 해상도 학습 기반은 서브워드 전용 모델 대비 상대적 WER 감소 18.3%를 보이며, 강력한 정규화 효과를 입증한다.
  • 다중 해상도 감독을 통한 학습 모델은 단일 해상도 대비 약 50% 더 빠른 수렴 속도를 보인다.
  • 입력 다운샘플링을 위한 프레임 스택킹은 청킹 방식보다 성능이 뛰어나며, 장거리 맥락 정보를 유지하기 때문이다.
  • 시각 입력이 누락된 경우 AV-ASR 모델은 음성 전용 모델 대비 약 6% 상대적 성능 저하를 보이지만, 시각 특징을 정규분포 노이즈(σ=0.2)로 대체했을 때 성능이 가장 우수하다.
  • 제안된 방법은 명시적인 발음 정보에 의존하지 않음에도 불구하고 최신의 Listen, Attend and Spell 기반 모델과 유사한 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.