Skip to main content
QUICK REVIEW

[논문 리뷰] Attentive Fusion Enhanced Audio-Visual Encoding for Transformer Based Robust Speech Recognition

Liangfa Wei, Jie Zhang|arXiv (Cornell University)|2020. 08. 06.
Speech and Audio Processing참고 문헌 24인용 수 9
한 줄 요약

이 논문은 트랜스포머 기반의 내성적인 음성 인식을 위한 주의 집중형 융합 강화 음성-시각 인코딩 방법을 제안한다. 다중 헤드 주의 기반 융합 블록을 인코더에 직접 통합하여 음성 및 시각 특징을 함께 모델링한다. 기존 최고 수준의 접근 방식과 비교해 청소된 조건, 관측된 노이즈 조건, 그리고 미관측된 노이즈 조건에서 평균적으로 각각 0.55%, 4.51%, 4.61%의 정확도 향상을 이룬다.

ABSTRACT

Audio-visual information fusion enables a performance improvement in speech recognition performed in complex acoustic scenarios, e.g., noisy environments. It is required to explore an effective audio-visual fusion strategy for audiovisual alignment and modality reliability. Different from the previous end-to-end approaches where the audio-visual fusion is performed after encoding each modality, in this paper we propose to integrate an attentive fusion block into the encoding process. It is shown that the proposed audio-visual fusion method in the encoder module can enrich audio-visual representations, as the relevance between the two modalities is leveraged. In line with the transformer-based architecture, we implement the embedded fusion block using a multi-head attention based audiovisual fusion with one-way or two-way interactions. The proposed method can sufficiently combine the two streams and weaken the over-reliance on the audio modality. Experiments on the LRS3-TED dataset demonstrate that the proposed method can increase the recognition rate by 0.55%, 4.51% and 4.61% on average under the clean, seen and unseen noise conditions, respectively, compared to the state-of-the-art approach.

연구 동기 및 목표

  • 청음 환경에서 시각 모odal 정보를 활용해 자동 음성 인식의 내성을 향상시키기 위해.
  • 기존의 종단 간 음성-시각 융합 방법이 모달리티 인코딩 이후에 융합을 수행함으로써 모달리티 간 상호작용를 충분히 활용하지 못하는 한계를 해결하기 위해.
  • 인코딩 과정 중에 음성-시각 정렬 및 신뢰도를 통합함으로써 표현 학습을 향상시키는 융합 전략을 설계하기 위해.
  • 다양한 노이즈 조건에서 정확도를 향상시키기 위해 조기 융합과 주의 집중 메커니즘의 융합 효과를 평가하기 위해.
  • 제안된 방법이 미관측된 노이즈 시나리오로의 일반화 능력을 입증하기 위해.

제안 방법

  • 인코더 내부에 주의 집중 융합 블록을 통합하여, 인코딩 과정 중에 음성-시각 표현 학습을 가능하게 하며, 이후에 융합하는 방식이 아닌, 인코딩 중에 융합을 수행한다.
  • 단방향 또는 양방향 모달리티 상호작용을 통해 다중 헤드 주의 메커니즘을 활용하여 교차 모달리티 의존성을 모델링한다.
  • 융합 블록의 입력으로 음성-시각 연결을 사용한 후, 자기 주의를 통해 모달리티 정렬 및 관련성을 학습한다.
  • 인코더의 여러 레이어에 융합 블록을 적용하여 점진적으로 교차 모달리티 컨텍스트를 포함한 표현을 향상시킨다.
  • 조기 융합 전략을 적용하여 음성 및 시각 특징을 디코더 이전에 융합함으로써, 후기 융합 방법에서 관찰되는 디코더 과부하 문제를 피한다.
  • 한 모달리티에서 다른 모달리티로 주의를 기울이는 공유 주의 메커니즘을 활용하여 신뢰할 수 있는 모달리티에 대한 동적 가중치를 부여한다.

실험 결과

연구 질문

  • RQ1기존의 인코딩 이후 융합 방식과 비교해, 인코더 내부에 음성-시각 융합을 통합하는 것이 저 SNR 음성 인식에서 내성을 향상시키는가?
  • RQ2다양한 노이즈 조건에서 제안된 주의 집중 융합 메커니즘이 간단한 연결 또는 후기 융합 방식과 비교해 WER에 어떤 영향을 미치는가?
  • RQ3제안된 방법은 학습 세트 외의 새로운 노이즈 유형(예: buccaneer2 노이즈)에 일반화되는가?
  • RQ4양방향 대비 단방향 모달리티 상호작용이 고, 저 SNR 조건에서 성능에 어떤 영향을 미치는가?
  • RQ5융합 메커니즘이 노이즈 환경에서 음성 모달리티에 대한 과도한 의존도를 줄일 수 있는가?

주요 결과

  • 제안된 주의 집중 융합 강화 조기 융합 방법은 기준 모델 대비 청소된 조건에서 평균적으로 WER을 0.55% 감소시켰다.
  • 관측된 노이즈(혼잡한 배경음) 조건에서는 최고 수준의 기준 모델 대비 상대적 WER 감소율이 4.51%에 달했다.
  • 미관측된 노이즈(buccaneer2) 조건에서는 평균적으로 WER이 4.61% 감소하여 강력한 일반화 능력을 입증했다.
  • AV-align 융합 블록은 저 SNR 조건에서 AV-concat 및 AV-cross보다 우수한 성능을 보이며 더 높은 내성을 입증했다.
  • AV-cross 방법은 고 SNR 조건에서는 AV-align보다 우수하지만 저 SNR 조건에서 급격히 성능이 떨어지며, 시각 스트림의 노이즈 오염에 취약함을 보여주었다.
  • 모든 노이즈 조건에서 조기 융합에 주의 집중 융합 블록을 적용한 방법이 중간 융합 및 후기 융합 전략을 일관되게 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.