Skip to main content
QUICK REVIEW

[논문 리뷰] Audio-visual Recognition of Overlapped speech for the LRS2 dataset

Jianwei Yu, Shi-Xiong Zhang|arXiv (Cornell University)|2020. 01. 06.
Speech and Audio Processing참고 문헌 34인용 수 10
한 줄 요약

이 논문은 라이브러리-자유형 최대가능도(LF-MMI) 시간지연신경망(TDNN) 아키텍처를 사용한 하이브리드 방식의 음성-시각 음성인식(AVSR) 시스템을 제안하며, 겹치는 말소리 상황에서 상태의 성능을 달성한다. LRS2 데이터셋에서 음성 전용 기준 대비 단어오류율(WER)을 최대 29.98%p 감소시키며, 더 복잡한 파이프라인 아키텍처의 성능을 따라잡는다.

ABSTRACT

Automatic recognition of overlapped speech remains a highly challenging task to date. Motivated by the bimodal nature of human speech perception, this paper investigates the use of audio-visual technologies for overlapped speech recognition. Three issues associated with the construction of audio-visual speech recognition (AVSR) systems are addressed. First, the basic architecture designs i.e. end-to-end and hybrid of AVSR systems are investigated. Second, purposefully designed modality fusion gates are used to robustly integrate the audio and visual features. Third, in contrast to a traditional pipelined architecture containing explicit speech separation and recognition components, a streamlined and integrated AVSR system optimized consistently using the lattice-free MMI (LF-MMI) discriminative criterion is also proposed. The proposed LF-MMI time-delay neural network (TDNN) system establishes the state-of-the-art for the LRS2 dataset. Experiments on overlapped speech simulated from the LRS2 dataset suggest the proposed AVSR system outperformed the audio only baseline LF-MMI DNN system by up to 29.98\% absolute in word error rate (WER) reduction, and produced recognition performance comparable to a more complex pipelined system. Consistent performance improvements of 4.89\% absolute in WER reduction over the baseline AVSR system using feature fusion are also obtained.

연구 동기 및 목표

  • 겹치는 말소리 상황에서 청각적 간섭이 심해 성능이 급격히 떨어지는 문제를 해결하기 위해.
  • 청각적 간섭으로 인한 성능 저하를 줄이기 위해 시각적 단서를 활용하여 음성-시각 융합이 인식의 강건성을 향상시키는지 조사하기 위해.
  • 레이어리스 자유형 최대가능도(LF-MMI) 기준을 사용하여 음성 강화와 인식을 동시에 최적화하는 통합된 AVSR 시스템을 개발하여, 파이프라인 아키텍처의 한계를 피하기 위해.
  • 하이브리드 및 종단간 AVSR 아키텍처를 비교하여 겹치는 말소리 인식에 더 우수한 설계를 규명하기 위해.
  • 다양한 신뢰도 조건에서 동적으로 음성-시각 통합을 조정할 수 있는 새로운 게이팅 융합 메커니즘을 도입하고 평가하기 위해.

제안 방법

  • 청결한 음성 및 겹치는 말소리 데이터를 종합적으로 사용하여 종단간으로 훈련하는 하이브리드 LF-MMI TDNN 아키텍처를 사용하여 AVSR를 수행하며, 분류 성능 향상을 위한 최적화를 수행한다.
  • 두 가지 게이팅 융합 메커니즘을 도입: 시각 모odal 기반(Visual-driven, V ⊗ A) 및 음성-시각 모달 기반((Audio-visual-driven, AV ⊗ A). 이는 각 모달의 신뢰도에 따라 음성 및 시각 특징의 가중치를 동적으로 조정한다.
  • 신뢰도가 떨어지는 시각 입력을 억제하기 위해 주의 메커니즘 유사 가중치를 학습하는 게이팅 융합 레이어를 사용하여, 시각 품질이 열 劣화될 경우에도 강건성을 향상시킨다.
  • 순서 수준의 분류적 훈련을 위해 레이어리스 자유형 최대가능도(LF-MMI) 기준을 적용하여, 명시적인 음성 분리 구성 요소 없이 통합된 AVSR 시스템을 공동 최적화한다.
  • 청결한 음성과 이중 발화자 겹치는 말소리 데이터를 다양한 신호대잡음비(SNR) 수준(-5dB에서 10dB)으로 혼합하여 훈련하며, 현실적인 노이즈 환경을 시뮬레이션한다.
  • 청결한 음성 및 강화된(분리된) 데이터를 사용하여 다중 조건 훈련을 수행하는 별도의 음성 분리 및 인식 모듈을 갖춘 파이프라인 아키텍처와 제안된 통합 시스템을 비교한다.

실험 결과

연구 질문

  • RQ1LRS2 데이터셋에서 겹치는 말소리 인식에 하이브리드 AVSR 시스템이 종단간 AVSR 시스템보다 우수한 성능을 보일까?
  • RQ2특히 시각 입력이 신뢰도가 떨어질 경우, 기존 특징 연결 기반 융합 대비 게이팅 융합 메커니즘이 AVSR 성능 향상에 기여할 수 있을까?
  • RQ3LF-MMI로 훈련된 통합 AVSR 시스템이 명시적인 음성 분리 및 다중 조건 훈련을 사용하는 더 복잡한 파이프라인 시스템과 유사한 성능을 달성할 수 있을까?
  • RQ4저 SNR 조건에서 시각 모달의 포함 여부가 WER 감소에 어떤 영향을 미치는가?
  • RQ5LF-MMI를 통한 공동 최적화가 분리된 최적화 방식(분리 및 인식 모듈 별도 최적화)에 비해 인식 강건성을 얼마나 향상시킬 수 있을까?

주요 결과

  • 제안된 LF-MMI TDNN 하이브리드 AVSR 시스템은 LRS2 데이터셋에서 기존 종단간 AVSR 시스템을 능가하는 최신 기술 수준의 성능을 달성한다.
  • 게이팅 융합 메커니즘(AV ⊗ A)은 특징 연결 기반 융합 대비 WER을 4.89%p 절감(상대적 32% 향상)하여 모달 신뢰도 저하에 대한 강건성을 향상시킴을 입증한다.
  • 통합된 AVSR 시스템은 음성 전용 LF-MMI DNN 기준 대비 WER을 최대 29.98%p 절감하여 음성 전용 시스템을 크게 능가한다.
  • 최고 성능을 보인 통합 시스템은 SNR 수준 전반에서 평균 WER 10.80%를 기록하며, 다중 조건 훈련을 사용하는 더 복잡한 파이프라인 시스템과 동등한 성능을 달성한다.
  • 음성 프레임 수준의 정렬을 사용해 훈련한 시각 전용 시스템은 성능 향상을 보이며, 이는 음성 감독이 입술 읽기 모델의 성능을 향상시킴을 시사한다.
  • 하이브리드 AVSR 시스템이 LRS2에서 종단간 AVSR 시스템을 능가함을 통해, 하이브리드 아키텍처가 복잡한 겹치는 말소리 인식 작업에 더 적합함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.