Skip to main content
QUICK REVIEW

[논문 리뷰] Leveraging Modality-specific Representations for Audio-visual Speech Recognition via Reinforcement Learning

Chen Chen, Yu‐Chen Hu|arXiv (Cornell University)|2022. 12. 10.
Speech and Audio Processing인용 수 4
한 줄 요약

이 논문은 소음 조건 하에서 음성-시각 음성 인식(AVSR) 성능을 향상시키기 위해 모달리티 불변 및 모달리티 특화 시각적 표현을 동적으로 통합하는 강화학습 기반 프레임워크인 MSRL을 제안한다. 단어 오류율(WER)과 일치하는 맞춤형 보상 함수를 사용함으로써, MSRL은 청소 및 다양한 소음 환경(포함된 적 없는 소음 유형 포함)에서 최신 기술보다 뛰어난 성능을 보이며, 뛰어난 내성성과 일반화 능력을 입증한다.

ABSTRACT

Audio-visual speech recognition (AVSR) has gained remarkable success for ameliorating the noise-robustness of speech recognition. Mainstream methods focus on fusing audio and visual inputs to obtain modality-invariant representations. However, such representations are prone to over-reliance on audio modality as it is much easier to recognize than video modality in clean conditions. As a result, the AVSR model underestimates the importance of visual stream in face of noise corruption. To this end, we leverage visual modality-specific representations to provide stable complementary information for the AVSR task. Specifically, we propose a reinforcement learning (RL) based framework called MSRL, where the agent dynamically harmonizes modality-invariant and modality-specific representations in the auto-regressive decoding process. We customize a reward function directly related to task-specific metrics (i.e., word error rate), which encourages the MSRL to effectively explore the optimal integration strategy. Experimental results on the LRS3 dataset show that the proposed method achieves state-of-the-art in both clean and various noisy conditions. Furthermore, we demonstrate the better generality of MSRL system than other baselines when test set contains unseen noises.

연구 동기 및 목표

  • 저 SNR 조건에서 시각 모달리티가 핵심이 되는 상황에서 기존 AVSR 모델이 음성 모달리티에 과도하게 의존하는 문제를 해결한다.
  • 실세계 상황에서 동적이고 비정상적인 소음 분포에 적응하지 못하는 고정된 융합 전략의 한계를 극복한다.
  • 자기회귀적 디코딩 중에 소음에 강인한 시각 모달리티 특화 표현을 효과적으로 활용함으로써 모델의 일반화 능력을 향상시킨다.
  • 작업별 성능 지표에 기반해 모달리티 불변 및 모달리티 특화 표현 간의 유연한 통합 메커니즘을 개발한다.
  • 특히 저자원 및 알려지지 않은 소음 환경에서, 강화학습이 최적의 융합 정책을 학습하는 데 효과적인지 입증한다.

제안 방법

  • 음성 스트림과 별개로 입술 움직임에서 모달리티 특화 시각적 표현을 추출하기 위해 사전 학습된 비전 모델을 사용한다.
  • 자기회귀적 디코딩 중에 모달리티 불변 및 모달리티 특화 표현 간의 동적 선택을 수행하는 강화학습(RL) 에이전트를 도입한다.
  • RL 에이전트가 최적의 통합 전략으로 향하도록 단어 오류율(WER) 기반의 작업 지향 보상 함수를 설계한다.
  • 다양한 토큰 수준의 통합 전략을 탐색할 수 있도록 추론 중에 빔 서치를 사용한다.
  • 정책 기반 강화학습 방법을 사용해 정책 네트워크를 엔드 투 엔드로 훈련하며, 에이전트가 소음 조건과 맥락에 따라 표현의 가중치를 학습한다.
  • RL 기반 융합 메커니즘을 자기회귀적 ASR 디코더에 통합하여, 각 디코딩 단계에서 맥락 인식형, 적응형 융합을 가능하게 한다.

실험 결과

연구 질문

  • RQ1소음에 의해 손상된 음성 조건에서, 특히 저 SNR 조건에서 모달리티 특화 시각적 표현이 AVSR 성능 향상에 기여할 수 있는가?
  • RQ2다양한 소음 분포 하에서 모달리티 불변 및 모달리티 특화 표현 간의 동적 융합 전략을 효과적으로 학습할 수 있는가?
  • RQ3WER에 기반한 보상 함수를 갖춘 강화학습이 고정된 융합 기반 모델 대비 알려지지 않은 소음 유형에 대해 더 나은 일반화 성능을 보이는가?
  • RQ4모달리티 특화 표현은 저자원 학습 환경에서 데이터 효율성을 얼마나 향상시키는가?
  • RQ5제안된 방법이 청소 및 다양한 소음 환경(포함된 적 없는 소음 유형 포함)에서 최신 기술 AVSR 모델을 초월할 수 있는가?

주요 결과

  • LRS3 데이터셋에서 청소 조건에서 MSRL은 1.33%의 WER를 기록했으며, 일반 자원 모드에서 최고의 베이스라인(AV-HuBERT) 대비 5% 상대 감소를 보였다.
  • 저자원 모드에서 MSRL은 WER를 2.82%로 줄였으며, AV-HuBERT 대비 14.5% 상대 개선을 기록하여 뛰어난 데이터 효율성을 입증했다.
  • 미리 보지 않은 소음 유형(카페, 미팅, 강, 레스토랑)에서, 저자원 모드에서 MSRL은 AV-HuBERT 대비 12.5%에서 27.1%까지 상대적으로 우수한 성능을 보이며 강력한 일반화 능력을 입증했다.
  • 소음 조건에서, 저자원 모드에서 MSRL은 번잡한 소음(Babble noise)에서 32.5% 상대적 승리, 언어 소음(Speech noise)에서 25.7% 상대적 승리를 기록했으며, 모든 SNR 수준에서 일관된 성능 향상을 보였다.
  • 단지 30시간의 레이블 데이터만으로도 MSRL은 34,000시간의 데이터를 사용하는 RNN-T를 능가했으며, 이는 뛰어난 데이터 효율성을 보여준다.
  • 모델 앙상블 베이스라인은 청소 조건에서 시각 모달리티 특화 표현에 과도하게 의존하여 성능이 열등했지만, MSRL은 맥락 인식형 융합을 학습함으로써 모든 설정에서 강건성을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.