Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Lite Audio-Visual Speech Enhancement

Shang-Yi Chuang, Hsin‐Min Wang|arXiv (Cornell University)|2020. 08. 30.
Speech and Audio Processing참고 문헌 91인용 수 6
한 줄 요약

이 논문은 복합적이고 비밀유지 가능한 오디오-시각 음성 향상 시스템인 개선된 라이트 오디오-시각 음성 향상(iLAVSE)을 제안한다. 이 시스템은 오디오-시각 특징 압축과 강건한 훈련 전략을 적용한 컨volutional recurrent neural network(CRNN)을 사용하며, 높은 시각 처리 비용, 오디오-시각 비동기성, 저품질의 시각 데이터 문제를 효과적으로 해결한다. 실생활 제약 조건(최대 100%의 시각 데이터 손실 및 심한 비동기성 포함)에서도 기준 AVSE 및 오디오 전용 시스템보다 뛰어난 성능을 달성한다.

ABSTRACT

Numerous studies have investigated the effectiveness of audio-visual multimodal learning for speech enhancement (AVSE) tasks, seeking a solution that uses visual data as auxiliary and complementary input to reduce the noise of noisy speech signals. Recently, we proposed a lite audio-visual speech enhancement (LAVSE) algorithm for a car-driving scenario. Compared to conventional AVSE systems, LAVSE requires less online computation and to some extent solves the user privacy problem on facial data. In this study, we extend LAVSE to improve its ability to address three practical issues often encountered in implementing AVSE systems, namely, the additional cost of processing visual data, audio-visual asynchronization, and low-quality visual data. The proposed system is termed improved LAVSE (iLAVSE), which uses a convolutional recurrent neural network architecture as the core AVSE model. We evaluate iLAVSE on the Taiwan Mandarin speech with video dataset. Experimental results confirm that compared to conventional AVSE systems, iLAVSE can effectively overcome the aforementioned three practical issues and can improve enhancement performance. The results also confirm that iLAVSE is suitable for real-world scenarios, where high-quality audio-visual sensors may not always be available.

연구 동기 및 목표

  • 오디오-시각 음성 향상(AVSE) 시스템을 구현할 때 발생하는 실용적 과제, 즉 시각 처리의 높은 계산 비용, 오디오-시각 비동기성, 저품질의 시각 입력을 해결하기 위함.
  • 라이트 AVSE(LAVSE) 프레임워크를 확장하여, 기밀성이나 계산 효율성에 손상 없이도 강건성을 향상시키기 위함.
  • 시각 센서가 신뢰할 수 없거나 자원이 제한된 실생활 조건에서도 높은 향상 성능를 유지할 수 있는 시스템을 개발하기 위함.
  • 오디오-시각 비일치 및 시각 데이터 열화를 다루기 위해 데이터 증강 및 제로아웃 훈련의 효과를 검증하기 위함.

제안 방법

  • iLAVSE 시스템은 오디오-시각 시퀀스의 시간적 의존성을 모델링하기 위해 LSTM 레이어를 포함한 다중모odal CRNN 아키텍처를 사용한다.
  • 시각 데이터는 잠재 특징 양자화 단위를 갖는 오토에인코더(AE)를 통해 압축되며, 이는 데이터 크기를 줄이고 이미지 복원을 방지함으로써 기밀성을 향상시킨다.
  • CRQ(Compact Representation Quantization) 모듈은 계산 오버헤드를 최소화하기 위해 AVSE 모델에 사용할 수 있는 압축된 시각 특징을 추출한다.
  • 오디오-시각 비동기성은 데이터 증강을 통해 완화된다: 실제 비동기 상황을 시뮬레이션하기 위해 훈련 시 무작위 오프셋을 가진 오디오-시각 쌍을 사용한다.
  • 저품질의 시각 데이터는 제로아웃 훈련 방식으로 시뮬레이션된다. 훈련 중에 특정 비율(0–100%)로 프레임을 무작위로 0으로 마스킹한다.
  • 시스템은 PESQ 및 STOI 메트릭을 사용해 평가하는 타이완 중어 영상 데이터셋을 기반으로 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1시각 데이터가 오디오에 비해 지연되거나 비일치할 경우, 경량 AVSE 시스템이 높은 성능를 유지할 수 있는가?
  • RQ2시각 입력이 열화되거나 부분적으로 손실되었을 경우, 시스템의 성능는 어떻게 되는가?
  • RQ3증강된 비동기 데이터로 훈련할 경우, 오디오-시각 비동기성에 대한 강건성이 얼마나 향상되는가?
  • RQ4합성된 저품질 시각 데이터에 대해 제로아웃 훈련을 수행할 경우, 실제 시각 데이터 손실 상황에서 일반화 성능가 향상되는가?

주요 결과

  • iLAVSE(OFR5)는 [-3, 3] 범위의 모든 테스트 오프셋에서 Noisy 및 AOSE(DP)를 모두 초월하며, 경미한에서 중간 수준의 오디오-시각 비동기성에 대한 강건성을 확인한다.
  • 100%의 시각 데이터 손실 조건에서 테스트한 결과, LPR ≥ 30로 훈련된 iLAVSE 모델은 AOSE(DP)와 유사한 PESQ 및 STOI 점수를 기록하여 극단적인 시각 데이터 손실 상황에서도 성능 저하가 최소화됨을 보여준다.
  • LPR ≥ 30로 훈련된 iLAVSE(LPR0)는 10%의 시각 데이터 손실 조건에서도 성능 저하가 급격히 발생함을 확인했으며, 이는 저품질 데이터로 훈련하는 것이 필수적임을 입증한다.
  • LPR ≥ 30로 훈련된 모델은 0–100%의 모든 시각 데이터 손실 수준에서 안정적인 성능를 유지하며, 시각 품질 열화에 대한 강력한 강건성을 입증한다.
  • 기존 AVSE 및 오디오 전용 시스템보다 뛰어난 향상 성능를 기록하며, 특히 시각 조건이 열악한 상황에서 뛰어난 성능를 보여, 실생활 적용 가능성의 타당성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.