Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Speech Representations from Raw Audio by Joint Audiovisual Self-Supervision

Abhinav Shukla, Stavros Petridis|arXiv (Cornell University)|2020. 07. 08.
Speech and Audio Processing참고 문헌 22인용 수 4
한 줄 요약

이 논문은 음성 속성 예측(음성 특성 예측)과 시각적 자율학습(말하는 얼굴 생성)을 결합하여 원시 음성 웨이브폼에서 직접 음성 표현을 학습하는 통합 청각시각 자율학습 방법을 제안한다. 이 방법은 특히 저자료 및 노이즈 조건에서 완전히 지도학습 및 기존 자율학습 방법보다 뛰어난 성능을 보이며, 음성 표현 학습을 위한 다중모달 프리트레인팅의 효과성을 입증한다.

ABSTRACT

The intuitive interaction between the audio and visual modalities is valuable for cross-modal self-supervised learning. This concept has been demonstrated for generic audiovisual tasks like video action recognition and acoustic scene classification. However, self-supervision remains under-explored for audiovisual speech. We propose a method to learn self-supervised speech representations from the raw audio waveform. We train a raw audio encoder by combining audio-only self-supervision (by predicting informative audio attributes) with visual self-supervision (by generating talking faces from audio). The visual pretext task drives the audio representations to capture information related to lip movements. This enriches the audio encoder with visual information and the encoder can be used for evaluation without the visual modality. Our method attains competitive performance with respect to existing self-supervised audio features on established isolated word classification benchmarks, and significantly outperforms other methods at learning from fewer labels. Notably, our method also outperforms fully supervised training, thus providing a strong initialization for speech related tasks. Our results demonstrate the potential of multimodal self-supervision in audiovisual speech for learning good audio representations.

연구 동기 및 목표

  • 원시 음성 웨이브폼에서 교차모달 감시를 통해 강건한 음성 표현을 학습하는 자율학습 방법을 개발하는 것.
  • 특히 말하는 얼굴 생성을 통한 시각 자율학습(예측 과제)이 음성 표현을 어떻게 풍부화하는지 탐색하는 것.
  • 라벨이 부족한 상황에서 다운스트림 음성 분류 과제에서 통합 청각시각 자율학습이 성능 향상에 기여하는지 평가하는 것.
  • 특히 저자원 및 노이즈 조건에서 제안된 방법을 음성 중심 자율학습 방법 및 완전 지도학습과 비교하는 것.

제안 방법

  • 방법은 원시 음성 및 시각 모달리티에서의 통합 자율학습을 위해 1D ResNet18을 음성 인코더로 사용한다.
  • 음성 중심 자율학습은 음성 인코더의 잠재 표현에서 주요 음성 특성(MFCCs, 로그 멜스펙트로그램, 원시 웨이브폼)을 재구성하는 디코더를 훈련시켜 달성된다.
  • 시각 자율학습은 첫 번째 프레임과 음성 임베딩에서 말하는 얼굴 프레임 시퀀스를 재구성하는 비디오 생성 헤드를 통해 구현되며, 음성과 입술 움직임 간의 정렬을 강제한다.
  • 음성 인코더는 음성 및 시각 과제의 재구성 손실을 함께 최적화하여, 시각 정보를 포함한 표현을 학습하도록 한다.
  • 최종 음성 인코더는 교차엔트로피 손실을 사용하는 BiGRU 분류기로 다운스트림 분류 과제에서 테스트한다.
  • 방법은 고립된 단어 분류(SPC 및 LRW 데이터셋)에서 평가되며, 제한된 데이터(10%) 및 노이즈 조건(SNR -5 dB에서 20 dB)에서의 분석도 포함된다.

실험 결과

연구 질문

  • RQ1음성 중심 자율학습에 비해 통합 청각시각 자율학습이 원시 음성에서의 음성 표현 학습을 향상시킬 수 있는가?
  • RQ2말하는 얼굴 생성을 통한 시각 자율학습은 특히 저자료 환경에서 음성 표현의 일반화 능력을 향상시키는가?
  • RQ3다운스트림 음성 분류 과제에서 테스트할 때 제안된 방법이 완전 지도학습보다 성능이 뛰어나게 되는가?
  • RQ4노이즈 조건에서의 성능은 어떻게 되며, 저SNR 환경에서 기반선보다 더 잘 일반화되는가?

주요 결과

  • SPC 전체 데이터셋에서 제안된 방법은 95.21%의 정확도를 기록하여 자율학습 기반선 중 두 번째로 높은 성능이며, 완전 지도학습을 초월한다.
  • LRW 전체 데이터셋에서 방법은 95.37%의 정확도를 기록하여 비교된 모든 방법 중 최고 성능이다.
  • 학습 데이터의 10%만을 사용할 경우, SPC에서 90.63%의 정확도, LRW에서 77.13%의 정확도를 기록하여 다른 자율학습 및 완전 지도학습 기반선보다 뚜렷이 뛰어나다.
  • 노이즈 조건(SNR -5 dB에서 20 dB)에서 통합 청각시각 방법은 SPC 및 LRW 데이터셋 양쪽에서 MFCCs 및 모든 다른 자율학습 기반선보다 일관되게 뛰어난 성능을 보였다.
  • 통합 청각시각 자율학습으로 훈련된 모델은 음성 중심 또는 시각 중심 기반선보다 더 잘 일반화되며, 다중모달 감시의 상호보완적 가치를 입증한다.
  • 완전 지도학습에서부터의 학습보다도 제안된 방법이 뚜렷이 뛰어나며, 교차모달 신호를 활용한 자율학습 프리트레인팅이 음성 과제에 강력한 초기화 방법임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.