Skip to main content
QUICK REVIEW

[논문 리뷰] u-HuBERT: Unified Mixed-Modal Speech Pretraining And Zero-Shot Transfer to Unlabeled Modality

Wei-Ning Hsu, Bowen Shi|arXiv (Cornell University)|2022. 07. 14.
Speech and Audio Processing인용 수 16
한 줄 요약

u-HuBERT는 음성 모odal리티(청각, 시각, 청각시각 복합)를 하나의 공유된 마스크 클러스터 예측 목표와 모달리티 드롭아웃을 사용하여 통합된 자기지도 학습 프리트레이닝 프레임워크를 제안한다. 이로 인해 하나의 테스트 조정 모델이 청각, 시각, 청각시각 음성 작업 전반에서 최신 기술 수준의 성능을 달성할 수 있으며, LRS3에서 라벨이 없는 모달리티로의 제로샷 전이 시 1.2%/1.4%/27.2% WER 성능을 기록한다.

ABSTRACT

While audio-visual speech models can yield superior performance and robustness compared to audio-only models, their development and adoption are hindered by the lack of labeled and unlabeled audio-visual data and the cost to deploy one model per modality. In this paper, we present u-HuBERT, a self-supervised pre-training framework that can leverage both multimodal and unimodal speech with a unified masked cluster prediction objective. By utilizing modality dropout during pre-training, we demonstrate that a single fine-tuned model can achieve performance on par or better than the state-of-the-art modality-specific models. Moreover, our model fine-tuned only on audio can perform well with audio-visual and visual speech input, achieving zero-shot modality generalization for multiple speech processing tasks. In particular, our single model yields 1.2%/1.4%/27.2% speech recognition word error rate on LRS3 with audio-visual/audio/visual input. Codes and models are available at https://github.com/facebookresearch/av_hubert

연구 동기 및 목표

  • 다양한 음성 모달리티를 위한 특화된 모델의 데이터 부족성과 구현 비용 문제를 해결하기 위해 다중 음성 모달리티를 위한 통합 프리트레이닝 프레임워크를 개발한다.
  • 프리트레이닝 단계에서 모달리티에 관계없는 표현을 학습함으로써, 라벨이 없는 모달리티로의 제로샷 전이를 가능하게 한다.
  • 단일 모달리티와 복합 모달리티 음성 데이터를 함께 프리트레이닝하여 자원이 적은 모달리티의 성능을 향상시킨다.
  • 한 모달리티에서 테스트 조정된 모델이 재학습 없이도 다른 모달리티로 효과적으로 일반화될 수 있음을 보여준다.
  • 혼합 모달리티 프리트레이닝에서 모달리티 드롭아웃의 효과를 검증함으로써, 다양한 모달리티 간 강건한 표현을 학습하는 데 기여한다.

제안 방법

  • 다양한 음성 모달리티(청각, 시각, 청각시각)의 특징을 공유된 모달리티에 관계없는 특징 공간으로 매핑하는 통합된 마스크 클러스터 예측 목표를 제안한다.
  • 모든 모달리티에서 마스크된 예측을 위한 가짜 레이블을 생성하기 위해 공유 코드북을 사용하여 단일 모달리티 및 복합 모달리티 데이터를 함께 프리트레이닝할 수 있도록 한다.
  • 프리트레이닝 중에 모달리티 드롭아웃을 적용하여 부족한 모달리티를 시뮬레이션하고, 입력 모달리티 조합에 대해 불변인 표현을 학습하도록 유도한다.
  • LRS3의 청각시각 데이터와 VC2-En의 라벨이 없는 청각 전용 데이터를 조합하여 프리트레이닝하며, 단일 모달리티 청각 데이터의 풍부함을 활용한다.
  • 라벨이 있는 데이터를 사용하여 어떤 모달리티 조합에서도 테스트 조정을 수행하고, 라벨이 없는 모달리티에 대해 제로샷 추론을 가능하게 한다.
  • 클러스터 기반 예측을 통한 대비 학습 목표를 도입하여, 다양한 모달리티 간 표현 품질 향상과 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1혼합된 단일 모달리티 및 복합 모달리티 음성 데이터로 프리트레이닝된 단일 자기지도 학습 모델이 특화된 모델과 유사한 성능을 달성할 수 있는가?
  • RQ2모달리티 드롭아웃이 제로샷 전이를 위한 모달리티에 관계없는 표현을 학습하는 데 얼마나 효과적인가?
  • RQ3예를 들어 청각 전용 데이터와 같은 추가적인 라벨이 없는 단일 모달리티 데이터로 프리트레이닝하면, 시각 음성처럼 자원이 적은 모달리티의 성능이 향상되는가?
  • RQ4청각 데이터로만 테스트 조정된 모델이 재학습 없이도 청각시각 및 시각 음성 입력으로 효과적으로 일반화될 수 있는가?
  • RQ5혼합 모달리티 프리트레이닝과 특화된 모델 프리트레이닝 간에 데이터 분포와 학습 기간의 영향은 무엇인가?

주요 결과

  • u-HuBERT는 LRS3에서 청각시각 음성 인식 작업에서 1.2% WER 성능을 기록하여 최신 기술 수준의 특화된 모델들과 비교해도 뒤지지 않는다.
  • 청각 전용 입력에서는 1.4% WER, 시각 전용 입력에서는 27.2% WER 성능을 기록하여 강력한 제로샷 전이 성능을 입증한다.
  • 청각시각 및 청각 전용 데이터(600K 업데이트)를 함께 프리트레이닝한 결과, 모든 세 모달리티에서 단일 청각시각 데이터로만 프리트레이닝한 베이스라인 대비 성능 향상을 보였다.
  • 모달리티 드롭아웃은 모달리티에 관계없는 특징을 학습하는 데 필수적이며, 이를 생략한 모델은 예상치 못한 모달리티 조합으로의 일반화에 실패한다.
  • 더 긴 학습 기간 동안 지속적인 성능 향상이 관찰되었고, 자원 제한으로 인해 데이터 부족 현상이 발생하는 특화된 모델 프리트레이닝 대비 조기에 성능 포화 상태에 도달한다.
  • 통합 프레임워크 덕분에 하나의 테스트 조정된 모델이 모든 모달리티 조합에서 우수한 성능을 보이며, 라벨이 없는 모달리티에 대한 제로샷 추론도 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.