Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Self-Supervised Learning of General Audio Representations

Luyu Wang, Pauline Luc|arXiv (Cornell University)|2021. 04. 26.
Music and Audio Processing참고 문헌 40인용 수 20
한 줄 요약

이 논문은 레이블 없이 일반적인 음성 표현을 학습하기 위해 영상, 스펙트로그램, 원시 파형을 활용하는 다중모달 자기지도 학습 프레임워크를 제안한다. 저해상도 영상과 샘플 혼합 증강 기법을 사용함으로써, AudioSet에서 42.4 mAP의 최고 성능을 달성하여 지도 학습 모델과의 격차를 좁히고 다양한 음성 작업에서 이전의 비지도 학습 방법을 능가한다.

ABSTRACT

We present a multimodal framework to learn general audio representations from videos. Existing contrastive audio representation learning methods mainly focus on using the audio modality alone during training. In this work, we show that additional information contained in video can be utilized to greatly improve the learned features. First, we demonstrate that our contrastive framework does not require high resolution images to learn good audio features. This allows us to scale up the training batch size, while keeping the computational load incurred by the additional video modality to a reasonable level. Second, we use augmentations that mix together different samples. We show that this is effective to make the proxy task harder, which leads to substantial performance improvements when increasing the batch size. As a result, our audio model achieves a state-of-the-art of 42.4 mAP on the AudioSet classification downstream task, closing the gap between supervised and self-supervised methods trained on the same dataset. Moreover, we show that our method is advantageous on a broad range of non-semantic audio tasks, including speaker identification, keyword spotting, language identification, and music instrument classification.

연구 동기 및 목표

  • 고해상도 영상이 필요 없이 영상 신호를 활용하여 자기지도 학습 기반 음성 표현 학습을 향상시키기 위해.
  • 음성, 스펙트로그램, 영상 입력 간 샘플 혼합이 대비 학습에서 특징 품질을 향상시키는지 조사하기 위해.
  • AudioSet 이외의 다양한 후행 작업으로의 학습된 음성 특징의 일반화 능력을 평가하기 위해.
  • 기본 벤치마크에서 자기지도 학습 모델과 지도 학습 모델 간 성능 격차를 줄이기 위해.

제안 방법

  • 동기화된 영상 클립에서 학습하는 세 개의 인코더(영상(V), 스펙트로그램(S), 원시 파형(W))를 사용하는 대비 학습 프레임워크를 적용한다.
  • 모odal 별 증강 기법을 적용: 영상에 대해 공간적 자르기와 색상 왜곡, 스펙트로그램에 대해 주파수 이동, 파형에는 형식에 특화된 증강 없음.
  • 모든 모달리티 간 샘플 혼합(mixup)을 도입하여, 혼합 입력을 두 배치 샘플의 가중 평균으로 구성함으로써 사전 과제의 난이도를 높인다.
  • 쌍별 대비 손실을 사용하여 동일 샘플의 증강된 뷰(양성 쌍)는 임베딩 공간에서 가까이, 다른 쌍(음성 쌍)은 멀리 떨어지도록 한다.
  • 이전 연구에서 제안한 다중 포맷 설정을 활용하여, 스펙트로그램 및 파형 네트워크가 상호 보조 학습을 통해 강건성과 일반화 능력을 향상시킨다.
  • 저해상도 프레임조차도 영상이 음성 인코더의 지도 신호로 사용되어, 계산 비용을 줄이면서도 성능을 유지하면서 음성 인코더를 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1저해상도 영상이 자기지도 학습 기반 음성 표현 학습을 향상시키기 위해 충분한 지도 신호를 제공할 수 있는가?
  • RQ2음성, 스펙트로그램, 영상 모달리티 입력 간 샘플 혼합이 학습된 음성 특징의 품질을 향상시키는가?
  • RQ3비어 있는 음성 작업, 예를 들어 화자 식별 및 키워드 검색에 대해 비지도 학습 기반 음성 모델이 얼마나 잘 일반화되는가?
  • RQ4AudioSet 및 기타 벤치마크에서 자기지도 학습 기반 음성 모델이 지도 학습 기반 기준 모델에 얼마나 가까이 성능을 끌어올릴 수 있는가?

주요 결과

  • 제안된 방법은 AudioSet 분류 벤치마크에서 42.4 mAP의 새로운 최고 성능을 달성하여 지도 학습 모델(43.1 mAP)의 성능에 가까워졌다.
  • 파형 기반 모델은 40.5 mAP를 기록하여 이전의 지도 학습 최고 성능(36.5 mAP)을 초월했다.
  • 후행 작업에서 모델은 COLA [14] 대비 평균 정확도를 5.5%p 향상시켰으며, 화자 식별(38.2% vs. 29.9% VoxCeleb), 키워드 검색(82.2% Speech Commands v2)에서 뚜렷한 성과를 보였다.
  • 모델은 다양한 작업으로 잘 일반화되며, 언어 식별(79.0% vs. 71.3% 이전 작업), 음악 악기 분류(68.3% vs. 63.4%), 음향 환경 분류(90.4% vs. 94.0% 이전 작업)에서도 뛰어난 성능을 보였다.
  • 저해상도 영상 사용이 성능에 악영향을 주지 않아 더 큰 배치 크기와 계산 비용 절감이 가능하면서도 강력한 특징 품질을 유지한다.
  • 샘플 혼합이 성능 향상에 크게 기여하며, 특히 배치 크기가 증가할수록 대비 사전 과제의 난이도를 높여 더 강건한 특징 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.