Skip to main content
QUICK REVIEW

[논문 리뷰] ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification

Sara Atito, Muhammad Awais|arXiv (Cornell University)|2022. 11. 23.
Music and Audio Processing참고 문헌 56인용 수 8
한 줄 요약

ASiT는 그룹 마스킹 모델 학습과 전역 및 국소 대비 손실을 활용한 교사-학생 distillation을 결합한 자기지도 학습 비전 트랜스포머를 제안하여 음성 스펙트로그램 이해를 향상시킨다. 이는 외부 데이터셋 또는 ImageNet 미사전학습을 사용하는 방법보다 5개의 음성 및 음성 분류 작업에서 최신 기술 성능을 달성한다.

ABSTRACT

Transformers, which were originally developed for natural language processing, have recently generated significant interest in the computer vision and audio communities due to their flexibility in learning long-range relationships. Constrained by the data hungry nature of transformers and the limited amount of labelled data, most transformer-based models for audio tasks are finetuned from ImageNet pretrained models, despite the huge gap between the domain of natural images and audio. This has motivated the research in self-supervised pretraining of audio transformers, which reduces the dependency on large amounts of labeled data and focuses on extracting concise representations of audio spectrograms. In this paper, we propose extbf{L}ocal- extbf{G}lobal extbf{A}udio extbf{S}pectrogram v extbf{I}sion extbf{T}ransformer, namely ASiT, a novel self-supervised learning framework that captures local and global contextual information by employing group masked model learning and self-distillation. We evaluate our pretrained models on both audio and speech classification tasks, including audio event classification, keyword spotting, and speaker identification. We further conduct comprehensive ablation studies, including evaluations of different pretraining strategies. The proposed ASiT framework significantly boosts the performance on all tasks and sets a new state-of-the-art performance in five audio and speech classification tasks, outperforming recent methods, including the approaches that use additional datasets for pretraining.

연구 동기 및 목표

  • 스펙트로그램의 국소적 및 전역적 맥락을 효과적으로 포착할 수 있는 자기지도 학습 음성 표현 학습 프레임워크를 개발하기 위해.
  • 시각 분야에서 성공한 그룹 마스킹 모델 학습이 도메인 차이가 있는 음성 스펙트로그램에 효과적으로 적용될 수 있는지 조사하기 위해.
  • 표준 마스킹 오토에인코드 미사전학습보다 특징의 분류 성능을 향상시키기 위해 대비 학습을 통합함으로써 개선하기 위해.
  • 미사전학습 전략, 모델 크기, 초기화 방식이 다운스트림 음성 분류 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • ASiT는 음성 스펙트로그램을 2차원 공간 입력으로 처리하기 위해 비전 트랜스포머 백본을 사용한다.
  • 연결된 스펙트로그램 토큰 조각을 무작위로 마스킹하고 맥락에서 복원함으로써 그룹 마스킹 모델 학습(GMML)을 사용한다.
  • 교사-학생 디스틸레이션 프레임워크를 도입하여, 교사 모델이 전역 및 국소 특징에서 대비 손실을 통해 학생 모델을 지도한다.
  • 국소 유사도 학습은 원본 및 손상된 스펙트로그램의 특징을 정렬하여 세밀한 분류 패턴을 유지한다.
  • 모델는 마스킹 오토에인코드에서 유도된 재구성 손실과 특징 정렬에서 유도된 대비 손실을 함께 최적화한다.
  • 대규모 비라벨 음성 데이터(AS-2M)를 사용하여 무 supervision 하에 일반적인 음성 표현을 학습하기 위해 사전학습을 수행한다.

실험 결과

연구 질문

  • RQ1원래 이미지에 대해 설계된 그룹 마스킹 모델 학습이 음성 스펙트로그램에 효과적으로 적용될 수 있는가? (1D 신호 성격과 이미지와의 구조적 차이가 있음에도 불구하고)
  • RQ2재구성 손실과 대비 학습을 병행할 경우, 재구성만으로 학습하는 것보다 음성 표현 학습 성능이 향상되는가?
  • RQ3전역 대비 학습 외에 국소 유사도 학습이 효과적인 다중 레이블 음성 이벤트 분류에 필수적인가?
  • RQ4ImageNet 초기화와 비교할 때 도메인 내 음성 데이터에서의 사전학습은 다운스트림 성능에서 어떻게 다른가?
  • RQ5음성 스펙트로그램 표현 학습을 위한 최적의 사전학습 기간, 마스킹 비율, 패치 정렬 전략은 무엇인가?

주요 결과

  • ASiT는 음성 이벤트 분류, 키워드 스포팅, 화자 식별을 포함한 5개의 벤치마크 음성 및 음성 분류 작업에서 최신 기술 성능을 달성한다.
  • 더 긴 사전학습(최대 100 에폭)은 체계적인 성능 향상을 이끌어내며, AS-20K 데이터셋에서 mAP가 점진적으로 향상된다.
  • 사전학습에 최적의 마스킹 비율은 60%에서 80% 사이이며, 이는 과적합을 방지하면서 맥락 기반 재구성에 유리하다.
  • 특히 초기 학습 단계에서 패치 경계와 일치하지 않게 마스킹할 경우 사전학습 수렴 속도가 빠르고 일반화 성능이 더 우수하다.
  • 더 큰 모델 크기(ViT-Base 등)는 더 우수한 다운스트림 성능을 보이며, ASiT의 용량 증가에 따른 확장성 확인.
  • 도메인 내 음성 데이터(AS-2M)에서의 사전학습은 ImageNet 사전학습보다 성능이 뛰어나며, ImageNet 초기화는 음성 전용 사전학습보다 성능이 떨어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.