Skip to main content
QUICK REVIEW

[논문 리뷰] Audio ALBERT: A Lite BERT for Self-supervised Learning of Audio Representation

Po-Han Chi, Pei-Hung Chung|arXiv (Cornell University)|2020. 05. 18.
Speech Recognition and Synthesis참고 문헌 27인용 수 39
한 줄 요약

Audio ALBERT (AALBERT)은 계층 간 가중치를 공유하는 매개변수 효율적인 자기지도 학습 음성 모델로, Mockingjay와 유사한 음소 및 화자 분류 성능을 약 91% 더 적은 파라미터로 달성합니다; 중간 계층은 더 많은 음소 및 화자 정보를 인코딩합니다.

ABSTRACT

For self-supervised speech processing, it is crucial to use pretrained models as speech representation extractors. In recent works, increasing the size of the model has been utilized in acoustic model training in order to achieve better performance. In this paper, we propose Audio ALBERT, a lite version of the self-supervised speech representation model. We use the representations with two downstream tasks, speaker identification, and phoneme classification. We show that Audio ALBERT is capable of achieving competitive performance with those huge models in the downstream tasks while utilizing 91\% fewer parameters. Moreover, we use some simple probing models to measure how much the information of the speaker and phoneme is encoded in latent representations. In probing experiments, we find that the latent representations encode richer information of both phoneme and speaker than that of the last layer.

연구 동기 및 목표

  • 제한된 자원으로 배포를 가능하게 하기 위한 음성 표현의 효율적인 자기지도 학습을 고무한다.
  • 음성 트랜스포머에 ALBERT 스타일의 가중치 공유를 적용하여 매개변수 효율성을 조사한다.
  • Mockingjay와의 비교를 위해 음소 및 화자 분류에서 AALBERT를 평가한다.
  • 층별 표현을 조사하여 음소 및 화자 정보가 어디에서 인코딩되는지 이해한다.

제안 방법

  • 계층 간 파라미터를 공유하여 Transformer 기반 음성 모델(Audio ALBERT)에 ALBERT 스타일의 가중치 공유를 적용한다.
  • 특정 마스킹/노이즈 스킴과 함께 cmvn을 사용하여 로그 선형 스펙트로그램을 복구하기 위한 마스크된 스펙트로그램 재구성으로 사전 학습한다.
  • 특징 추출 및 미세 조정 설정에서 음소 및 화자 분류에서 AALBERT를 Mockingjay (12L/6L/3L)와 비교한다.
  • 다양한 복잡도의 프로빙 분류기를 사용하여 층 전반의 음소 및 화자 정보를 평가한다.
  • 계층별 중복성과 정보 인코딩을 이해하기 위해 어텐션 분포를 분석한다.
(a) Average
(a) Average

실험 결과

연구 질문

  • RQ1가볍고 가중치 공유가 있는 트랜스포머(AALBERT)가 매개변수를 대폭 줄이면서도 더 큰 사전 학습 음성 모델(Mockingjay)의 다운스트림 성능에 필적할 수 있는가?
  • RQ2사전 학습된 음성 모델의 어떤 층이 가장 많은 음소 및 화자 정보를 인코딩하는가?
  • RQ3층 깊이가 AALBERT와 Mockingjay의 음소 및 화자 프로빙 성능에 어떻게 영향을 미치는가?
  • RQ4어텐션 분포가 Audio ALBERT의 파라미터 공유 및 층별 중복성에 대해 무엇을 알려주는가?

주요 결과

  • AALBERT는 Mockingjay와 비교할 만한 음소 분류 정확도를 달성하지만 파라미터를 91% 줄였다.
  • AALBERT는 또한 Mockingjay보다 훨씬 적은 파라미터를 사용하면서 다운스트림 화자 분류 성능도 동일하게 확보한다(예: 12L 구성에서 7.4M 대 84.3M).
  • 프로빙은 두 모델 모두 중간 계층이 마지막 계층보다 더 많은 음소 및 화자 정보를 담고 있음을 보여준다.
  • 두 모델 모두에서 중간 표현이 음소 및 화자 프로빙 작업에서 마지막 계층보다 더 성능이 우수하다.
  • 어텐션 분석은 계층 간 중복성을 드러내며, 표현 품질을 희생하지 않으면서 매개변수를 압축하기 위한 가중치 공유의 타당성을 뒷받침한다.
(b)
(b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.