Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Off-the-Shelf Machine Listening and Natural Language Models for Automated Audio Captioning

Benno Weck, Xavier Favory|arXiv (Cornell University)|2021. 10. 14.
Music and Audio Processing참고 문헌 32인용 수 4
한 줄 요약

이 논문은 트랜스포머 기반 아키텍처를 사용하여 오프더쇼프 사전 훈련된 음성 인식 및 자연어 처리 모델을 자동 음성 캡션에 적용하기 위한 평가를 수행한다. 연구 결과, YAMNet을 음성 인코딩에, BERT를 단어 임베딩에 사용하고, 음성 특징에 다중 헤드 어텐션 어댑터를 적용할 경우 가장 높은 성능을 기록하며, 기준 설정보다 SPIDEr 점수를 크게 향상시킨다.

ABSTRACT

Automated audio captioning (AAC) is the task of automatically generating textual descriptions for general audio signals. A captioning system has to identify various information from the input signal and express it with natural language. Existing works mainly focus on investigating new methods and try to improve their performance measured on existing datasets. Having attracted attention only recently, very few works on AAC study the performance of existing pre-trained audio and natural language processing resources. In this paper, we evaluate the performance of off-the-shelf models with a Transformer-based captioning approach. We utilize the freely available Clotho dataset to compare four different pre-trained machine listening models, four word embedding models, and their combinations in many different settings. Our evaluation suggests that YAMNet combined with BERT embeddings produces the best captions. Moreover, in general, fine-tuning pre-trained word embeddings can lead to better performance. Finally, we show that sequences of audio embeddings can be processed using a Transformer encoder to produce higher-quality captions.

연구 동기 및 목표

  • 오프더쇼프 사전 훈련된 음성 및 자연어 처리 모델의 자동 음성 캡션(AAC) 성능 효과성을 조사하기 위해.
  • 통합된 트랜스포머 기반 프레임워크를 사용하여 AAC에 최적의 사전 훈련된 모델 조합을 도출하기 위해.
  • 세부 설계 선택 사항, 예를 들어 단어 임베딩의 미세조정, 음성 임베딩에 대한 어댑터 사용, 겹치는 프레임 추출 방식 등을 평가하기 위해.
  • Clotho 데이터셋에서 가장 높은 캡션 품질을 제공하는 사전 훈련된 모델과 설정을 특정하기 위해.

제안 방법

  • 고정된 사전 훈련된 음성 인코더(E), 선택적 어댑터(A), 트랜스포머 디코더(D)를 포함한 트랜스포머 기반 인코더-디코더 프레임워크를 사용한다.
  • 네 가지 사전 훈련된 기계 청취 모델(YAMNet, VGGish, OpenL3, COALA)에서 음성 임베딩을 추출한다.
  • 디코더의 입력으로 사용되는 사전 훈련된 NLP 모델(예: BERT, word2vec, GloVe, fastText)에서 단어 임베딩을 유도한다.
  • 어댑터(A)는 다층 퍼셉트론(MLP), 다중 헤드 어텐션(MHA), 또는 어댑터 없음으로 구현되며, 디코딩 이전에 음성 임베딩을 처리한다.
  • 시간적 맥락 영향을 평가하기 위해 50% 겹침이 있는지 여부에 따라 음성 임베딩을 추출한다.
  • 모델은 교차 엔트로피 손실을 사용해 엔드 투 엔드로 훈련되며, 추론 시에는 그리디 디코딩을 사용한다.

실험 결과

연구 질문

  • RQ1자동 음성 캡션에서 가장 높은 성능을 보이는 사전 훈련된 음성 인코더는 무엇인가?
  • RQ2사전 훈련된 단어 임베딩의 미세조정은 캡션 품질에 어떤 영향을 미치는가?
  • RQ3음성 임베딩에 어댑터(MLP 또는 MHA)를 사용할 경우 캡션 생성 성능 향상이 이루어지는가?
  • RQ4겹치는 프레임 추출 방식은 음성 임베딩 품질에 어떤 영향을 미치는가?
  • RQ5음성 및 단어 임베딩 모델의 어떤 조합이 가장 높은 SPIDEr 점수를 기록하는가?

주요 결과

  • YAMNet과 BERT 단어 임베딩, MHA 기반 어댑터를 조합한 경우 SPIDEr 점수가 0.1793으로 가장 높았다.
  • 사전 훈련된 단어 임베딩의 미세조정은 Wilcoxon 부호 순위 검정에서 p < 0.001로 유의미하게 성능 향상을 이끌었다.
  • 음성 임베딩에 다중 헤드 어텐션 어댑터를 사용할 경우, 어댑터 없음 및 MLP 어댑터보다 일관되게 뛰어난 성능을 기록했다.
  • 50% 겹침을 포함해 음성 임베딩을 계산할 경우 COALA(p < 8.08e−07) 및 YAMNet(p < 3.92e−06)에서 성능 향상이 있었다.
  • 미세조정 없이도 고정된 외부 단어 임베딩 모델인 BERT가 다른 사전 훈련된 임베딩보다 뛰어난 성능을 기록했다.
  • 자기지도 학습 모델인 OpenL3의 경우 MHA 기반 어댑터가 가장 효과적이었으며, 이는 그들의 의미 기반 풍부한 표현을 더 잘 활용했음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.