Skip to main content
QUICK REVIEW

[논문 리뷰] A Whisper transformer for audio captioning trained with synthetic captions and transfer learning

Marek Kadlčík, Adam Hájek|arXiv (Cornell University)|2023. 05. 15.
Music and Audio Processing인용 수 6
한 줄 요약

이 논문은 AudioSet에서 유도된 합성 캡션과 사전 훈련된 음성-텍스트 모델로부터의 전이 학습을 활용하여, 음성 캡션을 위한 미세조정된 Whisper 트랜스포머를 제안한다. 합성 AudioSet 캡션, AudioCaps, Clotho를 혼합하여 사전 훈련하고, Clotho에서 계층 구조를 동결하여 미세조정함으로써, 가장 큰 모델(whisper-large-v2)이 Clotho 개발-평가 세트에서 SPIDEr 점수 0.2794를 기록하여 최신 기술 수준을 달성한다.

ABSTRACT

The field of audio captioning has seen significant advancements in recent years, driven by the availability of large-scale audio datasets and advancements in deep learning techniques. In this technical report, we present our approach to audio captioning, focusing on the use of a pretrained speech-to-text Whisper model and pretraining on synthetic captions. We discuss our training procedures and present our experiments' results, which include model size variations, dataset mixtures, and other hyperparameters. Our findings demonstrate the impact of different training strategies on the performance of the audio captioning model. Our code and trained models are publicly available on GitHub and Hugging Face Hub.

연구 동기 및 목표

  • 사전 훈련된 음성-텍스트 모델에서 전이 학습을 활용하여 음성 캡션 성능을 향상시키는 것.
  • AudioSet 레이블에서 파생된 합성 캡션의 효과가 음성 캡션 모델 사전 훈련에 미치는 영향을 조사하는 것.
  • 모델 크기, 데이터 혼합 비율, 정규화 전략이 캡션 성능에 미치는 영향을 평가하는 것.
  • 향후 음성 캡션 향상을 위해 데이터 스케일링과 더 강력한 감독을 탐색하는 것.

제안 방법

  • AudioSet에서 유도된 합성 캡션과 AudioCaps, Clotho의 인간 주석 캡션을 사용하여, 사전 훈련된 Whisper 인코더-디코더 트랜스포머를 음성 캡션에 대해 미세조정한다.
  • AudioSet 계층적 온톨로지의 순회를 통해 레이블을 자연어 기술로 매핑함으로써 합성 캡션을 생성한다. 이때 상위 클래스 접두어를 사용한다.
  • 원래 Whisper 초모수를 사용하여 오디오를 16 kHz로 전처리하고, log-mel 스펙트로그램으로 변환한다. WhisperFeatureExtractor를 사용한다.
  • 이중 접두어 전략을 적용한다: 표준 Whisper 접두어(작업 및 언어 지정용), 그리고 데이터셋과 캡션 작업 유형(캡션 대 조건어)을 지정하는 사용자 정의 접두어.
  • 모든 모델 크기에서 최적의 복원 전략으로서 5개의 비드를 사용한 비드 검색 복원을 적용한다.
  • 미세조정 중에 계층 구조를 동결하여, 더 작은 Clotho 데이터셋에서의 과적합을 방지한다. 특히, 모든 피드포워드 계층(fc1)을 동결한다.

실험 결과

연구 질문

  • RQ1AudioSet에서 유도된 합성 캡션으로 사전 훈련하는 것이 단순한 미세조정 대비 음성 캡션 성능에 어떤 영향을 미치는가?
  • RQ2사전 훈련 중에 합성(AudioSet)과 인간 주석 캡션(AudioCaps, Clotho) 데이터의 최적 혼합 비율은 무엇인가?
  • RQ3모델 크기가 음성 캡션 작업 성능에 미치는 영향은 어떠한가?
  • RQ4정규화 전략 중에서(가중치 감소, 드롭아웃, 계층 구조 동결) Clotho 데이터셋에서 가장 우수한 일반화 성능를 제공하는 것은 무엇인가?
  • RQ5AudioSet Strong과 같은 데이터셋에서 시간적으로 강력한 감독을 활용하여 합성 캡션 생성에 적용할 경우, 캡션 품질 향상에 기여할 수 있는가?

주요 결과

  • 가장 큰 모델인 whisper-large-v2가 Clotho 개발-평가 분할에서 최고 성능을 기록하여 SPIDEr 점수 0.2794를 달성했다.
  • 합성 AudioSet 캡션, AudioCaps, Clotho를 혼합하여 사전 훈련(12:3:1 비율)하면, 단순한 미세조정보다 성능 향상이著명했다.
  • 5개의 비드를 사용한 비드 검색 복원이 그로스나 더 높은 비드 전략보다 우수했으며, 모든 모델 크기에서 가장 높은 SPIDEr 점수를 기록했다.
  • 더 작은 Clotho 데이터셋에서의 과적합 방지를 위해, 미세조정 중 계층 구조를 동결하는 것이 가중치 감소나 드롭아웃보다 더 효과적이었다.
  • 사전 훈련 중에 대규모 합성 데이터셋(AudioSet 서브셋)에 더 높은 비중을 두는 것이 과적합을 완화하고 일반화 성능 향상에 기여했다.
  • Clotho 개발-평가 세트에서 SacreBLEU 점수 16.50과 CIDEr 점수 0.4331를 기록하여, 다양한 지표에서 뛰어난 성능을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.