Skip to main content
QUICK REVIEW

[논문 리뷰] Audio Captioning Using Sound Event Detection

Ayşegül Özkaya Eren, Mustafa Sert|arXiv (Cornell University)|2021. 10. 04.
Music and Audio Processing참고 문헌 13인용 수 8
한 줄 요약

이 논문은 사운드 이벤트 검출과 사전 훈련된 오디오 특징(PANNs) 및 Word2Vec 임베딩을 통합하여 캡션 품질을 향상시키는 오디오 캡션 모델을 제안한다. PANN 특징과 검출된 사운드 이벤트를 결합한 BiGRU 기반 인코더-디코더 아키텍처를 사용하여, Clotho V2 데이터셋에서 모든 평가 지표에서 베이스라인 대비 뚜렷한 성능 향상을 달성하였으며, CIDEr 및 SPIDEr 점수에서 40% 이상 향상되었다.

ABSTRACT

This technical report proposes an audio captioning system for DCASE 2021 Task 6 audio captioning challenge. Our proposed model is based on an encoder-decoder architecture with bi-directional Gated Recurrent Units (BiGRU) using pretrained audio features and sound event detection. A pretrained neural network (PANN) is used to extract audio features and Word2Vec is selected with the aim of extracting word embeddings from the audio captions. To create semantically meaningful captions, we extract sound events from the audio clips and feed the encoder-decoder architecture with sound events in addition to PANNs features. Our experiments on the Clotho dataset show that our proposed method significantly achieves better results than the challenge baseline model across all evaluation metrics.

연구 동기 및 목표

  • 원시 오디오 특징을 초월하여 의미적으로 풍부한 사운드 이벤트 정보를 통합하여 오디오 캡션 성능을 향상시키는 것.
  • 기존 오디오 캡션 모델이 이벤트, 장면, 객체 간의 맥락적 관계를 포착하지 못하는 한계를 해결하는 것.
  • 사전 훈련된 오디오 임베딩(PANNs)과 사운드 이벤트 검출을 융합하여 더 기술적이고 정확한 캡션을 생성하는 데의 효과성을 탐색하는 것.
  • 다양한 자동 평가 지표에서 DCASE 2021 Task 6의 베이스라인 모델을 능가하는 것.

제안 방법

  • 시스템은 96ms 힘벌윈도우, 50% 겹침을 적용한 스펙트로그램에서 2048차원 오디오 특징을 추출하기 위해 PANNs(Wavegram-Logmel-CNN14) 모델을 사용한다.
  • 사운드 이벤트는 PANNs의 최종 레이어 출력 확률을 임계값(0.1)으로 설정하여 검출하며, 시간 프레임당 527개 클래스의 이벤트 확률을 도출한다.
  • 검출된 이벤트는 의미 유사도 향상과 임베딩 정렬을 위해 단어 수준의 구성요소로 토큰화된다(예: 'Scary Music' → ['Scary', 'Music']).
  • 검출된 이벤트는 원-핫 인코딩을 통해 이진 벡터로 변환되며, 이는 PANN 특징과 연결되어 인코더의 입력으로 사용된다.
  • 인코더는 오디오 특징과 이벤트 벡터를 처리하기 위해 두 개의 BiGRU 레이어(32 및 64 유닛)를 사용하며, 부분 캡션을 인코딩하기 위해 별도의 GRU(128 유닛)를 사용한다.
  • 캡션 단어는 Word2Vec 임베딩(256D)으로 표현되며, 인코딩된 캡션은 오디오 및 이벤트 특징과 연결되어, 소프트맥스 출력을 가지는 128 유닛 GRU를 통해 디코딩된다.

실험 결과

연구 질문

  • RQ1검출된 사운드 이벤트를 통합하면 오디오 캡션의 의미적 품질과 정확도가 향상되는가?
  • RQ2PANNs 특징과 사운드 이벤트 벡터의 융합은 오디오 특징만을 사용할 경우와 비교해 캡션 성능에 어떤 영향을 미치는가?
  • RQ3Word2Vec 임베딩의 사용이 오디오 캡션 맥락에서 캡션 생성에 얼마나 기여하는가?
  • RQ4제안된 모델은 여러 표준 평가 지표에서 DCASE 2021 베이스라인을 능가하는가?

주요 결과

  • 제안된 모델은 CIDEr 점수 0.328을 기록하여 Clotho V2 베이스라인(0.075) 대비 335% 향상되었으며, 기준 캡션과의 의미적 일치도가 뚜렷이 향상됨을 시사한다.
  • 모델은 SPIDEr 점수 0.242를 기록하여 베이스라인(0.051) 대비 375% 향상되었으며, 시나리오 그래프 기반 캡션 평가에서 뛰어난 성능을 보였다.
  • 모델은 BLEU-1 점수를 0.378(베이스라인)에서 0.586으로 향상시켜 생성된 캡션에서 n-gram 정밀도가 향상됨을 보여준다.
  • 모델은 METEOR 점수 0.214를 기록하여 베이스라인(0.078) 대비 174% 향상되었으며, 캡션 매칭에서 더 높은 재현율과 정밀도를 의미한다.
  • 모델은 ROUGE-L 점수 0.444를 기록하여 베이스라인(0.263) 대비 68.8% 향상되었으며, 가장 긴 공통 부분 수열 일치도가 향상됨을 반영한다.
  • 결과는 모든 지표에서 일관되고 뚜렷한 향상이 있음을 확인하며, 사운드 이벤트 검출이 의미적 풍부성과 캡션 품질 향상에 기여함을 증명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.