Skip to main content
QUICK REVIEW

[논문 리뷰] WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research

Xinhao Mei, Chutong Meng|arXiv (Cornell University)|2023. 03. 30.
Music and Audio Processing참고 문헌 77인용 수 6
한 줄 요약

이 논문은 ChatGPT를 활용해 노이즈가 많은 웹에서 수집한 기술을 걸러내고 개선하는 3단계 파이프라인을 통해 생성된 고품질의 캡션을 포함한 약 400만 개의 오디오 클립으로 구성된 대규모 약한 레이블이 부여된 오디오 캡션 데이터셋인 WavCaps를 소개한다. 이 데이터셋은 오디오-언어 다중모달 작업에서 최신 기술 수준의 성능을 달성하며, LLM을 활용한 데이터 정제 기법이 오디오 이해 연구를 발전시키는 데 효과적임을 보여준다.

ABSTRACT

The advancement of audio-language (AL) multimodal learning tasks has been significant in recent years. However, researchers face challenges due to the costly and time-consuming collection process of existing audio-language datasets, which are limited in size. To address this data scarcity issue, we introduce WavCaps, the first large-scale weakly-labelled audio captioning dataset, comprising approximately 400k audio clips with paired captions. We sourced audio clips and their raw descriptions from web sources and a sound event detection dataset. However, the online-harvested raw descriptions are highly noisy and unsuitable for direct use in tasks such as automated audio captioning. To overcome this issue, we propose a three-stage processing pipeline for filtering noisy data and generating high-quality captions, where ChatGPT, a large language model, is leveraged to filter and transform raw descriptions automatically. We conduct a comprehensive analysis of the characteristics of WavCaps dataset and evaluate it on multiple downstream audio-language multimodal learning tasks. The systems trained on WavCaps outperform previous state-of-the-art (SOTA) models by a significant margin. Our aspiration is for the WavCaps dataset we have proposed to facilitate research in audio-language multimodal learning and demonstrate the potential of utilizing ChatGPT to enhance academic research. Our dataset and codes are available at https://github.com/XinhaoMei/WavCaps.

연구 동기 및 목표

  • 기존 데이터셋의 높은 비용과 제한된 규모로 인해 발생하는 오디오-언어 다중모달 학습 분야의 심각한 데이터 부족 문제를 해결한다.
  • 웹에서 수집한 노이즈가 많고 비구조적인 원시 기술들이 강력한 오디오-캡션 모델을 훈련시키기에 부적합한 문제를 해결한다.
  • 저품질의 웹 크롤링 기술을 고품질의 문장 형식의 캡션으로 변환하는 자동화되고 확장 가능한 파이프라인을 개발하여 다중모달 사전학습에 적합한 데이터를 제공한다.
  • LLM을 활용한 데이터 정제가 최종 오디오-언어 모델의 성능 향상에 크게 기여함을 입증한다.
  • 연구를 가속화하기 위해 공개 가능한 대규모 약한 레이블이 부여된 데이터셋을 제공한다.

제안 방법

  • 웹 소스와 사운드 이벤트 검출 데이터셋에서 약 40만 개의 오디오 클립과 원시 기술을 수집하며, Conceptual Captions와 유사한 웹 크롤링 기법을 활용한다.
  • 3단계 처리 파이프라인을 구현한다: (1) 텍스트 빈도를 사용한 사전 필터링을 통해 저품질 또는 관련성이 없는 기술을 제거한다; (2) ChatGPT를 활용해 원시 기술을 일관되고 문장 형태의 캡션으로 필터링 및 재작성한다; (3) 언어적 품질과 일관성을 확보하기 위해 후처리를 수행한다.
  • LLM인 ChatGPT의 능력을 활용해 콘텐츠 기반 필터링과 자연어 변환을 수행함으로써 노이즈를 크게 감소시키고 캡션 품질을 향상시킨다.
  • 웹에서 수집한 오디오-캡션 쌍, 사운드 이벤트 검출 데이터셋, 그리고 추가로 두 개의 오디오 소스를 통합하여 다양성과 규모를 향상시킨다.
  • WavCaps를 기반으로 CLAP 및 AudioLDM과 같은 다중모달 모델을 훈련하고 평가하며, Zero-shot 및 Fine-tuning 설정을 모두 활용해 성능을 벤치마킹한다.
  • FAD, Inception Score, R@1, R@5, R@10, KL, FD 등의 지표를 사용해 오디오-텍스트 검색, 캡션 생성, 오디오 생성 작업 등에서 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1LLM 기반 정제 기법을 사용해 노이즈가 많은 웹에서 수집한 기술들로부터 대규모 약한 레이블이 부여된 오디오 캡션 데이터셋을 효과적으로 구축할 수 있는가?
  • RQ2원시로 처리되지 않은 기술 대비 ChatGPT를 활용해 원시 기술을 변환함으로써 오디오-언어 쌍의 품질이 얼마나 향상되는가?
  • RQ3WavCaps에서 훈련된 오디오-언어 모델의 성능은 AudioCaps나 LAION과 같은 더 작은 규모의 정제된 데이터셋에서 훈련된 최신 기술 수준의 모델과 비교해 어떻게 되는가?
  • RQ4웹 크롤링된 데이터와 강한 레이블이 부여된 데이터를 포함한 다양한 출처의 약한 레이블 데이터를 통합하면, 최종 작업에서 더 나은 일반화 및 강건성 성능을 달성할 수 있는가?
  • RQ5LLM 기반 데이터 정제 기법을 통해 고비용의 인간 레이블링 데이터의 필요성을 크게 줄일 수 있으며, 이로 인해 모델 성능이 유지되거나 향상되는가?

주요 결과

  • WavCaps에서 훈련된 모델은 오디오 캡션, 텍스트-오디오 검색, 오디오 생성을 포함한 모든 평가된 오디오-언어 다중모달 작업에서 이전 최신 기술 수준의 모델을 초월한다.
  • WavCaps는 AudioCaps에서 28.6의 Zero-shot 텍스트-오디오 검색 R@1, Clotho에서 20.0의 R@1을 기록하며 기존 베이스라인을 크게 능가한다.
  • AudioCaps에서 미세조정된 AudioLDM 모델은 WavCaps에서 훈련된 AudioLDM_WavCaps-FT가 AudioLDM_LAION보다 더 높은 FAD와 Inception Score를 기록함으로써 더 우수한 텍스트 캡션 품질을 입증한다.
  • Ablation 연구 결과, ChatGPT 처리된 캡션을 사용할 경우 원시 기술 대비 성능 향상이 뚜렷하게 나타나며, AudioCaps에서 R@1이 15.8에서 18.1로 상승한다.
  • AudioSet과 웹 소스 데이터를 포함한 전체 WavCaps 데이터셋에서 훈련된 모델은 개별 데이터 소스에서 훈련된 모델보다 AudioCaps와 Clotho 양쪽에서 더 뛰어난 성능을 기록함으로써 데이터 다양성과 규모의 이점이 있음을 입증한다.
  • 다양한 지표를 통한 검증을 통해 고품질의 캡션을 제공하는 데이터셋은 LLM 기반 데이터 정제가 오디오 캡션 분야에서 고비용의 인간 레이블링을 효과적으로 대체할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.