[논문 리뷰] Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
이 논문은 LAION-Audio-630K라는 633,526개의 오디오-텍스트 샘플로 구성된 633,526개의 오디오-텍스트 데이터셋을 기반으로 훈련된 대규모 대비 언어-오디오 사전학습 모델인 CLAP을 소개한다. 특징 융합과 키워드-캡션 증강 기법을 통합함으로써, 모델은 오디오캡스에서 R@1 = 36.7%의 성능을 기록하며 텍스트-오디오 검색 분야에서 최신 기술 수준(SOTA)을 달성하였고, 제로샷 오디오 분류에서도 뛰어난 일반화 능력과 강건성을 입증하였다. 다양한 오디오 입력에 걸쳐 뛰어난 성능을 보였다.
Contrastive learning has shown remarkable success in the field of multimodal representation learning. In this paper, we propose a pipeline of contrastive language-audio pretraining to develop an audio representation by combining audio data with natural language descriptions. To accomplish this target, we first release LAION-Audio-630K, a large collection of 633,526 audio-text pairs from different data sources. Second, we construct a contrastive language-audio pretraining model by considering different audio encoders and text encoders. We incorporate the feature fusion mechanism and keyword-to-caption augmentation into the model design to further enable the model to process audio inputs of variable lengths and enhance the performance. Third, we perform comprehensive experiments to evaluate our model across three tasks: text-to-audio retrieval, zero-shot audio classification, and supervised audio classification. The results demonstrate that our model achieves superior performance in text-to-audio retrieval task. In audio classification tasks, the model achieves state-of-the-art performance in the zero-shot setting and is able to obtain performance comparable to models' results in the non-zero-shot setting. LAION-Audio-630K and the proposed model are both available to the public.
연구 동기 및 목표
- 사전학습을 위한 대규모, 다양한 종류의 자연스러운 설명이 담긴 오디오-텍스트 데이터셋의 부족 문제를 해결하기 위해.
- 다양한 길이의 오디오 입력을 처리할 수 있도록 다중모odal 표현 학습을 향상시키기 위해.
- 특징 융합 및 데이터 증강 기법을 통해 모델의 일반화 능력과 성능을 향상시키기 위해.
- 다양한 후행 작업, 특히 제로샷 및 지도 학습 오디오 분류를 포함한 여러 후행 작업에서 학습된 오디오 표현의 성능 평가를 위해.
- LAION-Audio-630K 데이터셋과 CLAP 모델을 공개하여 더 넓은 연구 목적의 활용을 가능하게 하기 위해.
제안 방법
- 저자들은 8개의 공공 소스에서 유래한 총 4,325.39시간의 오디오를 포함한 633,526개의 오디오-텍스트 쌍으로 구성된 대규모 데이터셋인 LAION-Audio-630K를 공개한다.
- 키워드-캡션 모델을 활용해 AudioSet에 대해 자동으로 기술적 설명 캡션을 생성함으로써, 자연어 기반 설명을 포함한 훈련 데이터를 크게 확장한다.
- CLAP 모델은 오디오와 텍스트를 동일한 임bedding 공간에 매핑하는 대비 학습 프레임워크를 사용하며, 일치하는 쌍 간의 정렬을 최적화한다.
- 특징 융합을 오디오 및 텍스트 인코더 간에 적용하여 표현 품질을 향상시키고, 다양한 길이의 오디오 입력을 효과적으로 처리할 수 있도록 한다.
- HTSAT, PANN 등의 다양한 오디오 인코더와 RoBERTa, BERT 등의 텍스트 인코더를 평가하고 조합하여 성능을 최적화한다.
- 긍정 쌍 간의 유사도를 극대화하고 부정 쌍 간의 유사도를 최소화함으로써, 대비 손실을 사용해 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1대규모, 약한 감독을 받는 오디오-텍스트 데이터는 제로샷 및 지도 학습 오디오 분류 성능을 향상시킬 수 있는가?
- RQ2키워드-캡션 증강 기법은 오디오 표현 학습에서 텍스트 기술의 품질과 다양성을 어떻게 향상시키는가?
- RQ3특징 융합은 다양한 길이의 오디오 입력에 대해 모델의 강건성과 성능을 어느 정도 향상시키는가?
- RQ4다양한 오디오 및 텍스트 인코더 조합이 대비 사전학습에서 최종 모델 성능에 미치는 영향은 어떠한가?
- RQ5대비 언어-오디오 모델은 텍스트-오디오 검색 및 다양한 후행 작업에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- CLAP 모델은 오디오캡스 벤치마크에서 텍스트-오디오 검색 R@1이 36.7%로, 새로운 최신 기술 수준을 달성하였다.
- 제로샷 오디오 분류 작업에서 CLAP는 ESC-50에서 89.1%의 상위 1위 정확도, US8K에서 73.2%, VGGSound에서 29.1%를 기록하여 이전 방법들을 능가하였다.
- 키워드-캡션 증강 기법은 단순 템플릿 프롬프팅에 비해 성능을 향상시키며, 특히 VGGSound와 US8K에서 정확도를 최대 4.8%포인트 향상시켰다.
- 특징 융합은 다양한 길이의 오디오 입력을 효과적으로 처리할 수 있도록 하여, Clotho 데이터셋에서 긴 오디오(10초 이상)에 특히 유리한 영향을 주었다.
- 감독 학습 FSD50K mAP는 64.9%를 기록하여 이전 최신 기술 수준을 초월하였고, VGGSound에서는 75.4%를 달성하여 강력한 전이 능력을 입증하였다.
- AudioCaps와 Clotho 간 성능 상충이 존재하나, 대규모이고 다양한 데이터로 훈련된 모델은 다양한 오디오 분포에 걸쳐 강력한 일반화 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.