[논문 리뷰] CLAP: Learning Audio Concepts From Natural Language Supervision
CLAP는 음성과 자연어 설명을 동일한 임bedding 공간에서 정렬하도록 음성 및 텍스트 인코더를 훈련하는 대비 학습 프레임워크를 도입하여, 단지 128만 개의 음성-텍스트 쌍으로도 16개의 하류 음성 작업에서 최신 기술 수준의 제로샷 성능을 달성한다. 이는 태스크별 미세조정 없이도 강력한 일반화 능력과 유연성을 보여준다.
Mainstream Audio Analytics models are trained to learn under the paradigm of one class label to many recordings focusing on one task. Learning under such restricted supervision limits the flexibility of models because they require labeled audio for training and can only predict the predefined categories. Instead, we propose to learn audio concepts from natural language supervision. We call our approach Contrastive Language-Audio Pretraining (CLAP), which learns to connect language and audio by using two encoders and a contrastive learning to bring audio and text descriptions into a joint multimodal space. We trained CLAP with 128k audio and text pairs and evaluated it on 16 downstream tasks across 8 domains, such as Sound Event Classification, Music tasks, and Speech-related tasks. Although CLAP was trained with significantly less pairs than similar computer vision models, it establishes SoTA for Zero-Shot performance. Additionally, we evaluated CLAP in a supervised learning setup and achieve SoTA in 5 tasks. Hence, CLAP's Zero-Shot capability removes the need of training with class labels, enables flexible class prediction at inference time, and generalizes to multiple downstream tasks.
연구 동기 및 목표
- 사전 정의된 클래스 레이블이 아닌 자연어 감독을 통해 학습하는 일반 목적의 음성 표현 모델을 개발하는 것.
- 공동 다중모odal 공간에서 음성과 텍스트 임베딩을 정렬하여, 태스크별 미세조정 없이도 민첩하고 제로샷 음성 분류를 가능하게 하는 것.
- 음향 이벤트 분류, 음악, 음성 태스크 등 다양한 음성 도메인에 걸쳐 태스크별 미세조정 없이도 강력한 일반화를 달성하는 것.
- 모델 고정과 프롬프트 엔지니어링이 음성 이해에서 제로샷 성능에 미치는 영향을 탐색하는 것.
- 시각 모델 대비 제한된 데이터로도 효과적으로 일반화되는 음성 기반 기초 모델을 구축하는 것.
제안 방법
- CLAP는 입력 음성과 텍스트 쌍을 각각 독립적으로 처리하는 음성 인코더와 텍스트 인코더를 사용한다.
- 학습 가능한 선형 레이어 $L_a$와 $L_t$를 통해 음성 및 텍스트 표현을 차원 d의 공통 임베딩 공간으로 투영한다.
- 양의 쌍이 대각선에 위치한 온도 조정된 유사도 행렬 $C = \tau \cdot (E_t \cdot E_a^\top)$ 를 사용하여 대비 학습을 적용한다.
- 손실 함수 $\mathcal{L} = 0.5(\ell_{\text{text}}(C) + \ell_{\text{audio}}(C))$ 는 음성-텍스트 쌍을 매칭시키고, 음성 쌍을 분리시키도록 최적화한다.
- 추론 시, 제로샷 분류는 음성 임베딩과 클래스 레이블의 텍스트 임베딩 간의 코사인 유사도를 계산하여 수행된다.
- 추론 중 프롬프트 엔지니어링을 적용하여 '이것은 [클래스 레이블]의 소리입니다'와 같은 템플릿을 사용해 제로샷 전이 성능을 향상시킨다.

실험 결과
연구 질문
- RQ1128만 개의 음성-텍스트 쌍으로 훈련된 대비 학습 프레임워크가 음성 이해에서 최신 기술 수준의 제로샷 성능를 달성할 수 있는가?
- RQ2자연어 감독이 클래스 레이블 감독보다 태스크별 미세조정 없이도 새로운 클래스 예측을 가능하게 하는 데서 어떻게 더 우수한 성능를 보이는가?
- RQ3음성 및 텍스트 인코더를 고정하는 것이 하류 제로샷 성능에 어떤 영향을 미치는가?
- RQ4다양한 프롬프트 템플릿은 음성 벤치마크에서 제로샷 분류 정확도에 어떤 영향을 미치는가?
- RQ5CLAP는 음향 이벤트, 음악, 음성 등 다양한 음성 도메인에 얼마나 효과적으로 일반화되는가?
주요 결과
- CLAP는 8개 도메인에 걸친 16개의 하류 작업에서 최신 기술 수준의 제로샷 성능를 달성했으며, 최적의 프롬프트 템플릿을 사용해 ESC50에서 82.6%의 정확도를 기록했다.
- FSD50K 데이터셋에서 CLAP는 제로샷 평가에서 53.8%의 mAP를 기록했으며, Wav2CLIP를 27个百分点 이상 앞섰다.
- 감독된 미세조정에서 CLAP는 5개 태스크에서 최신 기술 수준의 결과를 달성했으며, GTZAN의 음악 대비 음성 분류 태스크에서 100%의 정확도를 기록했다.
- 음성 인코더를 고정하고 텍스트 인코더만 미세조정했을 때, 반대로 고정했을 때보다 더 높은 제로샷 성능를 기록했으며, 이는 텍스트 인코더가 다중모달 정렬에 더 중요하다는 것을 시사한다.
- 프롬프트 엔지니어링은 제로샷 성능를 크게 향상시켰으며, '이것은 [클래스 레이블]의 소리입니다'라는 템플릿이 ESC50에서 가장 높은 정확도 82.6%를 기록했다.
- CLAP는 무작위 베이스라인 대비 악기 분류에서 22% 향상되었고, 보컬 사운드 분류에서 33% 향상되어, 미세조정 없이도 의미 있는 일반화 능력을 보여주었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.