[论文解读] CLAP: Learning Audio Concepts From Natural Language Supervision
CLAP 引入了一种对比学习框架,通过在共享嵌入空间中对齐音频和自然语言描述,训练音频和文本编码器,从而在仅使用 128k 个音视频对的情况下,在 16 项下游音频任务中实现了最先进(SOTA)的零样本性能,展示了强大的泛化能力和灵活性,且无需针对特定任务进行微调。
Mainstream Audio Analytics models are trained to learn under the paradigm of one class label to many recordings focusing on one task. Learning under such restricted supervision limits the flexibility of models because they require labeled audio for training and can only predict the predefined categories. Instead, we propose to learn audio concepts from natural language supervision. We call our approach Contrastive Language-Audio Pretraining (CLAP), which learns to connect language and audio by using two encoders and a contrastive learning to bring audio and text descriptions into a joint multimodal space. We trained CLAP with 128k audio and text pairs and evaluated it on 16 downstream tasks across 8 domains, such as Sound Event Classification, Music tasks, and Speech-related tasks. Although CLAP was trained with significantly less pairs than similar computer vision models, it establishes SoTA for Zero-Shot performance. Additionally, we evaluated CLAP in a supervised learning setup and achieve SoTA in 5 tasks. Hence, CLAP's Zero-Shot capability removes the need of training with class labels, enables flexible class prediction at inference time, and generalizes to multiple downstream tasks.
研究动机与目标
- 开发一种通用音频表示模型,从自然语言监督中学习,而非预定义的类别标签。
- 通过在共享多模态空间中对齐音频和文本嵌入,实现灵活的零样本音频分类。
- 在无需针对特定任务进行微调的情况下,实现在声音事件分类、音乐和语音任务等多样化音频领域中的强大泛化能力。
- 探索模型冻结和提示工程对音频理解中零样本性能的影响。
- 建立一个音频基础模型,与视觉模型相比,在有限数据下仍能有效泛化。
提出的方法
- CLAP 使用两个独立的编码器:音频编码器和文本编码器,分别独立处理输入的音视频对。
- 音频和文本表示通过可学习的线性层 $L_a$ 和 $L_t$ 投影到维度为 d 的共享嵌入空间中。
- 使用温度缩放的相似度矩阵 $C = \tau \cdot (E_t \cdot E_a^\top)$ 应用对比学习,其中正样本对位于对角线上。
- 损失函数 $\mathcal{L} = 0.5(\ell_{\text{text}}(C) + \ell_{\text{audio}}(C))$ 优化音频-文本对的匹配,同时将负样本对推开。
- 在推理阶段,通过计算音频嵌入与类别标签文本嵌入之间的余弦相似度,执行零样本分类。
- 在推理过程中应用提示工程,使用类似 'This is a sound of [class label]' 的模板,以提升零样本迁移性能。

实验结果
研究问题
- RQ1在仅使用 128k 个音视频对进行训练的对比学习框架,能否在音频理解中实现最先进(SOTA)的零样本性能?
- RQ2与类别标签监督相比,自然语言监督在实现音频模型中灵活的未见类别预测方面表现如何?
- RQ3冻结音频和文本编码器对下游零样本性能有何影响?
- RQ4不同提示模板对音频基准测试中的零样本分类准确率有何影响?
- RQ5CLAP 在声音事件、音乐和语音等多样化音频领域中的泛化程度如何?
主要发现
- CLAP 在 8 个领域共 16 项下游任务中实现了最先进(SOTA)的零样本性能,包括在 ESC50 数据集上使用最优提示模板达到 82.6% 的准确率。
- 在 FSD50K 数据集上,CLAP 在零样本评估中实现了 53.8% 的 mAP,比 Wav2CLIP 高出 27 个百分点。
- 在微调的监督学习中,CLAP 在 5 项任务中取得了最先进(SOTA)的结果,包括在 GTZAN 的音乐与语音分类任务中达到 100% 的准确率。
- 在微调时冻结文本编码器而微调音频编码器,相比冻结音频编码器,能获得更好的零样本性能,表明文本编码器在跨模态对齐中更为关键。
- 提示工程显著提升了零样本性能,其中 'This is a sound of [class label]' 模板在 ESC50 上实现了最高准确率 82.6%。
- 在无微调的情况下,CLAP 在乐器分类任务中比随机基线高出 22%,在人声分类任务中高出 33%,表明其具备显著的泛化能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。