Skip to main content
QUICK REVIEW

[论文解读] Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation

Yusong Wu, Ke Chen|arXiv (Cornell University)|Nov 12, 2022
Music and Audio Processing被引用 5
一句话总结

本文提出 CLAP,一种在 LAION-Audio-630K(包含 633,526 个音频-文本样本的音频-文本数据集)上训练的大规模对比语言-音频预训练模型。通过融合特征与关键词到字幕的数据增强方法,该模型在文本到音频检索(AudioCaps 上 R@1 = 36.7%)和零样本音频分类任务中均达到最先进性能,展现出在多样化音频输入下的强大泛化能力与鲁棒性。

ABSTRACT

Contrastive learning has shown remarkable success in the field of multimodal representation learning. In this paper, we propose a pipeline of contrastive language-audio pretraining to develop an audio representation by combining audio data with natural language descriptions. To accomplish this target, we first release LAION-Audio-630K, a large collection of 633,526 audio-text pairs from different data sources. Second, we construct a contrastive language-audio pretraining model by considering different audio encoders and text encoders. We incorporate the feature fusion mechanism and keyword-to-caption augmentation into the model design to further enable the model to process audio inputs of variable lengths and enhance the performance. Third, we perform comprehensive experiments to evaluate our model across three tasks: text-to-audio retrieval, zero-shot audio classification, and supervised audio classification. The results demonstrate that our model achieves superior performance in text-to-audio retrieval task. In audio classification tasks, the model achieves state-of-the-art performance in the zero-shot setting and is able to obtain performance comparable to models' results in the non-zero-shot setting. LAION-Audio-630K and the proposed model are both available to the public.

研究动机与目标

  • 为解决预训练所需的大规模、多样化且自然描述的音频-文本数据集稀缺问题。
  • 通过使模型能够处理可变长度音频输入,提升音频中多模态表征学习的效果。
  • 通过特征融合与数据增强技术,提升模型的泛化能力与性能表现。
  • 在多个下游任务(包括零样本与监督音频分类)上评估学习到的音频表征。
  • 向公众发布 LAION-Audio-630K 数据集与 CLAP 模型,以促进更广泛的研究应用。

提出的方法

  • 作者发布了 LAION-Audio-630K,一个大规模数据集,包含 633,526 个音频-文本对,总计 4,325.39 小时的音频,数据来源自八个公开渠道。
  • 他们采用关键词到字幕模型,自动为 AudioSet 生成描述性字幕,显著扩展了带有自然语言描述的训练数据。
  • CLAP 模型采用对比学习框架,将音频与文本映射到共享嵌入空间,优化匹配对之间的对齐。
  • 在音频与文本编码器之间应用特征融合,以提升表征质量,并实现对可变长度音频输入的有效处理。
  • 评估并组合多种音频编码器(如 HTSAT、PANN)与文本编码器(如 RoBERTa、BERT),以优化性能。
  • 模型使用对比损失进行训练,最大化正样本对(音频-文本)之间的相似性,同时最小化负样本对之间的相似性。

实验结果

研究问题

  • RQ1大规模、弱监督的音频-文本数据是否能提升零样本与监督音频分类的性能?
  • RQ2关键词到字幕增强方法在音频表征学习中如何提升文本描述的质量与多样性?
  • RQ3特征融合在多大程度上提升了模型对可变长度音频输入的鲁棒性与性能表现?
  • RQ4不同音频与文本编码器的组合如何影响对比预训练中最终模型的性能?
  • RQ5对比语言-音频模型是否能在文本到音频检索任务中实现最先进性能,并在多样化下游任务中展现良好泛化能力?

主要发现

  • CLAP 模型在 AudioCaps 基准上实现了 36.7% 的文本到音频检索 R@1,创下新最先进水平。
  • 在零样本音频分类任务中,CLAP 在 ESC-50 上达到 89.1% 的 top-1 准确率,在 US8K 上达到 73.2%,在 VGGSound 上达到 29.1%,优于先前方法。
  • 关键词到字幕增强方法相比简单模板提示显著提升性能,尤其在 VGGSound 与 US8K 上,准确率最高提升 4.8 个百分点。
  • 特征融合使模型能有效处理可变长度音频输入,尤其在 Clotho 数据集上对长音频(>10 秒)表现更优。
  • 模型在监督 FSD50K 上达到 64.9% 的 mAP,优于此前最先进方法,并在 VGGSound 上达到 75.4%,展现出强大的迁移能力。
  • 尽管在 AudioCaps 与 Clotho 之间存在性能权衡,但模型在大规模、多样化数据上训练后,仍展现出在多样化音频分布中的强大泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。