[论文解读] Deep Clustering For General-Purpose Audio Representations
DECAR 是一种自监督预训练方法,通过利用离线聚类生成伪标签,以预测任务来学习通用音频表征。它在 9 项下游音频分类任务中表现出强大的迁移性能,涵盖语音、音乐、动物叫声和环境声,使用的是在 AudioSet 平衡子集上预训练的轻量化、高效框架。
We introduce DECAR, a self-supervised pre-training approach for learning general-purpose audio representations. Our system is based on clustering: it utilizes an offline clustering step to provide target labels that act as pseudo-labels for solving a prediction task. We develop on top of recent advances in self-supervised learning for computer vision and design a lightweight, easy-to-use self-supervised pre-training scheme. We pre-train DECAR embeddings on a balanced subset of the large-scale Audioset dataset and transfer those representations to 9 downstream classification tasks, including speech, music, animal sounds, and acoustic scenes. Furthermore, we conduct ablation studies identifying key design choices and also make all our code and pre-trained models publicly available.
研究动机与目标
- 开发一种自监督预训练方法,无需人工标注标签即可学习通用音频表征。
- 利用聚类作为伪标签来源,以轻量化且可扩展的方式监督表征学习。
- 将学习到的表征有效迁移至多样化的下游音频分类任务,包括语音、音乐、动物叫声和声学场景。
- 通过消融研究识别关键的架构与训练设计选择,以指导未来自监督音频表征学习。
- 发布代码和预训练模型,以支持可复现性及自监督音频表征学习的进一步研究。
提出的方法
- 对大规模音频数据集(AudioSet 的平衡子集)应用离线聚类,为训练数据生成伪标签。
- 将聚类分配结果用作对比预测任务中的目标标签,训练神经网络以预测聚类归属。
- 设计一种轻量化、端到端的神经网络架构,专为音频数据的自监督预训练而优化。
- 使用基于聚类生成的伪标签,在 AudioSet 子集上通过对比学习目标预训练模型。
- 在 9 项下游音频分类基准上,使用标准线性探针或微调协议对学习到的表征进行微调。
- 开展消融研究,评估聚类策略、数据平衡性以及模型架构对下游性能的影响。
实验结果
研究问题
- RQ1与标准对比学习或掩码自编码方法相比,基于聚类的伪标签是否能提升自监督音频表征的质量?
- RQ2聚类算法的选择和聚类粒度如何影响下游迁移性能?
- RQ3在 AudioSet 的平衡子集上进行预训练,其表征在语音、音乐和环境声音等多样化音频领域中的泛化能力如何?
- RQ4影响基于聚类的自监督学习在音频中有效性的关键架构与训练设计因素有哪些?
- RQ5在准确率、效率和实现便捷性方面,DECAR 与现有自监督音频模型相比表现如何?
主要发现
- DECAR 在 9 项多样化下游音频分类任务中表现出强大的迁移性能,证明了基于聚类的伪标签在自监督预训练中的有效性。
- 在预训练阶段使用 AudioSet 的平衡子集,可获得比非平衡数据更稳健、更具泛化能力的表征。
- 消融研究显示,聚类策略和数据平衡性对下游性能有显著影响,凸显了数据筛选的重要性。
- DECAR 的轻量化设计使其具备高效的预训练和微调能力,适用于广泛的应用场景。
- 公开发布代码和预训练模型,有助于实现可复现性,并推动自监督音频表征学习的未来研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。