[论文解读] Multi-Format Contrastive Learning of Audio Representations
论文表明跨音频格式(原始波形和对数梅尔频谱)的一致学习可获得强表征,在 AudioSet 和 ESC-50 上达到新的 state-of-the-art,且不需要多模态数据。
Recent advances suggest the advantage of multi-modal training in comparison with single-modal methods. In contrast to this view, in our work we find that similar gain can be obtained from training with different formats of a single modality. In particular, we investigate the use of the contrastive learning framework to learn audio representations by maximizing the agreement between the raw audio and its spectral representation. We find a significant gain using this multi-format strategy against the single-format counterparts. Moreover, on the downstream AudioSet and ESC-50 classification task, our audio-only approach achieves new state-of-the-art results with a mean average precision of 0.376 and an accuracy of 90.5%, respectively.
研究动机与目标
- 推动并评估单一音频模态的多种格式是否能提供类似于多模态训练的收益
- 开发一个对比学习框架,使原始音频及其频谱表示之间的对齐最大化
- 确定自监督音频表示学习中有效的音频格式、增强和架构
- 展示在 AudioSet 和 ESC-50 上的下游性能,以确立无监督音频表示学习的最新成果
提出的方法
- 使用 SimCLR 风格的对比目标,在同一音频的两种不同格式(原始波形 vs 频谱表示)的两个增强视图之间最大化一致性
- 为每种格式采用合适的编码器(如基于卷积的或 CNN/ResNet 风格的架构),并使用共享投影头
- 对音频和声谱应用轻量级增强(音频混合、时间遮蔽、频率遮蔽、频率移位)
- 使用大批量训练以提供对比损失的众多负样本,并在 InfoNCE 损失中使用温度参数
- 通过冻结预训练编码器并在下游任务上训练浅层分类器来评估(AudioSet mAP、ESC-50 精度)
- 尝试单格式和双格式设置,以分析跨格式一致性的收益
实验结果
研究问题
- RQ1通过最大化原始音频与频谱表示之间的一致性来学习表征,是否能超越单格式或单模态基线?
- RQ2哪些音频格式和增强的组合能带来最佳下游性能?
- RQ3模型架构、批量大小、温度和投影尺寸如何影响音频的对比学习?
- RQ4在不使用标签的情况下采用双格式自监督学习时,在 AudioSet 和 ESC-50 的下游收益如何?
主要发现
- 双格式(原始波形和对数梅尔频谱)训练相对于单格式基线带来显著提升
- 原始音频与对数梅尔频谱配对将基础模型的 mAP 相对于仅原始音频提升约 15%,相对于仅对数梅尔提升约 41%(在 AudioSet 上)
- 最佳单模型结果分别达到 mAP 0.336(波形)和 0.329(对数梅尔),双格式训练在评估时达到 0.368(对数梅尔)和 0.355(波形);将两种格式的特征拼接可达到 0.376
- ESC-50 下游精度在双格式训练下达到 90.5%,刷新新的 state-of-the-art
- 更长的时间裁剪(10s)因 AudioSet 的多实例性质表现较差;3–5s 裁剪更优
- 增加批量大小和投影潜在维度通常能提升性能;对双格式设置而言,较大模型收益更明显
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。