Skip to main content
QUICK REVIEW

[论文解读] Contrastive Unsupervised Learning for Audio Fingerprinting

Zhesong Yu, Xingjian Du|arXiv (Cornell University)|Oct 26, 2020
Music and Audio Processing参考文献 19被引用 4
一句话总结

本论文提出了一种基于MoCo(动量对比)方法的对比无监督学习框架,用于音频指纹识别,通过对比同一音频的失真版本(正样本对)与不同音频轨道(负样本对),学习鲁棒且具有判别性的音频嵌入。该方法在严重失真(如音高偏移和速度变化)下实现了最先进水平的鲁棒性,在VoxCeleb2-Test上的命中率为84.54%,并在未见失真下实现了100%的泛化能力。

ABSTRACT

The rise of video-sharing platforms has attracted more and more people to shoot videos and upload them to the Internet. These videos mostly contain a carefully-edited background audio track, where serious speech change, pitch shifting and various types of audio effects may involve, and existing audio identification systems may fail to recognize the audio. To solve this problem, in this paper, we introduce the idea of contrastive learning to the task of audio fingerprinting (AFP). Contrastive learning is an unsupervised approach to learn representations that can effectively group similar samples and discriminate dissimilar ones. In our work, we consider an audio track and its differently distorted versions as similar while considering different audio tracks as dissimilar. Based on the momentum contrast (MoCo) framework, we devise a contrastive learning method for AFP, which can generate fingerprints that are both discriminative and robust. A set of experiments showed that our AFP method is effective for audio identification, with robustness to serious audio distortions, including the challenging speed change and pitch shifting.

研究动机与目标

  • 解决视频分享平台中音频轨道因音高偏移、速度变化和音效导致严重失真时的音频识别挑战。
  • 在Shazam和SAMAF等现有方法的基础上,提升音频指纹识别系统在严重失真下的鲁棒性。
  • 利用无监督对比学习,学习具有判别性且鲁棒的音频表征,无需依赖标注数据。
  • 通过在预训练阶段使用多样化失真,使模型能够泛化至训练中未见过的音频失真。
  • 开发一种紧凑、可扩展的指纹识别系统,适用于工业部署,且存储开销低。

提出的方法

  • 将MoCo对比学习框架适配至音频指纹识别,将一个音频轨道及其经过增强和失真的版本视为正样本对。
  • 将不同的音频轨道视为负样本对,以在训练过程中强化表征的判别性。
  • 通过随机音频降级(如音高偏移、速度变化、压缩、均衡化)进行数据增强,以生成正样本。
  • 使用共享编码器(如VGG-16、ResNet-18)并设计查询与键分支,其中键通过动量更新以稳定训练过程。
  • 从2.5秒音频片段的梅尔频谱图(128×200)中,通过全局平均池化和L2归一化提取256维嵌入。
  • 在端到端训练中使用对比损失,最小化正样本对之间的距离,同时最大化负样本对之间的距离。

实验结果

研究问题

  • RQ1对比无监督学习能否提升音频指纹识别在严重失真(如音高偏移和速度变化)下的鲁棒性?
  • RQ2在低资源、无监督设置下,主干网络的选择(如VGG与ResNet)如何影响指纹识别性能?
  • RQ3基于对比学习的音频指纹识别系统在训练中未见的未知音频失真下,其泛化能力达到何种程度?
  • RQ4在真实失真条件下,该方法与Shazam和SAMAF等现有系统相比,命中率表现如何?
  • RQ5所学习的指纹在大规模工业部署中的存储效率与可扩展性如何?

主要发现

  • 在ImageNet上预训练的VGG-16模型在VoxCeleb2-Test集上取得了84.54%的最高命中率,优于基于ResNet的模型。
  • 该系统在VoxCeleb2-Test和Music-Test上对训练中未使用的均衡化与压缩失真实现了100%的命中率,表明其具有极强的泛化能力。
  • 基于Shazam的基线模型在同一测试集上命中率为0.00%,凸显了传统方法在严重失真下的局限性。
  • 该模型在音乐数据上表现优异(使用VGG-16且未进行ImageNet预训练时命中率达99.80%),表明其对音乐具有高度判别性。
  • 指纹极为紧凑——每3分钟音频轨道约400 KB,使得1亿首曲目数据库的存储量约为400 GB,适合工业应用。
  • 出人意料的是,更深的网络(如ResNet-50)并未优于VGG-16,表明特征语义与模型容量并不总与音频指纹识别性能正相关。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。