Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Learning of Semantic Audio Representations

Aren Jansen, Manoj Plakal|arXiv (Cornell University)|Nov 6, 2017
Music and Audio Processing参考文献 18被引用 5
一句话总结

该论文提出了一种无监督深度度量学习方法,用于音频表征学习,采用三元组损失函数,利用时间平移、声音混合和时间邻近性等语义不变性,适用于未标注音频。该方法在声音事件分类任务上达到全监督模型84%的性能,并在低监督设置下将最先进性能提升一倍,证明了从弱结构化音频约束中实现强大泛化能力。

ABSTRACT

Even in the absence of any explicit semantic annotation, vast collections of audio recordings provide valuable information for learning the categorical structure of sounds. We consider several class-agnostic semantic constraints that apply to unlabeled nonspeech audio: (i) noise and translations in time do not change the underlying sound category, (ii) a mixture of two sound events inherits the categories of the constituents, and (iii) the categories of events in close temporal proximity are likely to be the same or related. Without labels to ground them, these constraints are incompatible with classification loss functions. However, they may still be leveraged to identify geometric inequalities needed for triplet loss-based training of convolutional neural networks. The result is low-dimensional embeddings of the input spectrograms that recover 41% and 84% of the performance of their fully-supervised counterparts when applied to downstream query-by-example sound retrieval and sound event classification tasks, respectively. Moreover, in limited-supervision settings, our unsupervised embeddings double the state-of-the-art classification performance.

研究动机与目标

  • 在无显式类别标签的情况下学习有意义的语义音频表征。
  • 利用与类别无关的语义约束(如时间平移、声音混合和时间邻近性)于未标注音频中,实现自监督学习。
  • 使用三元组损失训练深度卷积网络,将频谱图嵌入到低维空间,以保留语义相似性。
  • 在下游任务(如基于示例的检索和声音事件分类)上评估学习到的嵌入表征。
  • 在标注数据稀缺的低监督设置下展示性能提升。

提出的方法

  • 从未标注音频中采样三元组,利用三种语义约束:同一事件的时间偏移版本、事件混合对,以及时间上邻近的事件。
  • 通过三元组损失训练卷积神经网络,将频谱图窗口映射到d维嵌入空间,使锚点与正样本的距离小于与负样本的距离。
  • 采用对比损失形式,使模型最小化正样本对(如清晰与噪声版本)之间的距离,同时最大化负样本对(如无关声音)之间的距离。
  • 利用AudioSet数据集进行训练与评估,从原始音频片段中生成数百万个三元组,无需任何类别标注。
  • 将多种三元组类型整合到联合嵌入模型中,以提升鲁棒性并捕捉多样的语义关系。
  • 通过下游任务(如基于示例的检索和不同监督水平下的声音事件分类)评估学习到的嵌入表征。

实验结果

研究问题

  • RQ1未标注音频中的语义不变性(如时间偏移和声音混合)是否可用于在无显式标签的情况下训练有效的音频表征?
  • RQ2基于弱语义约束的三元组损失在下游音频任务上的泛化能力,与原始频谱图相比如何?
  • RQ3当时间平移、混合和邻近性等互补约束联合使用时,对表征质量的提升程度如何?
  • RQ4在低监督设置下,无监督嵌入表征是否能超越全监督基线模型?
  • RQ5在标准音频基准测试中,无监督与全监督表征之间的性能差距有多大?

主要发现

  • 联合无监督三元组模型在基于示例的声音检索任务上,恢复了原始频谱图与全监督嵌入表征之间41%的性能差距。
  • 在声音事件分类任务中,无监督嵌入表征在使用相同下游分类器时,达到全监督对应模型84%的性能。
  • 在仅每类20个标注样本的低监督设置下,无监督嵌入模型使全连接ResNet-50分类器在原始输入上的mAP翻倍。
  • 在527类AudioSet分类任务中,联合三元组集训练的模型达到mAP 0.244,为全监督ResNet-50模型mAP(0.288)的85%。
  • 时间邻近性约束带来的增益最强,其次是混合和时间平移,联合使用时表现出互补性提升。
  • 在数据增强中引入二维平移(时间与频率方向)可改善早期卷积滤波器的频谱定位能力,从而提升表征质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。