Skip to main content
QUICK REVIEW

[论文解读] Learning Complex Basis Functions for Invariant Representations of Audio

Stefan Lattner, Monika Dörfler|arXiv (Cornell University)|Jul 13, 2019
Music and Audio Processing参考文献 35被引用 4
一句话总结

本文提出复杂自编码器(CAE),一种深度学习架构,通过从音频频谱图中学习复数基函数,生成对变换不变的表征。通过将音频投影到对正交变换(如移调、时移)不变的幅度空间,以及编码变换差异的相位空间,CAE 在音频-乐谱对齐和重复段落发现任务中达到最先进性能,优于音高特征(Chroma)和基于GAE的特征。

ABSTRACT

Learning features from data has shown to be more successful than using hand-crafted features for many machine learning tasks. In music information retrieval (MIR), features learned from windowed spectrograms are highly variant to transformations like transposition or time-shift. Such variances are undesirable when they are irrelevant for the respective MIR task. We propose an architecture called Complex Autoencoder (CAE) which learns features invariant to orthogonal transformations. Mapping signals onto complex basis functions learned by the CAE results in a transformation-invariant "magnitude space" and a transformation-variant "phase space". The phase space is useful to infer transformations between data pairs. When exploiting the invariance-property of the magnitude space, we achieve state-of-the-art results in audio-to-score alignment and repeated section discovery for audio. A PyTorch implementation of the CAE, including the repeated section discovery method, is available online.

研究动机与目标

  • 解决手工设计音频特征对音乐信息检索(MIR)中无关变换(如移调、时移)敏感的问题。
  • 开发一种从数据中学习基函数的方法,而非依赖傅里叶变换或CQT等固定变换。
  • 生成对正交变换不变的幅度空间,以及编码变换类型和距离的相位空间。
  • 通过不变表征提升音频-乐谱对齐和重复段落发现等MIR任务的性能。
  • 通过MNIST作为基准,证明模型可泛化至其他不变性(如旋转)。

提出的方法

  • CAE通过具有复数值权重和激活的自编码器架构,从恒定-Q变换(CQT)的音频表征中学习复数基函数。
  • 模型在通过正交变换(如移调、时移)关联的数据对上进行训练,使用复数域中的重构损失。
  • 编码表征的幅度形成对变换不变的空间,而相位则编码变换特异性信息。
  • 幅度空间用于需要不变性的下游任务,而相位空间可用于推断信号间的变换类型和距离。
  • 该架构以无监督方式训练,无需对变换类型施加显式标签。
  • 该方法可泛化至其他不变性(如旋转),在MNIST数据集上通过旋转数字进行了验证。

实验结果

研究问题

  • RQ1从音频数据中学习复数基函数,是否能产生比CQT或Chroma等固定变换更鲁棒、变换不变的表征?
  • RQ2CAE的幅度空间在音频-乐谱对齐任务中,对移调和时移的不变性是否优于现有方法?
  • RQ3CAE的相位空间是否能有效编码音频片段间的变换类型和距离,从而实现更优的结构分析?
  • RQ4在对齐任务中,CAE相较于基于GAE的特征,在应对速度变化时是否更具鲁棒性?
  • RQ5CAE能否在非音频领域(如图像分类)泛化至其他不变性(如旋转)?

主要发现

  • CAE在移调不变的重复段落发现任务中达到最先进性能,优于Chroma和基于GAE的特征。
  • 在音频-乐谱对齐任务中,CAE特征的表现优于Chroma和基于GAE的特征,尤其在速度变化条件下表现更优。
  • 在旋转MNIST数据集上,对CAE幅度空间进行逻辑回归的错误率显著低于输入空间,即使仅使用256个学习到的基函数。
  • PCA可视化显示,CAE的幅度空间在旋转下形成清晰、类间分离的聚类,表明其具有强不变性。
  • CAE的相位差空间能清晰表示变换类型(如旋转角度),支持对信号关系的判别性分析。
  • CAE仅用256个基函数的性能即优于使用1000个基函数的GAE,表明通过显式训练实现不变性可实现更高效、更有效的基函数学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。