Skip to main content
QUICK REVIEW

[论文解读] Towards Interpretable Polyphonic Transcription with Invertible Neural Networks

Rainer Kelz, Gerhard Widmer|arXiv (Cornell University)|Sep 4, 2019
Music and Audio Processing参考文献 35被引用 7
一句话总结

本文提出使用可逆神经网络(INNs)实现可解释的多声部音乐转录,支持对学习到的表征进行直接检查,并生成符号化音符输出。通过在MAPS数据集上进行训练,模型揭示出:孤立音符——尤其是极端八度的音符——无法从多声部训练数据中可靠地解耦,暴露出当前神经网络转录系统的一个关键局限。

ABSTRACT

We explore a novel way of conceptualising the task of polyphonic music transcription, using so-called invertible neural networks. Invertible models unify both discriminative and generative aspects in one function, sharing one set of parameters. Introducing invertibility enables the practitioner to directly inspect what the discriminative model has learned, and exactly determine which inputs lead to which outputs. For the task of transcribing polyphonic audio into symbolic form, these models may be especially useful as they allow us to observe, for instance, to what extent the concept of single notes could be learned from a corpus of polyphonic music alone (which has been identified as a serious problem in recent research). This is an entirely new approach to audio transcription, which first of all necessitates some groundwork. In this paper, we begin by looking at the simplest possible invertible transcription model, and then thoroughly investigate its properties. Finally, we will take first steps towards a more sophisticated and capable version. We use the task of piano transcription, and specifically the MAPS dataset, as a basis for these investigations.

研究动机与目标

  • 为解决神经音乐转录模型中可解释性不足的问题,特别是模型是否学习到单个音符的解耦表征。
  • 研究可逆神经网络(INNs)是否能统一判别式与生成式建模在音乐转录中的应用,实现对模型行为的直接检查。
  • 评估仅通过多声部语料是否能够学习到单一孤立音符的概念,利用INNs生成并评估此类音符。
  • 提出一种通过模型反演与采样识别未标注数据中模糊或不确定预测的方法。
  • 探索INNs在下游MIR任务(如风格迁移与音源分离)中的可行性。

提出的方法

  • 该模型使用可逆神经网络(INN)将幅度谱图输入映射为解耦输出:语义部分(转录结果,y)与干扰部分(z),两者共享相同参数。
  • INN通过最小化原始输入谱图与从y和z重构出的输出之间的重建误差进行训练,确保双射映射。
  • 为实现可解释性,模型通过从标准正态分布采样z并条件化特定y值(如单个音符)生成合成音频样本。
  • 计算生成样本与真实孤立音符录音之间的帧级欧氏距离,并进行分位数平均以评估保真度。
  • 在MAPS数据集上评估模型,采用帧级与考虑时间上下文的RevNet架构,性能通过重建误差与感知相似性进行衡量。
  • 该方法通过反演预测并重构输入数据,实现对模型行为的直接可视化,从而可检查何种输入导致何种输出。

实验结果

研究问题

  • RQ1可逆神经网络能否用于解释多声部转录模型如何编码单个音符,以及其在多大程度上学习到解耦表征?
  • RQ2仅通过多声部音乐训练,模型在多大程度上能学习到孤立音乐音符的表征?通过生成与真实录音的对比进行验证。
  • RQ3模型能否通过分析重构质量与采样行为,识别并标记未标注数据中不确定或模糊的预测?
  • RQ4与帧级模型相比,通过RevNets引入时间上下文是否能提升转录性能或可解释性?
  • RQ5同一模型能否同时作为转录系统与合成器使用,支持语义概念采样与风格迁移?

主要发现

  • 模型成功以可忽略的误差重建输入谱图,证实了学习映射的可逆性与稳定性。
  • 针对孤立音符生成的样本在常见音高上表现出高保真度,但在稀有或极端音符(尤其是最低与最高八度)上存在显著偏差。
  • 生成样本与参考音符之间帧级距离的四分位距范围显示,极端音域的音符重构效果差,表明模型无法从多声部数据中学习到这些概念。
  • INN的使用使得模型行为可直接观察:通过从潜在空间采样,从业者可判断模型是否已学习到有意义且解耦的单个音符表征。
  • 通过RevNets引入时间上下文并未在性能或可解释性上带来可测量的提升,可能由于模型复杂度增加及训练数据不足。
  • 通过修改语义输出y并重新反演,模型支持语义概念采样与风格迁移,表明其在转录之外的MIR任务中具有更广泛的应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。