Skip to main content
QUICK REVIEW

[论文解读] audioLIME: Listenable Explanations Using Source Separation

Verena Haunschmid, Ethan Manilow|arXiv (Cornell University)|Aug 2, 2020
Music and Audio Processing参考文献 6被引用 7
一句话总结

audioLIME 是一种针对音乐标记系统、与模型无关的解释方法,通过使用语音分离技术生成可听且具有感知意义的解释,其方法是扰动单个音频源(如人声、军鼓)而非频谱图区域。与先前的 SLIME 方法相比,audioLIME 在解释基于频谱图和波形的模型预测时表现更优,尤其在波形输入上表现突出,生成的解释既可解释又具有感知有效性。

ABSTRACT

Deep neural networks (DNNs) are successfully applied in a wide variety of music information retrieval (MIR) tasks but their predictions are usually not interpretable. We propose audioLIME, a method based on Local Interpretable Model-agnostic Explanations (LIME) extended by a musical definition of locality. The perturbations used in LIME are created by switching on/off components extracted by source separation which makes our explanations listenable. We validate audioLIME on two different music tagging systems and show that it produces sensible explanations in situations where a competing method cannot.

研究动机与目标

  • 为解决音乐信息检索(MIR)任务中使用的深度神经网络(DNN)缺乏可解释性的问题。
  • 克服现有基于 LIME 的方法在 MIR 领域的局限性,这些方法使用基于频谱图的扰动,但其结果不具感知意义或不可听。
  • 开发一种方法,通过语音分离保留音频的音乐结构,生成既可解释又可听的解释。
  • 验证 audioLIME 生成的解释准确反映黑箱音乐标记模型的决策过程。
  • 证明该方法在基于频谱图和关键的基于波形的音乐标记模型上的有效性。

提出的方法

  • audioLIME 通过将可解释特征定义为通过语音分离提取的源分离音频组件(如钢琴、人声、军鼓)的二元开启/关闭状态,扩展了 LIME 框架。
  • 该方法将音频分割为 τ 个时间片段,从而生成 C × τ 个可解释组件(C 个源在 τ 个时间帧上),实现细粒度扰动。
  • 通过仅在二值向量 z′ 中混合选定的源(设为 1),生成扰动,从而产生一个与原始音频感知相似的新音频混合信号 z。
  • 在 2^14 个扰动样本上训练带有 L2 正则化的线性代理模型,以识别最影响黑箱模型预测的源组件。
  • 该系统对目标模型的输入表示(波形或频谱图)保持无感知,从而能够解释基于波形的模型(如 SampleCNN)。
  • 语音分离使用 Spleeter 完成,解释通过将前 k 个选定组件重新输入标记器来评估,以测试预测的一致性。

实验结果

研究问题

  • RQ1基于语音分离的扰动能否为音乐标记模型生成既可解释又具有感知意义(即可听)的解释?
  • RQ2audioLIME 是否在解释方面比 SLIME 更可靠,尤其是在基于波形的音乐标记模型上?
  • RQ3audioLIME 能否解释使用原始波形作为输入的模型的预测,而这些模型是以往基于 LIME 的方法无法处理的?
  • RQ4当仅使用前 k 个组件时,audioLIME 的解释在多大程度上保留了原始模型的预测?
  • RQ5audioLIME 生成的解释是否与人类对音乐内容的感知一致(例如,识别出‘女声主唱’标签对应的人声)?

主要发现

  • 当仅使用解释中的前 k 个组件时,audioLIME 的预测一致性高于 SLIME 和随机基线,其中在 FCN 和 SampleCNN 模型上 k=4 时性能最高。
  • 对于 FCN 模型,audioLIME 准确识别出‘女声主唱’是预测的关键组件,前三个组件分别为一位女歌手的人声分离结果。
  • 在摇滚音乐预测中,audioLIME 突出了强劲的军鼓和失真电吉他——这些音乐元素与摇滚风格一致,证明了其感知相关性。
  • audioLIME 在基于频谱图的 FCN 和基于波形的 SampleCNN 上均优于 SLIME,显示出其能够解释不同输入表示的模型。
  • 该方法在解释以往基于 LIME 的方法无法处理的模型方面表现出鲁棒性,特别是使用原始波形的模型,这得益于其可听且基于源的扰动策略。
  • 评估结果证实,audioLIME 的解释不仅准确,而且具有感知有效性,从而增强了对黑箱模型决策的信任。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。