Skip to main content
QUICK REVIEW

[论文解读] AudioMNIST: Exploring Explainable Artificial Intelligence for Audio Analysis on a Simple Benchmark

Sören Becker, Johanna Vielhaben|arXiv (Cornell University)|Jul 9, 2018
Explainable Artificial Intelligence (XAI)被引用 7
一句话总结

本文介绍了 AudioMNIST,一个包含 30,000 个英语发音数字音频样本的新型开源数据集,并应用层归因传播(LRP)方法解释深度神经网络在音频分类中的决策过程。在一项人类用户研究中,结果表明,可听热图——将相关性分数以音频形式呈现——相比视觉热图提供了显著更易理解的解释,凸显了在音频人工智能中采用模态特定解释格式的重要性。

ABSTRACT

Explainable Artificial Intelligence (XAI) is targeted at understanding how models perform feature selection and derive their classification decisions. This paper explores post-hoc explanations for deep neural networks in the audio domain. Notably, we present a novel Open Source audio dataset consisting of 30,000 audio samples of English spoken digits which we use for classification tasks on spoken digits and speakers' biological sex. We use the popular XAI technique Layer-wise Relevance Propagation (LRP) to identify relevant features for two neural network architectures that process either waveform or spectrogram representations of the data. Based on the relevance scores obtained from LRP, hypotheses about the neural networks' feature selection are derived and subsequently tested through systematic manipulations of the input data. Further, we take a step beyond visual explanations and introduce audible heatmaps. We demonstrate the superior interpretability of audible explanations over visual ones in a human user study.

研究动机与目标

  • 为解决音频分类领域中可解释人工智能(XAI)缺乏标准化、公开的基准问题。
  • 探索使用后处理解释方法(如 LRP)时,深度神经网络在音频任务中的决策机制。
  • 评估不同解释格式(视觉 vs. 可听)在音频数据中的可解释性表现。
  • 开发并验证一种将 LRP 相关性分数渲染为可听热图的新方法,以提升人类对模型决策的理解。
  • 证明解释格式显著影响用户可解释性,尤其在音频领域中表现突出。

提出的方法

  • 构建 AudioMNIST,一个包含 30,000 个英语发音数字录音的公开数据集,提供原始波形和频谱图格式。
  • 训练两种深度神经网络架构:一种基于原始波形,另一种基于频谱图,用于数字和性别分类任务。
  • 应用层归因传播(LRP)计算每个预测的输入特征相关性分数。
  • 通过将相关性值映射到音频信号的音高和时长,将 LRP 相关性分数转换为可听热图。
  • 开展人类用户研究,比较用户在仅使用视觉热图、可听热图和原始音频时预测模型决策的表现。
  • 使用似然性(informedness)和标定度(markedness)等指标量化可解释性,以比较不同解释格式的表现。

实验结果

研究问题

  • RQ1深度神经网络在使用原始波形与频谱图时,如何对发音数字和说话人生物性别的分类?
  • RQ2基于 LRP 的视觉解释在多大程度上能揭示模型在音频分类中的特征选择策略?
  • RQ3可听热图——以音频形式呈现的相关性分数——是否能显著提升人类对模型决策的可解释性,相比视觉热图?
  • RQ4解释的模态(视觉 vs. 听觉)如何影响用户理解模型预测的能力?
  • RQ5在音频分类任务中,视觉解释、可听解释与仅使用原始音频相比,其可解释性有何差异?

主要发现

  • 在频谱图上训练的模型主要依赖低频成分进行性别分类,表明对基频差异具有敏感性。
  • 基于波形的模型仅关注输入信号中极小的、局部化的部分,表明其对全局特征的利用有限。
  • 可听热图在可解释性方面显著优于视觉热图,用户研究中显示出更高的似然性和标定度。
  • 即使模型正确分类了某个数字(例如“nine”),用户在使用可听解释时的预测准确率也高于使用视觉热图,尤其当相关声学线索(如“i”音)短暂且细微时。
  • 基线条件——仅使用原始音频——的可解释性指标最低,证实了解释对模型透明度至关重要。
  • 本研究证实,最优解释格式取决于输入模态,由于人类感知的匹配性,听觉解释在音频数据中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。