Skip to main content
QUICK REVIEW

[論文レビュー] AudioMNIST: Exploring Explainable Artificial Intelligence for Audio Analysis on a Simple Benchmark

Sören Becker, Johanna Vielhaben|arXiv (Cornell University)|Jul 9, 2018
Explainable Artificial Intelligence (XAI)被引用数 7
ひとこと要約

この論文は、30,000件の英語の発話された数字音声サンプルを含むオープンソースデータセットであるAudioMNISTを紹介し、音声分類における深層ニューラルネットワークの意思決定を説明するために、レイヤーごとの関連性プロパゲーション(LRP)を適用する。ヒューマンユーザースタディにおいて、聴覚的ヒートマップ—音声化された関連性スコア—が視覚的ヒートマップよりもはるかに解釈可能であることが示された。これは、音声AIにおけるモodal特化型の説明フォーマットの重要性を強調している。

ABSTRACT

Explainable Artificial Intelligence (XAI) is targeted at understanding how models perform feature selection and derive their classification decisions. This paper explores post-hoc explanations for deep neural networks in the audio domain. Notably, we present a novel Open Source audio dataset consisting of 30,000 audio samples of English spoken digits which we use for classification tasks on spoken digits and speakers' biological sex. We use the popular XAI technique Layer-wise Relevance Propagation (LRP) to identify relevant features for two neural network architectures that process either waveform or spectrogram representations of the data. Based on the relevance scores obtained from LRP, hypotheses about the neural networks' feature selection are derived and subsequently tested through systematic manipulations of the input data. Further, we take a step beyond visual explanations and introduce audible heatmaps. We demonstrate the superior interpretability of audible explanations over visual ones in a human user study.

研究の動機と目的

  • 音声分類における説明可能AI(XAI)のための標準化されたオープンベンチマークの不足に対処すること。
  • LRPなどの後処理説明手法を用いて、音声タスクにおける深層ニューラルネットワークの意思決定プロセスを解明すること。
  • 視覚的説明と聴覚的説明の違いといった、異なる説明フォーマット(視覚的 vs. 聴覚的)の解釈可能性を、特に音声データに対して評価すること。
  • LRPの関連性スコアを音声に変換する新しい方法、すなわち聴覚的ヒートマップの開発と検証を目的とすること。
  • 説明フォーマットがユーザーの解釈に与える影響が顕著に現れること、特に音声分野において顕著であることを実証すること。

提案手法

  • 生波形およびスペクトログラム形式で、30,000件の英語発話された数字の録音を含む、公開データセットであるAudioMNISTを構築する。
  • 波形とスペクトログラムの両方を入力として用いた2つの深層ニューラルネットワークアーキテクチャを、数字分類および性別分類タスクに訓練する。
  • 各予測の入力特徴の関連性スコアを計算するために、レイヤーごとの関連性プロパゲーション(LRP)を適用する。
  • 関連性値を音声信号におけるピッチと持続時間にマッピングすることで、LRPの関連性スコアを聴覚的ヒートマップに変換する。
  • 視覚的ヒートマップ、聴覚的ヒートマップ、および生の音声のみを用いた条件を比較するヒューマンユーザースタディを実施する。
  • インフォームドネスとマークドネスといった指標を用いて、説明フォーマットの解釈可能性を定量的に評価する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、生波形とスペクトログラムのどちらを用いるかによって、発話された数字と発話者の生物学的性別をどのように分類しているか?
  • RQ2LRPに基づく視覚的説明は、音声分類におけるモデルの特徴選択戦略をどの程度明らかにできるか?
  • RQ3聴覚的ヒートマップ—音声化された関連性スコア—は、視覚的ヒートマップと比較して、モデル意思決定の解釈性を向上させることができるか?
  • RQ4説明のモダリティ(視覚的対聴覚的)は、ユーザーがモデル予測を理解する能力にどのように影響するか?
  • RQ5音声分類タスクにおいて、視覚的説明、聴覚的説明、および生の音声のみの違いによる解釈性の違いは何か?

主な発見

  • スペクトログラムで訓練されたモデルは、性別分類において主に低周波成分に依存しており、基本周波数の違いに敏感であることが示された。
  • 波形ベースのモデルは、入力信号のわずかな局所的領域にのみ注目しており、グローバルな特徴の利用が限定的であることが示唆された。
  • ヒューマンユーザースタディの結果、聴覚的ヒートマップは視覚的ヒートマップよりも顕著に解釈性が高く、インフォームドネスとマークドネスの両指標で優れた成績を示した。
  • モデルが正しい分類をした場合(例:'nine')、特に関連する音声的キュー(例:'i'の発音)が短く微細な場合、聴覚的説明を用いたユーザーの予測精度が視覚的説明よりも高かった。
  • ベースライン条件(生の音声のみ)は、解釈性指標が最低であった。これは、モデルの透明性を確保するためには説明が不可欠であることを確認した。
  • 本研究は、最適な説明フォーマットが入力モダリティに依存することを確認した。特に、人間の知覚的アライメントに合致するため、音声データに対しては聴覚的説明が優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。