Skip to main content
QUICK REVIEW

[論文レビュー] Towards Interpretable Polyphonic Transcription with Invertible Neural Networks

Rainer Kelz, Gerhard Widmer|arXiv (Cornell University)|Sep 4, 2019
Music and Audio Processing参考文献 35被引用数 7
ひとこと要約

本稿では、解釈可能なポリフォニック音楽譜書き換えのための可逆ニューラルネットワーク(INN)を導入し、学習された表現の直接的検査と記号的ネート出力の生成を可能にしている。MAPSデータセットで訓練した結果、特に極端なオクターブにおける単独の音符は、ポリフォニックな訓練データから信頼性を持って分離できないことが明らかとなり、現在のニューラル譜書き換えシステムにおける主要な制限が露呈された。

ABSTRACT

We explore a novel way of conceptualising the task of polyphonic music transcription, using so-called invertible neural networks. Invertible models unify both discriminative and generative aspects in one function, sharing one set of parameters. Introducing invertibility enables the practitioner to directly inspect what the discriminative model has learned, and exactly determine which inputs lead to which outputs. For the task of transcribing polyphonic audio into symbolic form, these models may be especially useful as they allow us to observe, for instance, to what extent the concept of single notes could be learned from a corpus of polyphonic music alone (which has been identified as a serious problem in recent research). This is an entirely new approach to audio transcription, which first of all necessitates some groundwork. In this paper, we begin by looking at the simplest possible invertible transcription model, and then thoroughly investigate its properties. Finally, we will take first steps towards a more sophisticated and capable version. We use the task of piano transcription, and specifically the MAPS dataset, as a basis for these investigations.

研究の動機と目的

  • ニューラル音楽譜書き換えモデルにおける解釈可能性の欠如、特に個々の音符の分離表現を学習しているかどうかの点を解決すること。
  • 可逆ニューラルネットワーク(INN)が、分類的および生成的モデリングを統合できるかどうかを調査し、モデル動作の直接的検査を可能にすること。
  • ポリフォニックコーパスからのみ単一の単独音符の概念を学習できるかどうかを評価し、INNを用いてそのような音符を生成・評価すること。
  • モデルの逆問題とサンプリングを用いて、ラベルなしデータにおける曖昧または不確実な予測を同定する手法を提供すること。
  • INNを用いた下流のMIRタスク(例:スタイル転送や音源分離)の実現可能性を検討すること。

提案手法

  • モデルは可逆ニューラルネットワーク(INN)を用い、マグニチュードスペクトログラム入力を、意味的部品(譜面出力、y)と不要な部品(z)に分離する出力へマップする。両者とも同じパラメータを共有する。
  • INNは、元の入力スペクトログラムと、yとzから再構築された出力との間の再構築誤差を最小化するように訓練され、双射的マッピングを保証する。
  • 解釈可能性の観点から、標準正規分布からzをサンプリングし、特定のy値(例:単一の音符)に条件づけて合成音声サンプルを生成する。
  • 生成されたサンプルと真値の単独音符録音との間のフレーム単位のユークリッド距離を計算し、分位数平均をとることで忠実度を評価する。
  • モデルはMAPSデータセットで評価され、フレーム単位と時間的文脈を考慮したRevNetアーキテクチャの両方を用い、再構築誤差と知覚的類似度を指標として性能を測定した。
  • モデルは予測を逆問題と再構築することで、直接的にモデル動作を可視化可能にし、どの入力がどの出力に対応するかを検査できる。

実験結果

リサーチクエスチョン

  • RQ1可逆ニューラルネットワークは、ポリフォニック譜書き換えモデルが個々の音符をどのように符号化しているかを解釈し、どの程度個別化された表現を学習しているかを評価できるか?
  • RQ2ポリフォニック音楽のみで訓練されたモデルが、真値録音との比較を通じて、単一の単独音符をどの程度正しく表現できるか?
  • RQ3再構築品質とサンプリング行動を分析することで、モデルがラベルなしデータにおける曖昧または不確実な予測を同定・フラグ付けできるか?
  • RQ4RevNetsによる時間的文脈の統合は、フレーム単位モデルと比較して、譜書き換え性能または解釈可能性に有意な向上をもたらすか?
  • RQ5同じモデルが譜書き換えシステムとしてだけでなく、合成器としても機能可能であり、意味的コンセプトのサンプリングやスタイル転送を可能にするか?

主な発見

  • モデルは再構築誤差が無視できるほど小さいことを確認し、学習されたマッピングの可逆性と安定性を裏付けた。
  • 単独音符の生成において、一般的なピッチでは高い忠実度を示したが、珍しいまたは極端な音符(特に低音・高音域)では顕著なずれが生じた。
  • 生成された音符と基準音とのフレーム単位距離の四分位範囲から、極端なレパートリーに属する音符はうまく再構築されていないことが判明し、ポリフォニックデータからのこれらの概念の学習に失敗していることが示された。
  • INNの使用により、モデル動作の直接的検査が可能となった。潜在空間からのサンプリングにより、モデルが個々の音符の意味的で分離可能な表現を学習しているかどうかを観察できる。
  • RevNetsによる時間的文脈の統合は、性能向上や解釈可能性向上に明確な効果を示さなかった。これは、モデルの複雑さの増加と訓練データの不足が原因と考えられる。
  • 意味的出力yを変更し再逆問題化することで、モデルは意味的コンセプトのサンプリングやスタイル転送を可能にした。これは、譜書き換えを越えたMIRタスクへの応用可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。