[論文レビュー] Towards multi-instrument drum transcription
本論文では、大規模な合成データセットを導入し、畳み込みニューラルネットワーク(CNN)および畳み込み再帰ニューラルネットワーク(CRNN)を訓練することで、標準の3つのドラム(スネア、バスドラム、ハイハット)を超える複数の楽器を含むドラムトランスクリプションを実現し、実世界のデータへの一般化性能を向上させた。主な貢献は、8および18種類のドラム楽器クラスをサポートする、公開可能でバランスの取れた合成データセットと、そのデータセットで訓練されたモデルである。トムスやシンバルなど、代表が不足している楽器クラスの性能向上が見られた。
Automatic drum transcription, a subtask of the more general automatic music transcription, deals with extracting drum instrument note onsets from an audio source. Recently, progress in transcription performance has been made using non-negative matrix factorization as well as deep learning methods. However, these works primarily focus on transcribing three drum instruments only: snare drum, bass drum, and hi-hat. Yet, for many applications, the ability to transcribe more drum instruments which make up standard drum kits used in western popular music would be desirable. In this work, convolutional and convolutional recurrent neural networks are trained to transcribe a wider range of drum instruments. First, the shortcomings of publicly available datasets in this context are discussed. To overcome these limitations, a larger synthetic dataset is introduced. Then, methods to train models using the new dataset focusing on generalization to real world data are investigated. Finally, the trained models are evaluated on publicly available datasets and results are discussed. The contributions of this work comprise: (i.) a large-scale synthetic dataset for drum transcription, (ii.) first steps towards an automatic drum transcription system that supports a larger range of instruments by evaluating and discussing training setups and the impact of datasets in this context, and (iii.) a publicly available set of trained models for drum transcription. Additional materials are available at http://ifs.tuwien.ac.at/~vogl/dafx2018
研究の動機と目的
- 既存の自動ドラムトランスクリプションシステムが、スネア、バスドラム、ハイハットという3つの主要なドラム楽器に限定されているという限界に対処すること。
- 4197 トラック(約259時間)の、大規模でバランスの取れた合成データセットを用いてモデルを訓練することで、実世界の音声データへの一般化性能を向上させること。
- データセット構成、クラスのバランス、トレーニング戦略の影響が、複数の楽器クラスにおけるトランスクリプション性能に与える影響を評価すること。
- 今後のマルチインストルメントドラムトランスクリプション研究を支援するため、公開可能なトレーニング済みモデルとデータセットを提供すること。
提案手法
- 複数のドラム楽器のオンセット活性を同時に予測する、エンドツーエンドの畳み込みニューラルネットワークおよび畳み込み再帰ニューラルネットワーク(CRNN)を訓練する。
- General MIDIマッピングを用いて、8および18種類のドラム楽器クラスをカバーする、4197 トラック、約259時間の音声を含む合成データセットを作成する。
- クラスの不均衡を軽減し、トムスやシンバルなどの代表が不足している楽器の性能を向上させるために、データバランス化技術を適用する。
- 1つのモデルで全ターゲット楽器をトランスクリプションできるマルチタスクトレーニング設定を採用し、パラメータの効率性と一般化性能を向上させる。
- ENST や MAESTRO などの公開データセットを用いてモデルを評価し、データセット間での一般化性能とロバストネスを評価する。
- 誤りパターンの分析として、疑似混同行列を用い、類似した響きの楽器(例:BD/LT、CHH/PHH)の間で頻繁に誤分類が生じることを特定する。
実験結果
リサーチクエスチョン
- RQ11つのディープラーニングモデルが、標準の3つを超える広範なドラム楽器(最大18クラス)を効果的にトランスクリプションできるか。
- RQ2大規模で合成されたバランスの取れたデータセットを用いてトレーニングすることで、実世界の音声データへの一般化性能が、実世界データのみを用いた場合と比較して向上するか。
- RQ3データバランス化と混合トレーニング戦略(例:合成データで事前学習した後、実世界データで微調整)が、代表が不足しているドラムクラスの性能に与える影響は何か。
- RQ4トランスクリプションの誤りパターンは楽器クラスごとにどのように異なるか。また、それらは楽器の聴覚的類似性やラベル付けの曖昧さに関する何らかのインサイトを提供するか。
主な発見
- 合成データセットで訓練されたモデルは、実世界のデータへの一般化がうまくいき、直接的な実データファインチューニングなしでも、ENST や MAESTRO などの公開ベンチマークで強力な性能を示した。
- 合成データセットでトレーニングしたことで、代表が不足しているクラス(例:LT、MT、RD、CRC、CHC)の性能向上が確認され、データ拡張としての有効性が示された。
- 合成データセットのバランス化により、トレーニング段階での代表が不足しているクラスの性能向上が見られたが、一貫したデータセット間一般化性能の向上にはつながらなかった。これは、データ分布設計におけるトレードオフを示唆している。
- 疑似混同行列の分析から、類似した響きの楽器(例:ハイハットのバリエーション、トムス、シンバル)が頻繁に誤分類されることが判明し、ドラム音色分類における本質的な聴覚的曖昧さが示された。
- 合成MIDIデータセットで事前学習し、その後実世界データの組み合わせで微調整することで、すべての楽器クラス、特にレアな楽器の検出性能が向上したモデルが得られた。
- 本システムは、スケールに応じたマルチインストルメントドラムトランスクリプションが可能であることを示しており、公開されたモデルとデータセットにより、再現可能な研究と今後の開発が可能になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。