[論文レビュー] High-resolution Piano Transcription with Pedals by Regressing Onset and Offset Times
本稿では、深層学習モデルを用いて正確なオンセットおよびオフセット時刻と sustain ペダルの時刻を回帰することで、任意の時間分解能を達成可能な高分解能ピアノトランスクリプションシステムを提案する。推論時、解析的手法により正確なタイミングを計算し、MAESTROで96.72%の最先端のオンセット F1 を達成するとともに、MAESTROにおける最初のペダルトランスクリプションベンチマーク F1 91.86% を達成した。
Automatic music transcription (AMT) is the task of transcribing audio recordings into symbolic representations. Recently, neural network-based methods have been applied to AMT, and have achieved state-of-the-art results. However, many previous systems only detect the onset and offset of notes frame-wise, so the transcription resolution is limited to the frame hop size. There is a lack of research on using different strategies to encode onset and offset targets for training. In addition, previous AMT systems are sensitive to the misaligned onset and offset labels of audio recordings. Furthermore, there are limited researches on sustain pedal transcription on large-scale datasets. In this article, we propose a high-resolution AMT system trained by regressing precise onset and offset times of piano notes. At inference, we propose an algorithm to analytically calculate the precise onset and offset times of piano notes and pedal events. We show that our AMT system is robust to the misaligned onset and offset labels compared to previous systems. Our proposed system achieves an onset F1 of 96.72% on the MAESTRO dataset, outperforming previous onsets and frames system of 94.80%. Our system achieves a pedal onset F1 score of 91.86\%, which is the first benchmark result on the MAESTRO dataset. We have released the source code and checkpoints of our work at https://github.com/bytedance/piano_transcription.
研究の動機と目的
- フレーム単位のオンセット/オフセット検出手法に見られる時間分解能の制限(例:32 ms のフレーム間隔)を解消する。
- 訓練データにおけるオンセットおよびオフセットラベルのずれに対する耐性を高め、既存システムの性能低下を是正する。
- バイナリフレームレベルの予測ではなく、正確なオンセットおよびオフセット時刻をモデル化することで、高分解能トランスクリプションを実現する。
- MAESTROデータセットにおけるサスティンペダルトランスクリプションの包括的評価を初めて提供し、ベンチマークを確立する。
- 任意の分解能を達成可能な解析的手法を用いて、正確なオンセットおよびオフセット時刻を計算する推論アルゴリズムを開発する。
提案手法
- 各音声フレームの中心と最も近いオンセットまたはオフセット時刻との時間差を回帰するように深層ニューラルネットワークを学習する。
- バイナリラベルの代わりに回帰ターゲットを用いることで、音符およびサスティンペダルの両方の細かいタイミング情報を保持する。
- 推論時、時間差の微分可能損失関数を最小化することで、正確なオンセットおよびオフセット時刻を解析的に計算するアルゴリズムを適用する。
- 残差接続を備えたCNNベースのアーキテクチャを用い、MAESTROデータセット上で音符およびペダルトランスクリプションの両方をエンドツーエンドで学習する。
- 分解能および耐性を評価するため、変動する許容誤差(オンセット:2–100 ms、オフセット:10–500 ms)を用いた新しい評価プロトコルを導入する。
- 別個のヘッドを導入し、フレーム単位の回帰を用いてペダルのオンセットおよびオフセットイベントを検出する。
実験結果
リサーチクエスチョン
- RQ1フレーム単位の分類ではなく、オンセットおよびオフセット時刻の回帰に基づくモデル化が、フレーム単位分類よりも高いトランスクリプション分解能を達成できるか?
- RQ2固定許容誤差ベースラインと比較して、本手法は変動するオンセットおよびオフセット評価許容誤差下でも性能を発揮するか?
- RQ3訓練データにおける正解ラベルのずれに対して、モデルはどの程度耐性を示すか?
- RQ4回帰ベースのアプローチが、音符およびサスティンペダル両方のトランスクリプションで最先端の性能を達成できるか?
- RQ5回帰出力から解析的に正確なオンセットおよびオフセット時刻を計算することが可能で、任意の時間分解能を実現できるか?
主な発見
- 提案手法は、MAESTROデータセットで96.72%のオンセット F1 スコアを達成し、全許容誤差レベルで先行する「onsets and frames」システム(94.80%)を上回った。
- 100 ms の許容誤差下でも、ノート F1 スコアが96.79%に達し、高分解能評価下での優れた性能を示した。
- 50 ms の許容誤差下でペダルオンセット F1 スコアが91.86%に達し、MAESTROデータセットにおけるサスティンペダルトランスクリプションの最初のベンチマーク結果を達成した。
- 同じ評価プロトコル下で再実装した「onsets and frames」ベースラインと比較したところ、ペダルトランスクリプションで91.86% vs. 91.57% の F1 スコアを記録し、本手法が優れた性能を示した。
- 誤差分析の結果、誤検出の主な原因はオクターブの誤認識および短時間持続のノート(15 ms 未満)であり、誤検出は高音または低音のオクターブに多く見られた。
- チューニングがずれたピアノや低品質な録音では性能が低下する傾向にあり、音声品質およびチューニング精度に感受性を示すことがわかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。